Степенная функция 📈
Открой любую статью про масштабирование больших языковых моделей — GPT, LLaMA, Chinchilla — и ты увидишь один и тот же график: качество модели (loss) плавно падает с увеличением объёма данных или числа параметров, но падает всё медленнее и медленнее. Удвоение датасета уже не удваивает качество. Затем ещё удвоение — и прирост совсем скромный. Это не случайность и не какая-то мистическая особенность нейросетей. Это одна конкретная математическая форма — степенная функция $y = x^n$, только с дробным отрицательным показателем.
Степенная функция — это целое семейство функций вида $y = x^n$, где $n$ может быть любым числом: натуральным чётным, натуральным нечётным, целым отрицательным или дробным. И удивительно, что при всей внешней похожести формулы поведение графика кардинально меняется в зависимости от того, какой именно $n$ ты подставил. Парабола $y = x^2$, кубическая кривая $y = x^3$, гипербола $y = 1/x$, корень $y = \sqrt{x}$ — все это степенные функции, просто с разными показателями. Понять один раз общий принцип — и ты сможешь предсказать форму графика для любого $n$, не строя таблицу значений.
В этом уроке мы разберём степенную функцию по всем четырём типам показателя: натуральный чётный, натуральный нечётный, отрицательный целый и дробный (рациональный). Для каждого типа выясним область определения, чётность или нечётность, форму графика и — обязательно — где это работает в реальных задачах, особенно в машинном обучении и анализе данных. Ты увидишь, что регуляризация в нейросетях, законы масштабирования LLM, распределение частот слов в тексте (закон Ципфа) и даже физика Ньютона — всё это частные случаи одной и той же функции $y = x^n$.
🎯 Ты узнаешь:
- Как меняется график $y = x^n$ при чётном, нечётном, отрицательном и дробном показателе
- Почему область определения степенной функции — это не всегда $\mathbb{R}$, и как её быстро определить
- Когда функция чётная, когда нечётная, а когда — ни то ни другое
- Почему $x^{1/3}$ как степенная функция определена не так, как кубический корень $\sqrt[3]{x}$
- Как степенные законы (power laws) описывают scaling laws больших языковых моделей и закон Ципфа для частот слов
История: откуда это взялось?
Древние греки и вавилоняне прекрасно понимали, что такое $x^2$ и $x^3$ — но исключительно геометрически. Квадрат числа — это буквально площадь квадрата со стороной $x$, куб — объём куба. Дальше третьей степени геометрия замолкала: у пространства всего три измерения, и что такое "четвёртая степень" физически, никто не представлял. Показатель степени долгое время мог быть только натуральным числом — 1, 2, 3, 4 — и не больше.
Перелом случился в XVII веке. Английский математик Джон Уоллис в трактате "Arithmetica Infinitorum" (1656 год) предложил смелую идею: а что, если распространить обозначение $x^n$ на отрицательные и дробные показатели, определив их через уже известные операции — деление и извлечение корня? Так родились записи $x^{-1} = 1/x$ и $x^{1/2} = \sqrt{x}$. Это было не открытие новых объектов, а гениальное расширение уже существующей алгебры — искусственное, но при этом абсолютно логичное продолжение правил действий со степенями на новые случаи.
Исаак Ньютон подхватил идею Уоллиса и пошёл дальше: в 1665 году в письме к Генри Ольденбургу он показал, что биномиальную формулу — ту самую, что раскрывает $(a+b)^n$ — можно применять даже при дробном и отрицательном $n$, если превратить конечную сумму в бесконечный ряд. Это стало одним из кирпичиков будущего математического анализа. С тех пор степень $x^n$ перестала быть "геометрической фигурой" и превратилась в полноценную функцию, определённую для любого рационального (а позже и любого вещественного) показателя — с собственной областью определения, графиком и свойствами, которые мы сегодня и разберём.
А сегодня именно эта функция — рабочая лошадка статистики, физики и машинного обучения. Когда исследователи OpenAI в 2020 году опубликовали знаменитую работу про scaling laws нейросетей, они обнаружили, что loss модели предсказуемо подчиняется степенному закону $L(N) \propto N^{-\alpha}$ на протяжении семи порядков величины $N$ (числа параметров) — от крошечных моделей до гигантских. То же самое уравнение, которое Уоллис написал для абстрактной алгебры 370 лет назад, сегодня помогает планировать компьютерный бюджет на обучение моделей стоимостью в десятки миллионов долларов.
Натуральный чётный показатель: параболы старших порядков
Интуиция
Представь, что $y = x^n$ с чётным $n$ — это "штрафная функция", которая наказывает за отклонение от нуля. Именно такую роль эта функция играет в машинном обучении: среднеквадратичная ошибка (MSE) буквально устроена как $(y_{\text{предсказано}} - y_{\text{истинное}})^2$ — квадрат отклонения. Чем больше ошибка модели, тем сильнее штраф, причём штраф растёт быстрее, чем сама ошибка.
Давай разберёмся, что происходит с этим "штрафом" при разных $n$. При $n = 2$ отклонение в 3 единицы даёт штраф $9$. При $n = 4$ — уже $81$. Чем выше чётный показатель, тем безжалостнее функция карает большие отклонения — и тем снисходительнее относится к маленьким (отклонение меньше единицы при возведении в высокую степень становится совсем крошечным). Это как штраф за опоздание: если опоздал на минуту, штраф почти незаметен что при линейном, что при "жёстком" правиле, а вот если опоздал на час — жёсткое правило накажет несоизмеримо больнее.
Ключевая особенность чётного показателя: знак $x$ не имеет значения. И $(-3)^2 = 9$, и $3^2 = 9$ — минус "съедается" при чётном числе умножений. Поэтому график всегда симметричен относительно оси $Oy$, как отражение в зеркале.
Определение: Степенной функцией с натуральным чётным показателем называется функция вида $y = x^n$, где $n \in \{2, 4, 6, 8, \dots\}$.
Свойства:
- Область определения: $D(f) = \mathbb{R}$ (функция определена для любого $x$)
- Область значений: $E(f) = [0; +\infty)$ (результат всегда неотрицателен)
- Функция чётная: $f(-x) = (-x)^n = x^n = f(x)$, график симметричен относительно оси $Oy$
- Убывает на $(-\infty; 0]$, возрастает на $[0; +\infty)$
- Проходит через точки $(0; 0)$, $(1; 1)$, $(-1; 1)$ при любом $n$
- Чем больше $n$, тем "уже" ветви графика при $|x| > 1$ и тем "площе" (ближе к оси $Ox$) кривая при $|x| < 1$
Примеры с разбором
Пример 1 (простой): исследуй функцию $y = x^4$ в точках $x = 2$ и $x = -2$
Решение:
Шаг 1. Вычислим $f(2) = 2^4 = 16$.
Шаг 2. Вычислим $f(-2) = (-2)^4 = (-2) \cdot (-2) \cdot (-2) \cdot (-2) = 16$.
Шаг 3. Заметим: $f(2) = f(-2) = 16$ — значения совпадают, что подтверждает чётность функции.
Ответ: $f(2) = f(-2) = 16$, функция чётная.
Пример 2 (средний): реши уравнение $x^4 = 81$
Решение:
Шаг 1. Заметим, что $81 = 3^4$.
Шаг 2. Уравнение принимает вид $x^4 = 3^4$.
Шаг 3. Поскольку показатель чётный, у уравнения $x^n = a$ (при $a > 0$) два решения — положительное и отрицательное: $x = 3$ и $x = -3$.
Проверка: $3^4 = 81$ ✅, $(-3)^4 = 81$ ✅
Ответ: $x = \pm 3$
📌 Это принципиально отличается от нечётного показателя, где решение всегда только одно — мы увидим это в следующем разделе.
Пример 3 (сложный): при каких $x$ выполняется $x^4 < x^2$?
Решение:
Шаг 1. Перенесём всё в одну сторону:
$$x^4 - x^2 < 0$$Шаг 2. Вынесем общий множитель $x^2$:
$$x^2(x^2 - 1) < 0$$Шаг 3. Проанализируем знаки. Множитель $x^2$ всегда неотрицателен и равен нулю только при $x = 0$. Значит, всё произведение отрицательно только тогда, когда $x^2 > 0$ (то есть $x \neq 0$) и $x^2 - 1 < 0$, то есть $|x| < 1$.
Шаг 4. Объединим условия: $x \neq 0$ и $-1 < x < 1$.
Ответ: $x \in (-1; 0) \cup (0; 1)$
Проверка: при $x = 0{,}5$: $0{,}5^4 = 0{,}0625$, а $0{,}5^2 = 0{,}25$ — действительно, $0{,}0625 < 0{,}25$ ✅
Вывод: внутри интервала $(-1; 1)$ более высокая чётная степень всегда даёт меньшее значение, а снаружи — большее. Это тот самый эффект "штрафной функции", о котором мы говорили в интуиции.
Почему это важно
Чётные степени — фундамент того, как машинное обучение измеряет ошибку. Среднеквадратичная ошибка (MSE), дисперсия, L2-регуляризация (штраф $\sum w_i^2$ на веса модели, чтобы они не "разрастались") — всё это конструкции на основе $x^2$. А четвёртая степень используется реже, но не менее осмысленно: эксцесс (kurtosis) — статистическая мера "тяжести хвостов" распределения — вычисляется через четвёртый момент $E[(x - \mu)^4]$, и именно он помогает находить выбросы в данных перед тем, как отдать их модели на обучение. Понимание того, что чётная степень "прощает" маленькие отклонения, но резко наказывает большие, объясняет, почему L2-регуляризация не создаёт разреженных весов (в отличие от L1, которая линейна и одинаково "давит" на все отклонения) — маленькие веса эта регуляризация почти не трогает.
Натуральный нечётный показатель: кривые, которые помнят знак
Интуиция
Представь усилитель, который не меняет направление сигнала, а только его силу. Подал положительный вход — получил положительный выход, подал отрицательный — получил отрицательный. Именно так ведёт себя $y = x^n$ при нечётном $n$: знак результата всегда совпадает со знаком аргумента. $(-2)^3 = -8$ — минус остаётся, потому что при нечётном числе умножений один "лишний" минус никуда не девается.
Разберём по шагам, чем это отличается от чётного случая. У чётной степени график похож на чашу: убывает, потом возрастает, разворот в нуле. У нечётной степени разворота нет вообще — функция монотонно возрастает на всей числовой прямой, от $-\infty$ до $+\infty$, без единого "провала". В точке $x = 0$ график словно на мгновение "замирает" (касательная там горизонтальна при $n \geq 3$), но затем продолжает расти в ту же сторону — это называется точкой перегиба, а не экстремумом.
Определение: Степенной функцией с натуральным нечётным показателем называется функция вида $y = x^n$, где $n \in \{1, 3, 5, 7, \dots\}$.
Свойства:
- Область определения: $D(f) = \mathbb{R}$
- Область значений: $E(f) = \mathbb{R}$ (принимает вообще любые значения)
- Функция нечётная: $f(-x) = (-x)^n = -x^n = -f(x)$, график симметричен относительно начала координат
- Монотонно возрастает на всей области определения
- Проходит через точки $(0; 0)$, $(1; 1)$, $(-1; -1)$
Примеры с разбором
Пример 1 (простой): вычисли $f(-2)$ и $f(3)$ для $y = x^3$
Решение:
Шаг 1. $f(-2) = (-2)^3 = (-2) \cdot (-2) \cdot (-2) = -8$.
Шаг 2. $f(3) = 3^3 = 27$.
Шаг 3. Проверим нечётность: $f(-2) = -8 = -f(2) = -(2^3) = -8$ ✅
Ответ: $f(-2) = -8$, $f(3) = 27$, функция нечётная.
Пример 2 (средний): реши уравнение $x^3 = -27$
Решение:
Шаг 1. Заметим, что $-27 = (-3)^3$.
Шаг 2. Уравнение принимает вид $x^3 = (-3)^3$.
Шаг 3. Поскольку функция $y = x^3$ монотонна (строго возрастает), у уравнения $x^n = a$ при нечётном $n$ решение всегда единственно, независимо от знака $a$.
$$x = -3$$Проверка: $(-3)^3 = -27$ ✅
Ответ: $x = -3$
📌 В отличие от чётной степени, здесь ровно одно решение при любом $a$ — потому что монотонная функция каждое значение принимает ровно один раз.
Пример 3 (сложный): найди все корни уравнения $x^3 - x = 0$
Решение:
Шаг 1. Вынесем общий множитель $x$:
$$x(x^2 - 1) = 0$$Шаг 2. Разложим разность квадратов:
$$x(x - 1)(x + 1) = 0$$Шаг 3. Произведение равно нулю, если хотя бы один из множителей равен нулю:
$$x = 0, \quad x = 1, \quad x = -1$$Ответ: $x \in \{-1; 0; 1\}$
Проверка: $(-1)^3 - (-1) = -1 + 1 = 0$ ✅, $0^3 - 0 = 0$ ✅, $1^3 - 1 = 0$ ✅
Наблюдение: корни расположены симметрично относительно нуля — ожидаемо, ведь $f(x) = x^3 - x$ тоже нечётная функция (разность двух нечётных функций).
Почему это важно
Нечётные степени сохраняют направление — и это критично там, где важен не только размер ошибки, но и её знак. В продвинутых методах оптимизации (например, кубической регуляризации Нестерова для второго порядка обучения нелинейных моделей) добавляется штраф вида $\|x\|^3$, который, в отличие от квадратичного, более "терпим" к малым шагам, но резко ограничивает крупные — при этом не искажая направление движения. Третий момент распределения (skewness, асимметрия) вычисляется через $(x - \mu)^3$ — именно нечётность степени позволяет отличить "перекос вправо" от "перекоса влево" в данных, что важно при feature engineering: если признак сильно асимметричен, модель может работать хуже, и это первым делом видно по знаку третьего момента. А в компьютерной графике и генерации анимации (в том числе видео, синтезированного нейросетями) кубические функции сглаживания (easing functions) $y = x^3$ используются, чтобы движение начиналось и заканчивалось плавно, без рывков.
Отрицательный целый показатель: гиперболы и обратные зависимости
Интуиция
Представь, что ты делишь пиццу между $x$ людьми. Чем больше людей, тем меньше кусок каждому — это обратная зависимость, и она в точности описывается функцией $y = 1/x = x^{-1}$. Если людей мало, кусок огромный (график взлетает вверх при $x \to 0$); если людей много, кусок стремится к нулю, но никогда не станет ровно нулём (график приближается к оси $Ox$, но никогда её не касается).
Давай разберёмся, откуда вообще берётся отрицательный показатель. По определению степени с отрицательным показателем:
$$x^{-n} = \frac{1}{x^n}, \quad x \neq 0$$Это прямое продолжение правила степеней $x^a \cdot x^b = x^{a+b}$: если мы хотим, чтобы $x^n \cdot x^{-n} = x^0 = 1$ выполнялось всегда, то $x^{-n}$ обязано равняться $1/x^n$ — по-другому просто не сходится арифметика.
Важный нюанс: в отличие от положительных степеней, чётность/нечётность отрицательного показателя работает так же, как и для положительных — определяется чётностью числа $n$ в $x^{-n}$, — но при этом функция никогда не определена в нуле, потому что там образуется деление на ноль.
Определение: Степенной функцией с отрицательным целым показателем называется функция вида $y = x^{-n} = \dfrac{1}{x^n}$, где $n$ — натуральное число.
Свойства:
- Область определения: $D(f) = (-\infty; 0) \cup (0; +\infty)$ — ноль всегда исключён
- При $n$ нечётном (например, $y = 1/x$, $y = 1/x^3$): функция нечётная, ветви графика расположены в I и III четвертях (для положительного $x$ значение положительно, для отрицательного — отрицательно), убывает на каждом из промежутков $(-\infty; 0)$ и $(0; +\infty)$ по отдельности
- При $n$ чётном (например, $y = 1/x^2$, $y = 1/x^4$): функция чётная, обе ветви расположены выше оси $Ox$ (значение всегда положительно), убывает на $(0; +\infty)$ и возрастает на $(-\infty; 0)$
- В обоих случаях график имеет две асимптоты: вертикальную $x = 0$ и горизонтальную $y = 0$ — кривая приближается к ним, но никогда не пересекает
Примеры с разбором
Пример 1 (простой): вычисли $f(4)$ и $f(-2)$ для $y = \dfrac{1}{x}$
Решение:
Шаг 1. $f(4) = \dfrac{1}{4} = 0{,}25$.
Шаг 2. $f(-2) = \dfrac{1}{-2} = -0{,}5$.
Шаг 3. Проверим нечётность: $f(-2) = -0{,}5$, а $-f(2) = -\dfrac{1}{2} = -0{,}5$ — совпадает ✅
Ответ: $f(4) = 0{,}25$, $f(-2) = -0{,}5$, функция нечётная.
Пример 2 (средний): реши уравнение $\dfrac{1}{x^2} = 4$
Решение:
Шаг 1. Умножим обе части на $x^2$ (заметим, что $x \neq 0$ по области определения):
$$1 = 4x^2$$Шаг 2. Выразим $x^2$:
$$x^2 = \frac{1}{4}$$Шаг 3. Извлечём корень — не забываем оба знака:
$$x = \pm \frac{1}{2}$$Проверка: $\left(\dfrac{1}{2}\right)^{-2} = \left(2\right)^2 = 4$ ✅, аналогично для $-\dfrac{1}{2}$, так как показатель чётный ✅
Ответ: $x = \pm 0{,}5$
Пример 3 (сложный): при каком $t$ значение $\eta(t) = \dfrac{\eta_0}{t}$ упадёт до 1% от начального $\eta_0$?
Это классическая формула затухания скорости обучения (learning rate decay) в методах вроде SGD — один из простейших и старейших способов регулировать шаг обучения по мере тренировки модели.
Решение:
Шаг 1. Условие "1% от начального значения" означает $\eta(t) = 0{,}01 \cdot \eta_0$.
Шаг 2. Подставим в формулу:
$$\frac{\eta_0}{t} = 0{,}01 \cdot \eta_0$$Шаг 3. Сократим $\eta_0$ (оно не равно нулю по смыслу задачи):
$$\frac{1}{t} = 0{,}01$$Шаг 4. Выразим $t$:
$$t = \frac{1}{0{,}01} = 100$$Ответ: через $t = 100$ шагов обучения скорость обучения снизится до 1% от начальной.
Вывод: зависимость $1/t$ падает медленно в начале и очень быстро тормозит "финальное" затухание — именно поэтому в реальных пайплайнах используют более сложные степенные схемы (например, $1/\sqrt{t}$), чтобы обучение не "останавливалось" слишком рано.
Почему это важно
Обратно пропорциональные зависимости с отрицательным целым показателем встречаются повсеместно — от школьной физики до продакшн-систем ML. Закон всемирного тяготения и закон Кулона — оба $\propto 1/r^2$ (обратный квадрат расстояния), классический пример чётного отрицательного показателя. Расписания скорости обучения $1/t$ в оптимизации — критически важная деталь настройки нейросетей: слишком быстрое затухание "замораживает" обучение, слишком медленное — не даёт модели сойтись. И на уровне архитектуры: механизм внимания (attention) в трансформерах масштабирует произведение запросов и ключей на $1/\sqrt{d_k}$ — тоже отрицательная степень (правда, дробная — к ней мы перейдём в следующем разделе), которая нужна, чтобы значения не "взрывались" при росте размерности модели. Понимание того, что отрицательная степень означает "чем больше знаменатель — тем меньше эффект", помогает быстро прикинуть, как параметр архитектуры повлияет на численную стабильность обучения.
Дробный (рациональный) показатель: корни и степенные законы
Интуиция
Если целая степень — это "умножь $x$ само на себя $n$ раз", а отрицательная — "раздели единицу на это", то что тогда значит $x^{1/2}$? Умножить $x$ саму на себя пол раза нельзя буквально — но идея Уоллиса была в том, чтобы сохранить главное правило степеней: $x^a \cdot x^b = x^{a+b}$. Если это правило должно работать и для дробей, то $x^{1/2} \cdot x^{1/2}$ обязано равняться $x^{1/2 + 1/2} = x^1 = x$. А число, которое, умноженное само на себя, даёт $x$, — это по определению квадратный корень $\sqrt{x}$. Отсюда: $x^{1/2} = \sqrt{x}$.
Разберём по шагам общее правило. Для дроби $\dfrac{m}{n}$ (несократимой, $n \geq 2$) степень определяется через корень:
$$x^{m/n} = \sqrt[n]{x^m} = \left(\sqrt[n]{x}\right)^m$$Здесь и кроется главная тонкость: у корня чётной степени ($\sqrt{}$, $\sqrt[4]{}$, ...) нет смысла для отрицательного подкоренного выражения. Поэтому по общепринятому в школьном курсе соглашению, степенная функция с нецелым рациональным показателем $r = m/n$ определяется:
- при $r > 0$: для $x \geq 0$, то есть $D(f) = [0; +\infty)$
- при $r < 0$: для $x > 0$, то есть $D(f) = (0; +\infty)$ (в нуле функция стремится к бесконечности, значение не определено)
Определение: Степенной функцией с рациональным нецелым показателем называется функция вида $y = x^{m/n}$, где $\dfrac{m}{n}$ — несократимая дробь, $n \geq 2$. Область определения: $x \geq 0$ при $r > 0$, $x > 0$ при $r < 0$.
Почему именно так, а не "для всех $x$, где формально можно извлечь корень"? Разберём на конкретном примере, который часто ставит в тупик. Дробь $\dfrac{1}{3}$ равна дроби $\dfrac{2}{6}$ — казалось бы, $x^{1/3}$ и $x^{2/6}$ должны быть одной и той же функцией. Но если попытаться вычислить это при $x = -8$ через нечётный корень: $\sqrt[3]{-8} = -2$ — вроде бы нормально, кубический корень из отрицательного числа существует. А теперь через вторую запись: $x^{2/6} = \sqrt[6]{x^2} = \sqrt[6]{(-8)^2} = \sqrt[6]{64} = 2$. Получили разные ответы для одной и той же дроби: $-2$ и $2$! Это противоречие — и именно поэтому в школьной алгебре договорились: если показатель нецелый рациональный, область определения ограничивают $x \geq 0$ (или $x > 0$), чтобы такой парадокс никогда не возникал. А вот запись именно с символом корня, $\sqrt[3]{x}$, — это отдельная, самостоятельная операция, которая для нечётного индекса корня определена и для отрицательных $x$, без всяких противоречий, потому что там нет вопроса о "сокращении дроби в показателе".
Свойства:
- Область определения зависит от знака $r$ (см. выше)
- Функция ни чётная, ни нечётная в общем случае — область определения $[0; +\infty)$ не симметрична относительно нуля, поэтому условие $f(-x) = \pm f(x)$ даже не имеет смысла проверять
- При $r > 1$: график похож на параболу, но "положе" в нуле, "круче" при больших $x$
- При $0 < r < 1$: график быстро растёт у нуля, а затем рост замедляется (классическая форма $\sqrt{x}$)
- При $r < 0$: убывающая гипербола, определённая только для $x > 0$
Примеры с разбором
Пример 1 (простой): вычисли $f(9)$ для $y = x^{1/2}$
Решение:
Шаг 1. По определению $x^{1/2} = \sqrt{x}$.
Шаг 2. $f(9) = \sqrt{9} = 3$.
Проверка: $3^2 = 9$ ✅
Ответ: $f(9) = 3$
Пример 2 (средний): вычисли $f(8)$ для $y = x^{2/3}$
Решение:
Шаг 1. Распишем через корень и степень: $x^{2/3} = \left(\sqrt[3]{x}\right)^2$.
Шаг 2. Найдём кубический корень из 8: $\sqrt[3]{8} = 2$.
Шаг 3. Возведём результат в квадрат: $2^2 = 4$.
Ответ: $f(8) = 4$
📌 Обрати внимание на порядок действий: сначала корень, потом степень — так числа получаются меньше, и считать в уме гораздо проще, чем сначала возводить 8 в квадрат (64), а потом извлекать из 64 кубический корень.
Пример 3 (сложный): упрощённый scaling law $L(N) = 1000 \cdot N^{-1/2}$. Во сколько раз уменьшится loss при увеличении $N$ с 100 до 10 000?
Здесь $L$ — значение функции потерь, $N$ — размер обучающего датасета (в условных единицах). Показатель $-1/2$ — упрощённая версия реальных scaling laws, где показатели обычно лежат в диапазоне примерно от $-0{,}3$ до $-0{,}5$.
Решение:
Шаг 1. Вычислим $L(100) = 1000 \cdot 100^{-1/2} = \dfrac{1000}{\sqrt{100}} = \dfrac{1000}{10} = 100$.
Шаг 2. Вычислим $L(10\,000) = 1000 \cdot 10\,000^{-1/2} = \dfrac{1000}{\sqrt{10\,000}} = \dfrac{1000}{100} = 10$.
Шаг 3. Найдём отношение: $\dfrac{L(100)}{L(10\,000)} = \dfrac{100}{10} = 10$.
Ответ: loss уменьшился ровно в 10 раз, при этом датасет увеличился в 100 раз.
Вывод: это и есть суть "медленного" степенного закона — при показателе $-1/2$ стократное увеличение данных даёт лишь десятикратное улучшение качества. Именно поэтому в реальных проектах ML "просто накинуть больше данных" быстро упирается в закон убывающей отдачи, и требуется точный расчёт: стоит ли вложение в дополнительные данные того прироста качества, который оно даст.
Почему это важно
Дробный показатель — это язык, на котором в 2020–2022 годах были написаны знаковые статьи по scaling laws больших языковых моделей (Kaplan et al., затем Hoffmann et al. — "Chinchilla"). Они показали, что $\text{Loss}(N) \approx A \cdot N^{-\alpha}$ — гладкая степенная зависимость от числа параметров $N$ с дробным показателем $\alpha$, стабильная на семи порядках величины. Именно эта формула позволяет заранее — ещё до дорогостоящей тренировки — предсказать, каким будет качество модели с определённым бюджетом вычислений, и выбрать оптимальное соотношение "данные / параметры / компьютерное время". В data science дробные степени используются и в feature engineering: преобразование Бокса-Кокса (Box-Cox transform) применяет $x^\lambda$ к скошенным признакам (доходы, цены, время ожидания), чтобы сделать их распределение ближе к нормальному — это заметно улучшает работу линейных моделей. А сама операция нормализации (RMS-norm, L2-норма вектора) в своей основе содержит $x^{1/2}$ — извлечение корня из суммы квадратов.
Практика: 30 заданий
Базовые (задания 1-10)
Задание 1: Найди область определения функции $y = x^6$.
Задание 2: Определи чётность функции $y = x^5$.
Задание 3: Вычисли значение функции $y = x^{-3}$ при $x = 2$.
Задание 4: Найди область определения функции $y = x^{-4}$.
Задание 5: Вычисли $16^{1/2}$.
Задание 6: Вычисли $27^{1/3}$.
Задание 7: Реши уравнение $x^4 = 81$.
Задание 8: Реши уравнение $x^3 = -64$.
Задание 9: Сравни без калькулятора: $0{,}5^2$ и $0{,}5^4$.
Задание 10: Кинетическая энергия тела $E = \dfrac{mv^2}{2}$. Во сколько раз увеличится $E$, если скорость $v$ увеличить в 3 раза (масса не меняется)?
Средние (задания 11-20)
Задание 11: Найди область определения и определи, является ли чётной/нечётной функция $y = x^{2/3}$.
Задание 12: Вычисли $8^{-1/3}$.
Задание 13: Реши уравнение $x^{1/2} = 5$.
Задание 14: Реши уравнение $x^{-2} = 0{,}25$.
Задание 15: Найди все $x$, при которых $x^5 = x^3$.
Задание 16: Сравни без калькулятора: $2^{1/2}$ и $2^{1/3}$.
Задание 17: При каких натуральных $n$ функция $y = x^n$ является нечётной и возрастает на всей числовой прямой?
Задание 18: Упрощённый scaling law: $L(N) = 500 \cdot N^{-1/2}$, где $N$ — размер обучающей выборки. Найди $L(2500)$.
Задание 19: Найди область определения функции $y = x^{-1/2}$.
Задание 20: Реши уравнение $x^{2/3} = 4$.
Продвинутые (задания 21-30)
Задание 21: Реши уравнение $x^{3/2} = 27$.
Задание 22: Сравни без калькулятора: $1{,}5^3$ и $1{,}5^{-3}$.
Задание 23: Реши неравенство $x^4 > 16$.
Задание 24: Частота слова в тексте приближённо подчиняется закону Ципфа $f(r) = \dfrac{C}{r}$, где $r$ — ранг слова по частоте. Самое частое слово ($r = 1$) встретилось 10 000 раз. Сколько раз примерно встретится слово с рангом $r = 100$?
Задание 25: Реши уравнение $x^{-3} = -\dfrac{1}{8}$.
Задание 26: Реши неравенство $x^5 > x^3$.
Задание 27: Упрощённый scaling law: $\text{Loss}(N) = 1000 \cdot N^{-0{,}5}$, где $N$ — число параметров модели (в млн). Во сколько раз нужно увеличить $N$, чтобы уменьшить loss ровно в 2 раза?
Задание 28: Найди область определения функции $y = x^{-2/3}$ и вычисли $f(27)$.
Задание 29: Реши уравнение $x^4 = x^2 + 6$.
Задание 30: Отладка кода. Найди ошибку и исправь её.
import numpy as np
x = -8.0
result = np.power(x, 1/3)
print(result) # ожидали -2.0, получили: nan (и предупреждение RuntimeWarning)
Частые ошибки
❌ Ошибка 1: путают отрицательный показатель со знаком минус перед числом
Неправильно: думать, что $x^{-2}$ означает "минус $x^2$", то есть $(-4)^{-2} = -16$.
Правильно: $x^{-2} = \dfrac{1}{x^2}$. Например, $4^{-2} = \dfrac{1}{16}$, а $(-4)^{-2} = \dfrac{1}{(-4)^2} = \dfrac{1}{16}$ — тоже положительное число, потому что показатель чётный.
💡 Почему важно: это одна из самых частых ошибок на экзаменах. Отрицательный показатель — это указание на обратную величину (перевёрнутую дробь), а не на смену знака результата.
❌ Ошибка 2: считают, что $x^{1/2}$ определена для всех $x$
Неправильно: пытаться вычислить $(-4)^{1/2}$ и получить какой-то вещественный ответ.
Правильно: $x^{1/2} = \sqrt{x}$ определена только при $x \geq 0$. Для $(-4)^{1/2}$ вещественного значения не существует.
💡 Почему важно: в коде это приводит к nan или ошибке (см. задание 30). Перед подстановкой данных в формулу с дробным показателем всегда проверяй знак аргумента.
❌ Ошибка 3: путают степенную функцию $x^{1/3}$ и операцию "кубический корень" $\sqrt[3]{x}$
Неправильно: считать, что $(-8)^{1/3}$ по школьному определению степенной функции равно $-2$, как и $\sqrt[3]{-8}$.
Правильно: символ корня $\sqrt[3]{x}$ определён для всех вещественных $x$ (в том числе отрицательных) как отдельная операция. А запись $x^{1/3}$ как степенная функция с рациональным показателем по общепринятому соглашению определена только для $x \geq 0$ — иначе возникает противоречие при равносильных дробях $\frac{1}{3} = \frac{2}{6}$ (см. подробный разбор в теоретической части).
💡 Почему важно: это не просто формальность — от выбора трактовки зависит область определения всей функции, а значит и корректность решения уравнений и неравенств.
❌ Ошибка 4: считают $y = x^{-2}$ нечётной функцией
Неправильно: думать, что раз показатель отрицательный, функция обязательно нечётная, как $y = 1/x$.
Правильно: чётность отрицательной целой степени определяется чётностью числа $n$ в записи $x^{-n}$, точно так же, как и для положительных степеней. $y = x^{-2} = 1/x^2$ — чётная функция: $(-3)^{-2} = \dfrac{1}{9} = 3^{-2}$.
💡 Почему важно: от чётности зависит форма графика — обе ветви выше оси $Ox$ (чётный случай) или ветви в противоположных четвертях (нечётный случай). Перепутав, легко неверно построить график или сделать неверный вывод о знаке функции.
❌ Ошибка 5: считают, что более высокая степень всегда даёт бо́льшее значение
Неправильно: утверждать, что $x^4 > x^2$ при любом $x \neq 0$ (по аналогии с "больше степень — больше число").
Правильно: это верно только при $|x| > 1$. При $0 < |x| < 1$ соотношение переворачивается: $x^4 < x^2$ (мы разобрали это в примере 3 первого раздела и в задании 26 для нечётных степеней).
💡 Почему важно: это прямо влияет на интуицию о регуляризации в ML — для нормализованных признаков (которые часто лежат в $(-1, 1)$) более высокая степень штрафа действует слабее, а не сильнее, что противоречит наивному ожиданию.
Главное запомнить
✅ Степенная функция $y = x^n$ — это семейство функций, форма графика которых кардинально зависит от типа показателя $n$: натуральный чётный, натуральный нечётный, отрицательный целый или дробный рациональный.
✅ Натуральный чётный показатель ($n = 2, 4, 6, \dots$): $D(f) = \mathbb{R}$, $E(f) = [0; +\infty)$, функция чётная, график — "чаша", симметричная относительно оси $Oy$.
✅ Натуральный нечётный показатель ($n = 1, 3, 5, \dots$): $D(f) = \mathbb{R}$, $E(f) = \mathbb{R}$, функция нечётная, монотонно возрастает на всей прямой без разворотов.
✅ Отрицательный целый показатель: $D(f) = (-\infty; 0) \cup (0; +\infty)$ — ноль всегда исключён; чётность зависит от чётности $n$ так же, как у положительных степеней; график — гипербола с асимптотами $x = 0$ и $y = 0$.
✅ Дробный (рациональный) показатель $r = m/n$: при $r > 0$ область определения $x \geq 0$, при $r < 0$ область определения $x > 0$ — по общепринятому школьному соглашению, чтобы избежать противоречий при сокращении дроби.
✅ Уравнение $x^n = a$ (при $a > 0$) имеет два решения при чётном $n$ и одно решение при нечётном $n$.
✅ Внутри интервала $(-1; 1)$ более высокая степень даёт меньшее по модулю значение; вне этого интервала — большее.
✅ Символ корня $\sqrt[n]{x}$ (нечётный индекс) и запись $x^{1/n}$ как степенная функция — формально разные операции с разными областями определения при $x < 0$.
✅ Степенные законы (power laws) с дробными отрицательными показателями лежат в основе scaling laws больших языковых моделей и закона Ципфа для частот слов.
✅ Отрицательная степень означает "перевернуть в дробь" ($x^{-n} = 1/x^n$), а не "сменить знак результата".
Связь с другими темами курса
Что было раньше: квадратичная функция $y = ax^2 + bx + c$ (урок 80) — это частный случай, "смещённый и растянутый" вариант простейшей степенной функции $y = x^2$. Свойства степеней и корней из курса алгебры основной школы — фундамент для всех вычислений в этом уроке.
Что дальше: следующий урок — обратная функция — логично продолжает тему: функция $y = \sqrt{x}$ является обратной к $y = x^2$ на промежутке $x \geq 0$, а $y = x^3$ обратима на всей числовой прямой. Дальше в курсе степенные функции встретятся в правилах дифференцирования — производная $y = x^n$ равна $y' = n x^{n-1}$ работает для любого показателя $n$, включая дробный и отрицательный, что делает этот урок прямой подготовкой к анализу.
Где это применяется в жизни и в ML/данных:
📊 В машинном обучении: MSE-loss и L2-регуляризация ($n=2$), эксцесс и асимметрия распределений ($n=4$ и $n=3$), scaling laws больших языковых моделей и Chinchilla-законы ($n$ дробное отрицательное), масштабирование attention в трансформерах ($1/\sqrt{d_k}$).
📈 В data science: преобразование Бокса-Кокса для нормализации скошенных признаков, закон Ципфа для частот слов в NLP-корпусах, распределение Парето для доходов и городов.
🔬 В физике: законы обратных квадратов (гравитация, электростатика), кинетическая энергия $\propto v^2$, закон Кеплера $T^2 \propto a^3$.
💰 В экономике: эффект масштаба производства, кривые спроса и предложения часто моделируются степенными зависимостями.
Интересные факты
💡 Ньютон и бесконечный ряд. В 1665 году, работая над обобщением бинома Ньютона, Исаак Ньютон показал в письме Генри Ольденбургу, что формула $(1+x)^n$ работает даже для дробных и отрицательных $n$, если превратить конечную сумму в бесконечный ряд. Это стало одним из первых шагов к созданию математического анализа — раздела математики, без которого сегодня невозможно было бы обучать нейросети методом градиентного спуска.
💡 Закон Кеплера — это степенной закон. Третий закон Кеплера гласит: квадрат периода обращения планеты пропорционален кубу большой полуоси орбиты, $T^2 \propto a^3$. Формулу можно переписать как $T \propto a^{3/2}$ — чистая степенная функция с дробным показателем, выведенная эмпирически из наблюдений задолго до того, как Ньютон объяснил её теоретически через закон всемирного тяготения.
💡 Scaling laws предсказывают качество модели до её обучения. В 2020 году исследователи OpenAI (Kaplan et al.) показали, что loss языковых моделей следует степенному закону от размера модели, данных и вычислений на протяжении семи (!) порядков величины. Это позволяет с высокой точностью предсказать, насколько улучшится качество GPT-подобной модели при увеличении бюджета — ещё до того, как потратить миллионы долларов на реальное обучение.
💡 Закон Бенфорда — тоже следствие степенной природы данных. В реальных числовых наборах (население городов, суммы в финансовых отчётах) первая цифра чаще всего единица, а не девятка — это прямое следствие того, что такие величины распределены по степенному (логарифмически-степенному) закону. Аудиторы используют этот факт, чтобы находить сфальсифицированную отчётность.
Лайфхаки и полезные трюки
1. Быстрое определение области определения по виду показателя
Спроси себя: показатель — целое или дробное? Если целое положительное — $\mathbb{R}$. Если целое отрицательное — $\mathbb{R}$ без нуля. Если дробное — смотри на знак: положительное $\Rightarrow$ $x \geq 0$, отрицательное $\Rightarrow$ $x > 0$. Эти четыре правила закрывают все случаи без исключений.
2. Мнемоника "внутри слабее, снаружи сильнее"
Внутри интервала $(-1; 1)$ более высокая степень слабее (значение ближе к нулю), снаружи этого интервала — сильнее (значение растёт быстрее). Точки $x = -1$, $0$, $1$ — всегда "точки перелома", где все степенные функции сходятся в одной точке (или в нуле).
3. Считай дробные степени в порядке "сначала корень, потом степень"
Для $x^{m/n}$ выгоднее сначала извлечь корень $n$-й степени, а потом возвести в степень $m$ — числа получаются заметно меньше и считать легче в уме. Пример: $8^{2/3}$ — сначала $\sqrt[3]{8} = 2$, потом $2^2 = 4$, а не наоборот ($8^2 = 64$, потом $\sqrt[3]{64}$).
4. Для отрицательного показателя — сначала переверни дробь
При вычислении $x^{-n}$ сразу переписывай как $\dfrac{1}{x^n}$ прежде, чем что-либо возводить в степень — так гораздо проще избежать ошибки со знаком, особенно если $x$ само отрицательное.
5. В коде используй np.cbrt и явную обработку знака, а не общий ** или np.power
Если работаешь с данными, где могут встретиться отрицательные значения и дробный показатель (например, при степенных преобразованиях признаков), не используй x ** (1/3) или np.power(x, 1/3) вслепую — для отрицательных $x$ это даст nan или неожиданный комплексный результат. Используй np.cbrt(x) для кубического корня или np.sign(x) * np.abs(x) ** r как универсальный безопасный приём.
Степенная функция — это не просто раздел школьной программы, который нужно сдать и забыть. Это инструмент, которым ты будешь пользоваться каждый раз, когда открываешь статью про очередную LLM и видишь график зависимости качества от размера модели, когда настраиваешь регуляризацию в своей первой нейросети или когда пытаешься понять, почему признак с "длинным хвостом" портит работу линейной модели. Освоив, как один показатель $n$ меняет всё поведение функции — от параболы до гиперболы и корня, — ты получаешь универсальный ключ к чтению огромного пласта математики вокруг данных и моделей. Дальше — обратные функции, и оттуда прямая дорога к производным, где эта же самая функция $x^n$ раскроется ещё одной неожиданной гранью.
Понял тему? Закрепи в боте! 🚀
Попрактикуйся на задачах и получи персональные рекомендации от AI
💪 Начать тренировку