Показательная функция 📈
Открой любую нейросеть в PyTorch и найди строчку с softmax или sigmoid. Под капотом там всегда одно и то же — число $e$, возведённое в степень. Не сложение, не умножение — именно возведение в степень, где показатель степени меняется, а основание фиксировано. Это и есть показательная функция: $f(x) = a^x$.
До сих пор ты работал со степенями как с операцией: подставил конкретные числа $a$ и $n$, получил результат. Теперь мы делаем следующий шаг — объявляем показатель степени переменной. Основание $a$ фиксируется раз и навсегда (например, $a = 2$), а $x$ пробегает все действительные числа. Получается функция — полноценный математический объект со своим графиком, областью определения, областью значений и характером поведения.
Разница между "степенью" и "показательной функцией" примерно такая же, как между конкретным выстрелом и траекторией снаряда: раньше ты вычислял $2^{10}$ один раз, теперь ты изучаешь, как ведёт себя $2^x$ для всех $x$ сразу — при отрицательных, дробных, иррациональных значениях. И именно это поведение — то, что функция либо неудержимо растёт, либо стремительно затухает, но никогда не касается нуля — оказывается фундаментом доброй половины формул машинного обучения.
Ты узнаешь:
🎯 Что значит подставить в степень любое действительное число, а не только натуральное
🎯 Почему $a^x$ никогда не бывает отрицательным и не бывает равным нулю
🎯 Как основание $a$ определяет, растёт функция или убывает — без единой производной
🎯 Почему softmax и сигмоида в нейросетях устроены именно на базе показательной функции
История: откуда это взялось?
Степени с натуральными показателями были известны ещё в древнем Вавилоне и Египте — как удобная запись повторного умножения. Но идея о том, что показатель степени сам может быть переменной величиной, оформилась гораздо позже, только в XVII–XVIII веках, когда математики вплотную занялись задачами непрерывного роста.
Толчком послужили банковские расчёты. В 1683 году швейцарский математик Якоб Бернулли задался вопросом: если вклад растёт на фиксированный процент, но начисления происходят не раз в год, а чаще — раз в месяц, раз в день, — как это записать одной формулой? Ответ потребовал взглянуть на выражение $(1+r)^t$, где $t$ — не количество лет, а непрерывно меняющийся аргумент. Так родилась идея функции $a^x$, где $x$ — не счётчик повторений, а полноценная переменная.
Окончательно теорию показательной функции построил Леонард Эйлер в XVIII веке. Именно он показал, что $a^x$ можно определить не только для целых и дробных $x$, но и для любых действительных чисел — включая иррациональные вроде $\sqrt{2}$ или $\pi$ — через последовательность всё более точных рациональных приближений. Эйлер же ввёл в обиход особое число $e \approx 2{,}71828\ldots$, о котором у нас будет отдельный урок, — но уже сейчас важно понимать, что вся современная теория показательной функции стоит на его плечах.
Показательная функция описывает процессы, где прирост пропорционален уже накопленному количеству: рост бактериальных колоний, распространение эпидемий, радиоактивный распад, сложные проценты. Сегодня к этому списку добавился ещё один: активационные функции и вероятностные распределения в нейросетях — но именно эту связь мы подробно разберём в четвёртом блоке урока.
Блок 1: От степеней к функции — что такое $a^x$ при любом $x$
Давай разберёмся, в чём именно скачок
Раньше степень с натуральным показателем — это была просто инструкция: "умножь $a$ само на себя $n$ раз". Потом появились степени с нулевым, отрицательным и дробным показателем — расширение той же идеи через свойства степеней (например, $a^{1/n} = \sqrt[n]{a}$). Всё это ты уже проходил.
Показательная функция делает последний, решающий шаг: она объявляет показатель степени переменной $x$, которая может принимать любое действительное значение — не только целое или рациональное, но и иррациональное вроде $\sqrt{2}$, $\pi$, $e$.
Представь, что у тебя есть "машина роста" с фиксированным множителем $a$. Ты вставляешь в неё число $x$ — координату на числовой прямой — и получаешь на выходе $a^x$. Основание $a$ задаёт "характер" машины раз и навсегда, а $x$ — это то, что ты выбираешь каждый раз заново.
Определение
Определение: Показательная функция — это функция вида
$$f(x) = a^x$$где $a$ — фиксированное число, называемое основанием степени, такое что $a > 0$ и $a \neq 1$, а $x$ — любое действительное число ($x \in \mathbb{R}$).
Почему именно такие ограничения на $a$, разберём подробно в следующем блоке — но коротко: без них функция либо перестаёт быть определена при всех $x$, либо теряет характерное "растущее-убывающее" поведение.
Пример 1 (простой): вычисляем значение в целой точке
Вопрос: Найди $f(-2)$ для функции $f(x) = 5^x$.
Решение:
Здесь показатель отрицательный, вспоминаем правило $a^{-n} = \dfrac{1}{a^n}$:
$$f(-2) = 5^{-2} = \frac{1}{5^2} = \frac{1}{25} = 0{,}04$$Ответ: $f(-2) = \dfrac{1}{25}$
Обрати внимание: результат маленький, но строго положительный. Мы ещё вернёмся к этому.
Пример 2 (средний): дробное основание в отрицательной степени
Вопрос: Вычисли $\left(\dfrac{2}{3}\right)^{-3}$.
Решение:
Отрицательная степень "переворачивает" дробь:
$$\left(\frac{2}{3}\right)^{-3} = \left(\frac{3}{2}\right)^{3} = \frac{27}{8} = 3{,}375$$Ответ: $3{,}375$
Связь: Это тот же приём, который используется, когда основание показательной функции задано как $\left(\dfrac{2}{3}\right)^x$, а тебе нужно сравнить значения при положительных и отрицательных $x$ — переход к обратной дроби сильно упрощает вычисления.
Пример 3 (сложный): что вообще значит $2^{\sqrt{2}}$
Вопрос: Как понять, чему равно $2^{\sqrt{2}}$, если показатель — иррациональное число, которое нельзя записать в виде дроби?
Решение:
Именно здесь и находится главный концептуальный переход показательной функции. Число $\sqrt{2} \approx 1{,}41421356\ldots$ можно сколь угодно точно приблизить рациональными (дробными) числами:
$$1{,}4 < 1{,}41 < 1{,}414 < 1{,}4142 < \ldots < \sqrt{2}$$Для каждого из этих рациональных приближений $2^x$ уже определено через корни: $2^{1{,}4} = 2^{7/5} = \sqrt[5]{2^7}$, и так далее. Подставляя всё более точные приближения, получаем всё более точные значения:
$$2^{1{,}4} \approx 2{,}639, \quad 2^{1{,}41} \approx 2{,}657, \quad 2^{1{,}414} \approx 2{,}665, \quad \ldots$$Эти значения "сходятся" к одному конкретному числу — именно его и называют $2^{\sqrt{2}} \approx 2{,}665$.
Ответ: $2^{\sqrt{2}} \approx 2{,}665$ (значение существует и единственно, хотя точной дробью его не записать)
Почему это важно: Именно эта идея — что степень можно "долить" до любого действительного показателя через приближения — и позволяет говорить, что область определения показательной функции — вся числовая прямая, без единого разрыва. Без этого шага показательная функция была бы определена только на дробных числах, и у неё вообще не было бы непрерывного графика. В машинном обучении веса, логиты и learning rate — это как раз произвольные действительные числа, а не аккуратные дроби, и функция $e^x$ обязана быть определена в каждой точке без исключений.
Блок 2: Область определения и область значений
Представь, что ты собираешь конструктор с двумя строгими правилами
У показательной функции есть два разных "мира": мир того, что можно подставлять ($x$), и мир того, что можно получить на выходе ($y$). Они устроены совершенно по-разному.
-
Область определения — это всё, что разрешено подставлять вместо $x$. Как мы выяснили в блоке 1, сюда входит буквально любое действительное число: целое, дробное, отрицательное, иррациональное.
-
Область значений — это всё, что может получиться на выходе. И тут начинается интересное: сколько бы ты ни подставлял, результат никогда не будет нулём и никогда не будет отрицательным.
Определение
Область определения и область значений показательной функции $f(x) = a^x$:
$$x \in (-\infty; +\infty), \qquad y \in (0; +\infty)$$То есть подставлять можно любое $x$, а получать на выходе — только строго положительные числа.
Пример 1 (простой): почему результат никогда не ноль
Вопрос: Может ли $2^x$ равняться нулю при каком-нибудь $x$?
Решение:
Проверим на экстремально маленьких значениях. При $x = -10$:
$$2^{-10} = \frac{1}{2^{10}} = \frac{1}{1024} \approx 0{,}000977$$Число крошечное, но не ноль. Сколько бы мы ни увеличивали отрицательный показатель, результат $\dfrac{1}{2^n}$ будет становиться всё меньше и меньше, но делить единицу на конечное число и получить точный ноль — невозможно.
Ответ: Нет, $2^x \neq 0$ ни при каком конечном $x$. График лишь бесконечно приближается к оси $Ox$, но никогда её не касается — прямая $y = 0$ является горизонтальной асимптотой.
Пример 2 (средний): почему сигмоида никогда не выдаёт ровно 0 или 1
Вопрос: Функция сигмоиды в нейросетях задаётся как $\sigma(x) = \dfrac{1}{1 + e^{-x}}$. Почему $\sigma(x)$ никогда не равна ровно 0 или ровно 1, каким бы большим или маленьким ни было $x$?
Решение:
Знаменатель $1 + e^{-x}$ состоит из единицы и слагаемого $e^{-x}$, которое, как мы только что выяснили, всегда строго положительно — это прямое следствие области значений показательной функции. Значит:
$$1 + e^{-x} > 1 \quad \text{при любом } x$$Раз знаменатель всегда больше единицы, а числитель равен единице, дробь $\sigma(x)$ всегда строго меньше 1. И одновременно знаменатель всегда конечен (не бесконечен), значит дробь всегда строго больше 0.
Ответ: $0 < \sigma(x) < 1$ при любом $x$ — это прямое следствие того, что $e^{-x} > 0$ всегда.
Почему это важно: В классификаторах сигмоида превращает "сырой" выход сети в вероятность. То, что она никогда не достигает точного 0 или 1, — не баг, а фича: модель никогда не может быть абсолютно, стопроцентно уверена. Это свойство напрямую вытекает из области значений показательной функции, которую ты только что изучил.
Пример 3 (сложный): почему ограничения на $a$ обязательны
Вопрос: Почему в определении требуется $a > 0$ и $a \neq 1$? Проверь на конкретных числах, что сломается при $a = -4$, $a = 0$ и $a = 1$.
Решение:
Случай $a = -4$. Возьмём $x = \dfrac{1}{2}$: $(-4)^{1/2} = \sqrt{-4}$ — квадратный корень из отрицательного числа не существует среди действительных чисел. Значит, при отрицательном основании функция определена не для всех $x$ — область определения "дырявая", то есть требование $x \in \mathbb{R}$ нарушается.
Случай $a = 0$. Возьмём $x = -1$: $0^{-1} = \dfrac{1}{0}$ — деление на ноль, не существует. А при $x = 0$ выражение $0^0$ — классическая математическая неопределённость. Основание $a=0$ ломает функцию сразу в нескольких точках.
Случай $a = 1$. Здесь формальных противоречий нет: $1^x = 1$ определено при любом $x$. Но результат всегда один и тот же — константа. График — горизонтальная прямая, без роста и без убывания. Это уже не "показательная" функция в содержательном смысле, а вырожденный случай, который специально исключают из определения.
Ответ: Все три случая нарушают либо область определения (для $a \le 0$), либо содержательный смысл функции (для $a = 1$), поэтому условие $a > 0, a \neq 1$ — не формальная придирка, а необходимость.
Блок 3: Монотонность — где основание решает всё
А теперь самое важное: растёт функция или падает?
Представь два банковских вклада. Один даёт множитель $\times 1{,}08$ каждый год — с каждым годом сумма становится больше предыдущей. Другой — множитель $\times 0{,}5$ каждые 10 лет, как радиоактивный распад: с каждым периодом остаётся меньше, чем было. Обе ситуации описываются показательной функцией $a^x$, только с разным основанием — и именно основание решает, будет функция расти или убывать.
-
Если $a > 1$ — функция возрастает на всей области определения: чем правее $x$, тем больше $f(x)$.
-
Если $0 < a < 1$ — функция убывает на всей области определения: чем правее $x$, тем меньше $f(x)$.
Важно: доказать это можно чисто алгебраически, через свойства степеней — производная (о которой ты узнаешь значительно позже, в уроке 133) для этого совершенно не нужна.
Определение
Монотонность показательной функции:
Функция $f(x) = a^x$ является возрастающей на $\mathbb{R}$, если $a > 1$, и убывающей на $\mathbb{R}$, если $0 < a < 1$.
В обоих случаях функция строго монотонна — то есть не бывает "плоских участков" и не бывает смены направления.
Пример 1 (простой): сравнение при возрастающей функции
Вопрос: Что больше — $2^{10}$ или $2^{7}$, без точного вычисления?
Решение:
Основание $a = 2 > 1$, значит функция $f(x) = 2^x$ возрастающая. Раз $10 > 7$, то по определению возрастающей функции $f(10) > f(7)$.
Ответ: $2^{10} > 2^7$ (для проверки: $1024 > 128$ ✅)
Пример 2 (средний): сравнение при убывающей функции
Вопрос: Что больше — $(0{,}5)^3$ или $(0{,}5)^7$?
Решение:
Здесь основание $a = 0{,}5$, и $0 < 0{,}5 < 1$ — функция убывающая. Для убывающей функции работает обратная логика: чем больше показатель, тем меньше значение. Поскольку $3 < 7$:
$$(0{,}5)^3 > (0{,}5)^7$$Ответ: $(0{,}5)^3 > (0{,}5)^7$ (проверка: $0{,}125 > 0{,}0078125$ ✅)
Важная ловушка: интуиция про "чем больше степень — тем больше число" здесь работает наоборот. Именно на этом чаще всего ошибаются.
Пример 3 (сложный): доказательство монотонности без производной
Вопрос: Докажи, что при $a > 1$ функция $f(x) = a^x$ возрастает на всей области определения — используя только свойства степеней.
Решение:
Возьмём два произвольных числа $x_1 < x_2$. Нужно показать, что $f(x_1) < f(x_2)$, то есть $a^{x_1} < a^{x_2}$.
Шаг 1. Разность показателей положительна: $x_2 - x_1 > 0$.
Шаг 2. Поскольку $a > 1$, а показатель $x_2 - x_1$ положителен, справедливо неравенство:
$$a^{x_2 - x_1} > 1$$(Это следует из смысла степени: число, большее единицы, возведённое в положительную степень, только увеличивается по сравнению с единицей.)
Шаг 3. Распишем $a^{x_2}$ через свойство степеней $a^{m+n} = a^m \cdot a^n$:
$$a^{x_2} = a^{x_1 + (x_2 - x_1)} = a^{x_1} \cdot a^{x_2 - x_1}$$Шаг 4. Поскольку $a^{x_1} > 0$ (область значений) и $a^{x_2-x_1} > 1$, умножение положительного числа на число, большее единицы, только увеличивает его:
$$a^{x_2} = a^{x_1} \cdot a^{x_2 - x_1} > a^{x_1} \cdot 1 = a^{x_1}$$Вывод: $a^{x_2} > a^{x_1}$, то есть из $x_1 < x_2$ следует $f(x_1) < f(x_2)$ — функция возрастает.
Ответ: Доказано алгебраически, без единой производной — только через свойства степеней, которые ты уже знаешь.
Почему это важно: Именно такое рассуждение (а не "график идёт вверх, значит растёт") — строгий математический стандарт доказательства монотонности. Позже, в уроке про производную, ты увидишь тот же факт с другой стороны, но идея "разность аргументов положительна → множитель больше единицы → произведение больше исходного" останется рабочей интуицией на всю жизнь.
Блок 4: График показательной функции
Представь себе форму до того, как построишь её по точкам
У всех показательных функций есть общий "скелет", который не зависит от конкретного значения основания:
-
график всегда проходит через точку $(0; 1)$, потому что $a^0 = 1$ для любого допустимого $a$;
-
график всегда проходит через точку $(1; a)$, потому что $a^1 = a$;
-
прямая $y = 0$ — горизонтальная асимптота: график бесконечно приближается к оси $Ox$, но никогда её не пересекает;
-
график целиком лежит выше оси $Ox$ (следствие области значений $y > 0$).
Дальше форма расходится в зависимости от основания. При $a > 1$ график полого стартует слева, проходит через $(0;1)$ и стремительно взлетает вправо. При $0 < a < 1$ — зеркальная картина: график стремительно падает слева и полого приближается к оси справа.
Определение
Симметрия графиков: Графики функций $y = a^x$ и $y = \left(\dfrac{1}{a}\right)^x$ симметричны друг другу относительно оси $Oy$.
Это следует из тождества $\left(\dfrac{1}{a}\right)^x = a^{-x}$ — то есть график $y=(1/a)^x$ получается из графика $y=a^x$ заменой $x$ на $-x$, а такая замена всегда даёт зеркальное отражение относительно вертикальной оси.
Пример 1 (простой): опорные точки графика
Вопрос: Назови три точки, через которые проходит график $y = 3^x$.
Решение:
Используем опорные правила:
-
$x = 0$: $y = 3^0 = 1$ → точка $(0; 1)$
-
$x = 1$: $y = 3^1 = 3$ → точка $(1; 3)$
-
$x = 2$: $y = 3^2 = 9$ → точка $(2; 9)$
Ответ: $(0;1)$, $(1;3)$, $(2;9)$ — этого достаточно, чтобы набросать возрастающую кривую.
Пример 2 (средний): восстанавливаем основание по графику
Вопрос: График показательной функции $y = a^x$ проходит через точку $(2; 9)$. Найди $a$.
Решение:
Подставляем координаты точки в формулу:
$$a^2 = 9$$Извлекаем квадратный корень, но помним: основание степени по определению обязано быть положительным, поэтому отрицательный корень $a=-3$ не подходит:
$$a = 3$$Ответ: $a = 3$ (проверка: $3^2 = 9$ ✅, и $3 > 0$, $3 \neq 1$ — условие выполнено)
Пример 3 (сложный): почему у softmax "острый" график
Вопрос: В softmax сравниваются логиты нейросети (сырые числа перед нормализацией). Почему функция $e^x$, а не, скажем, линейная $y = x$, используется для превращения логитов в веса вероятностей?
Решение:
Ключевое свойство графика показательной функции — ускоряющийся рост: при $a > 1$ кривая не просто идёт вверх, а идёт вверх со всё возрастающей крутизной. Разница между соседними значениями $a^{x+1} - a^x = a^x(a-1)$ растёт вместе с $x$ — то есть чем правее по оси, тем сильнее "разрыв" между соседними точками графика.
Если бы softmax использовал линейную функцию, логиты $z = [1, 2, 3]$ давали бы веса, пропорциональные $1{:}2{:}3$ — разница между классами была бы довольно скромной. Но благодаря показательному росту $e^1 \approx 2{,}72$, $e^2 \approx 7{,}39$, $e^3 \approx 20{,}09$ — разрыв между слабым и сильным сигналом резко увеличивается: соотношение становится примерно $1{:}2{,}7{:}7{,}4$.
Ответ: Показательная функция не просто растёт, а растёт со всё увеличивающейся скоростью, поэтому она "обостряет" различия между логитами гораздо сильнее, чем линейная зависимость — именно это нужно, чтобы модель уверенно выделяла наиболее вероятный класс.
Почему это важно: Форма графика — это не абстрактная красота, а рабочий инструмент выбора функции для конкретной задачи. Понимание того, что $a^x$ "разгоняется" при увеличении $x$, объясняет, почему инженеры выбирают именно экспоненту там, где нужно резко подчеркнуть большие значения.
Блок 5: Показательная функция в машинном обучении
Обещанный раздел: три места, где $a^x$ работает без остановки на каждой итерации обучения нейросети.
5.1 Softmax — превращаем логиты в вероятности
Softmax берёт вектор "сырых" чисел (логитов) $z = (z_1, \ldots, z_n)$ и превращает его в распределение вероятностей:
$$\text{softmax}(z_i) = \frac{e^{z_i}}{\sum_{j} e^{z_j}}$$Почему это вообще работает как распределение вероятностей? Потому что у показательной функции область значений — только положительные числа: каждое слагаемое $e^{z_j}$ строго больше нуля, независимо от знака $z_j$ (даже если логит отрицательный!). Значит, и числитель, и знаменатель дроби положительны, и каждая вероятность на выходе лежит в диапазоне $(0; 1)$ — ровно то свойство области значений, которое мы разобрали в блоке 2.
import numpy as np
logits = np.array([1.0, 2.0, 3.0])
exp_logits = np.exp(logits) # [2.72, 7.39, 20.09] — всегда положительны
probs = exp_logits / exp_logits.sum() # [0.09, 0.245, 0.665]
5.2 Сигмоида — бинарная вероятность из одного числа
$$\sigma(x) = \frac{1}{1 + e^{-x}}$$Мы уже доказали в блоке 2, что $0 < \sigma(x) < 1$ при любом $x$ — это прямое следствие положительности $e^{-x}$. А монотонность показательной функции (блок 3) объясняет форму знаменитой S-образной кривой: при $x \to +\infty$ величина $e^{-x} \to 0$ (убывающая функция с основанием $\dfrac{1}{e} < 1$), значит $\sigma(x) \to 1$. При $x \to -\infty$ величина $e^{-x}$ неограниченно растёт, значит $\sigma(x) \to 0$.
def sigmoid(x):
return 1 / (1 + np.exp(-x))
sigmoid(0) # 0.5 — точка перегиба
sigmoid(5) # 0.993 — близко к 1, но не равно
sigmoid(-5) # 0.007 — близко к 0, но не равно
5.3 Расписание learning rate — управляемое убывание
Скорость обучения (learning rate) часто уменьшают по ходу тренировки, чтобы модель под конец делала более осторожные шаги. Классический вариант — экспоненциальное затухание:
$$\text{lr}(t) = \text{lr}_0 \cdot \gamma^{t}, \qquad 0 < \gamma < 1$$Здесь $\gamma$ — коэффициент затухания на каждую эпоху $t$. Так как $0 < \gamma < 1$, это в точности убывающая показательная функция из блока 3: чем больше эпох прошло, тем меньше становится learning rate, причём падение никогда не даёт точный ноль — он лишь стремится к нему, оставаясь исчезающе малым, но положительным.
lr0, gamma = 0.1, 0.95
for epoch in range(10):
lr = lr0 * gamma ** epoch
print(f"epoch {epoch}: lr = {lr:.5f}")
5.4 Экспоненциальное скользящее среднее (EMA)
В оптимизаторах вроде Adam накопленный момент градиента обновляется через коэффициент $\beta$ (обычно $\beta = 0{,}9$ или $0{,}999$), а вклад старых градиентов затухает как $\beta^t$ — снова та же убывающая показательная функция, только на этот раз она "забывает" старую информацию плавно, без резких обрывов.
Практика: 30 заданий
Базовые (задания 1–10)
Задание 1: Вычисли $f(4)$ для функции $f(x) = 2^x$.
Задание 2: Вычисли $f(-3)$ для функции $f(x) = 5^x$.
Задание 3: Вычисли $\left(\dfrac{1}{2}\right)^{-4}$.
Задание 4: При каком $x$ выполняется $3^x = 27$?
Задание 5: Сравни без вычисления точных значений: что больше, $2^{10}$ или $2^{7}$?
Задание 6: Сравни без вычисления точных значений: что больше, $(0{,}5)^3$ или $(0{,}5)^7$?
Задание 7: Найди область значений функции $f(x) = 4^x$.
Задание 8: Через какую точку всегда проходит график $y = a^x$, независимо от значения $a$?
Задание 9: Определи, возрастает или убывает функция $y = \left(\dfrac{2}{5}\right)^x$.
Задание 10: Вычисли значение сигмоиды в точке $x=0$: $\sigma(0) = \dfrac{1}{1+e^{0}}$.
Средние (задания 11–20)
Задание 11: Реши уравнение $4^x = 64$.
Задание 12: Реши уравнение $\left(\dfrac{1}{3}\right)^x = 9$.
Задание 13: Найди основание $a$, если график функции $y = a^x$ проходит через точку $(3; 8)$.
Задание 14: Сравни без калькулятора: что больше, $3^{1/2}$ или $3^{1/3}$?
Задание 15: При каком значении $x$ функция $f(x) = (0{,}2)^x$ принимает значение $25$?
Задание 16: Вычисли $f(2) - f(0)$ для функции $f(x) = 3^x$.
Задание 17: Колония бактерий удваивается каждый час. Модель: $N(t) = 200 \cdot 2^t$. Сколько бактерий будет через 5 часов?
Задание 18: Радиоактивное вещество распадается по закону $m(t) = 80 \cdot (0{,}5)^{t/10}$ (граммы), где $t$ — годы, а период полураспада — 10 лет. Найди массу через 30 лет.
Задание 19: Определи, будет ли значение выражения $\left(\dfrac{7}{9}\right)^{-2}$ больше или меньше единицы, не вычисляя точно.
Задание 20: В логите нейросети $z = 2$. Вычисли $e^z$ с точностью до сотых, используя $e \approx 2{,}718$.
Продвинутые (задания 21–30)
Задание 21: Докажи алгебраически (без производной), что при $a > 1$ функция $f(x) = a^x$ возрастает на всей области определения.
Задание 22: Докажи алгебраически, что при $0 < a < 1$ функция $f(x) = a^x$ убывает на всей области определения.
Задание 23: Реши неравенство $2^x > 2^5$, используя монотонность.
Задание 24: Реши неравенство $\left(\dfrac{1}{4}\right)^x < \left(\dfrac{1}{4}\right)^3$, используя монотонность.
Задание 25: Даны логиты нейросети $z = [1, 2, 3]$. Вычисли $e^{z_i}$ (с точностью до сотых, $e \approx 2{,}718$) и убедись, что все значения положительны.
Задание 26: Докажи, используя область значений показательной функции ($e^{-x} > 0$ при любом $x$), что $0 < \sigma(x) < 1$ для сигмоиды $\sigma(x) = \dfrac{1}{1+e^{-x}}$.
Задание 27: Learning rate убывает по закону $\text{lr}(t) = 0{,}1 \cdot (0{,}95)^t$. Известно, что $0{,}95^{10}\approx0{,}599$, $0{,}95^{20}\approx0{,}358$, $0{,}95^{30}\approx0{,}215$, $0{,}95^{40}\approx0{,}129$, $0{,}95^{50}\approx0{,}077$. При каком из этих значений $t$ learning rate впервые опустится ниже $0{,}01$?
Задание 28: Два вклада с одинаковой начальной суммой растут как $1{,}05^t$ (5% годовых) и $1{,}08^t$ (8% годовых). Известно, что $1{,}05^{10}\approx1{,}629$, $1{,}08^{10}\approx2{,}159$. Во сколько раз второй вклад больше первого через 10 лет?
Задание 29: Виральный пост в момент $t=0$ увидели 50 человек. Дальше число просмотров растёт как $N(t) = 50 \cdot 3^t$, где $t$ — номер "волны" репостов. При каком наименьшем целом $t$ число просмотров превысит миллион?
Задание 30: Отладка кода. Найди ошибку в реализации сигмоиды и объясни, почему график ведёт себя неправильно.
import numpy as np
def sigmoid(x):
return 1 / (1 + np.exp(x)) # ???
print(sigmoid(10)) # получаем: 0.0000454
print(sigmoid(-10)) # получаем: 0.99995
Частые ошибки
❌ Ошибка 1: путать основание и показатель
Неправильно: считать, что $2^x$ и $x^2$ — это одно и то же, или что они растут одинаково.
Правильно: в $2^x$ переменная стоит в показателе (растёт всё быстрее — показательный рост), а в $x^2$ переменная стоит в основании (это степенная функция, растёт заметно медленнее). Это принципиально разное поведение, особенно при больших $x$.
❌ Ошибка 2: считать, что основанием может быть любое число
Неправильно: брать $a = -2$, $a = 0$ или $a = 1$ как основание показательной функции.
Правильно: основание обязано быть положительным и не равным единице. При отрицательном основании функция не определена для всех действительных $x$ (например, $\sqrt{-2}$ не существует), при $a=0$ возникают неопределённости вроде $0^0$, а при $a=1$ функция вырождается в константу и теряет характерное поведение.
❌ Ошибка 3: думать, что $a^x$ может быть нулём или отрицательным
Неправильно: "если $a$ маленькое, а $x$ большое, результат может стать отрицательным или нулевым".
Правильно: $a^x > 0$ при любых допустимых $a$ и любом $x \in \mathbb{R}$ — это часть определения области значений. Значение может быть сколь угодно близко к нулю, но никогда не станет нулём или отрицательным числом.
❌ Ошибка 4: решать уравнение $2^x = 8$ делением вместо приведения к одному основанию
Неправильно: $2^x = 8 \implies x = 8/2 = 4$.
Правильно: показатель степени — это не множитель, поэтому делить нельзя. Нужно привести к одинаковому основанию: $2^x = 2^3 \implies x = 3$.
❌ Ошибка 5: путать направление монотонности для $0
Неправильно: "раз основание положительное, функция всегда растёт".
Правильно: знак основания относительно единицы, а не относительно нуля, определяет направление. При $0 < a < 1$ функция строго убывает, хотя само основание и положительно.
❌ Ошибка 6: забывать проверить допустимость основания при решении задач "найди $a$"
Неправильно: из уравнения $a^2 = 9$ брать оба корня, $a=3$ и $a=-3$.
Правильно: основание показательной функции обязано быть положительным по определению, значит подходит только $a=3$; отрицательный корень отбрасывается, даже если он математически удовлетворяет уравнению.
❌ Ошибка 7: путать экспоненциальный и линейный рост в прикладных задачах
Неправильно: считать, что если каждую единицу времени прибавляется "какой-то процент", это похоже на равномерный (линейный) прирост.
Правильно: при экспоненциальном росте прирост пропорционален уже накопленному значению — чем больше база, тем больше абсолютный прирост на следующем шаге. Именно поэтому небольшая на первый взгляд разница в процентной ставке (5% против 8%, см. задание 28) со временем превращается в разницу на десятки процентов.
Главное запомнить
✅ Определение: $f(x) = a^x$, где $a > 0$, $a \neq 1$, $x$ — любое действительное число.
✅ Область определения: $x \in (-\infty; +\infty)$ — подставлять можно абсолютно любое число, включая иррациональные (они определяются через приближение рациональными).
✅ Область значений: $y \in (0; +\infty)$ — результат всегда строго положителен, никогда не равен нулю и не бывает отрицательным.
✅ Опорные точки графика: всегда проходит через $(0;1)$, так как $a^0=1$; и через $(1;a)$, так как $a^1=a$.
✅ Монотонность: возрастает при $a > 1$, убывает при $0 < a < 1$ — и это доказывается строго алгебраически, через свойства степеней, без единой производной.
✅ Асимптота: прямая $y=0$ — график бесконечно приближается к оси $Ox$, но никогда её не касается.
✅ Симметрия: графики $y=a^x$ и $y=(1/a)^x$ зеркальны друг другу относительно оси $Oy$.
✅ Почему $a=1$ и $a\le0$ запрещены: при $a=1$ теряется характерное растущее/убывающее поведение (функция вырождается в константу); при $a\le0$ функция не определена сразу для всех действительных $x$.
✅ В машинном обучении: softmax и сигмоида работают благодаря положительности $e^x$ на любом входе; расписания learning rate и EMA-накопление моментов в оптимизаторах используют убывающую ветвь ($0
✅ Что дальше: отдельное число $e$ (следующий урок), затем более глубокие алгебраические свойства показательной функции, а производная показательной функции появится значительно позже — в уроке 133. Что нужно было знать до этого урока: Степени с натуральным, целым и рациональным показателем — вся арифметика степеней, на которой строятся доказательства этого урока Свойства степеней: $a^{m+n}=a^m a^n$, $a^{-n}=1/a^n$, $(a^m)^n=a^{mn}$ — они использовались буквально в каждом доказательстве и в каждом решении уравнения Понятие функции, области определения и области значений Что изучить дальше: Число $e$ (урок 112) — особое основание, "естественная" единица измерения экспоненциального роста, ключевая константа для всего дальнейшего курса и для машинного обучения Свойства показательной функции (урок 113) — более глубокие алгебраические тождества и приёмы работы с выражениями вида $a^x$ Логарифм (значительно позже) — функция, обратная показательной; отвечает на вопрос "в какую степень возвести основание, чтобы получить число" Показательные уравнения и неравенства — прямое применение монотонности, которую ты только что доказал Производная показательной функции (урок 133) — самый мощный инструмент анализа поведения функции, но он основывается именно на понимании, изученном сегодня Где это нужно в жизни: 🤖 В ML/AI: softmax, сигмоида, расписания learning rate, экспоненциальное скользящее среднее в Adam/RMSProp — везде в основе лежит функция $a^x$ с положительной областью значений и строгой монотонностью. 💰 В финансах: сложные проценты, рост капитала, амортизация — классические модели показательного роста и убывания. 🦠 В биологии и эпидемиологии: рост популяций, распространение вирусов на ранней стадии эпидемии, радиоактивный распад. 📱 В технологиях: вирусное распространение контента, закон Мура (удвоение числа транзисторов), рост объёма данных. 💡 Легенда о зёрнах на шахматной доске. По легенде, изобретатель шахмат попросил у правителя награду: одно зерно на первую клетку доски, два на вторую, четыре на третью — и так далее, каждый раз удваивая. На последней, 64-й клетке нужно было бы положить $2^{63}$ зёрен — это больше, чем всё зерно, когда-либо выращенное человечеством. Классическая иллюстрация того, насколько обманчиво "скромным" кажется показательный рост на старте. 💡 Закон Мура. С 1965 года количество транзисторов в микрочипах примерно удваивалось каждые два года — эмпирическая закономерность, которую можно записать почти как показательную функцию $N(t) \approx N_0 \cdot 2^{t/2}$. Именно благодаря этому росту современные нейросети вообще можно обучать за разумное время. 💡 Показательная функция и эпидемии. На ранней стадии распространения инфекции (пока не сработали ограничения и не исчерпался запас восприимчивых людей) число заболевших действительно растёт по показательному закону. Именно поэтому эпидемиологи в первые недели вспышки так внимательно следят за "коэффициентом размножения" $R_0$ — по сути, это и есть основание $a$ показательной функции. 💡 Термин "показательная" — не случайность. Название "показательная функция" происходит от слова "показатель" (степени) — переменная стоит именно в показателе. В английском языке используется слово "exponential" — от той же идеи exponent (показатель). Обрати внимание: в русском и английском акцент сделан на одну и ту же деталь конструкции — то, что меняется, находится наверху, в показателе, а не в основании. 1. Быстрая проверка направления монотонности Не пытайся представлять график — просто сравни основание с единицей: $a > 1$ → возрастает $0 < a < 1$ → убывает Больше ничего запоминать не нужно: ни знак $a$, ни его конкретное значение не важны, важно только положение относительно единицы. 2. Двух точек достаточно для наброска графика Чтобы быстро нарисовать эскиз графика $y=a^x$, отметь всего две точки: $(0;1)$ и $(1;a)$. Дальше просто соединяй их плавной кривой в нужном направлении (вверх — если $a>1$, вниз слева направо — если $0
3. Переход к обратному основанию Если неудобно работать с дробным основанием меньше единицы, всегда можно перейти к обратному числу через смену знака показателя: Это часто упрощает сравнение и построение графика. 4. Оценка иррациональной степени через "вилку" Чтобы прикинуть значение вроде $2^{\sqrt2}$, зажми показатель между двумя удобными рациональными числами (например, $1{,}4$ и $1{,}5$) и вычисли границы: Этого достаточно для быстрой прикидки "на глаз" без калькулятора с иррациональными показателями. 5. Численная стабильность softmax — приём из реального кода При вычислении $e^{z_i}$ для больших логитов легко получить переполнение ( 6. Мнемоника "чем больше основание, тем круче взлёт" Если сравниваешь несколько возрастающих показательных функций (например, $2^x$, $3^x$, $10^x$), функция с большим основанием при positive $x$ всегда обгонит функцию с меньшим основанием — и чем правее по оси, тем разрыв заметнее. Полезно держать в голове при быстрой оценке "какая модель роста агрессивнее". Показательная функция — это не про "ещё одну формулу для запоминания". Это про то, что реальность вокруг нас (от вирусных постов до вероятностей, которые выдаёт нейросеть) регулярно ведёт себя именно так: значения не складываются, а умножаются на фиксированный коэффициент на каждом шаге. Как только ты научился видеть эту структуру — рост или убывание пропорционально текущему значению, положительность результата, строгую монотонность без единого "плоского" участка — ты готов к следующему шагу: узнать, почему среди всех возможных оснований математики выделили одно особенное число $e$ и назвали его "естественным". Встретимся в следующем уроке. Попрактикуйся на задачах и получи персональные рекомендации от AI
Связь с другими темами курса
Интересные факты
Лайфхаки и полезные трюки
overflow). Стандартный трюк — вычесть из всех логитов их максимум перед экспонентой; сама вероятность при этом не меняется, потому что $\dfrac{e^{z_i}}{\sum e^{z_j}} = \dfrac{e^{z_i - c}}{\sum e^{z_j - c}}$ для любой константы $c$:z = np.array([1000, 1001, 1002]) # без сдвига — переполнение
z_stable = z - np.max(z) # [-2, -1, 0] — безопасно
probs = np.exp(z_stable) / np.exp(z_stable).sum()
Понял тему? Закрепи в боте! 🚀