🔴 Сложный ⏱️ 55 минут

Применение в задачах (рост, распад)

📋 Содержание урока

Применение в задачах (рост, распад) 📉

Ты запускаешь обучение нейросети. В конфиге написано lr=0.1, gamma=0.95, ExponentialLR. Через сколько эпох learning rate станет меньше $0{,}001$ — то есть шаг обучения фактически превратится в топтание на месте? В соседней вкладке у тебя открыт калькулятор вклада: банк обещает 12% годовых, но с ежемесячной капитализацией — это правда больше, чем 12%, и насколько? А в новостях пишут, что число заражённых удваивается каждые 3,8 дня и «через месяц будет катастрофа».

Три совершенно разных мира — оптимизация, финансы, эпидемиология. И одна-единственная математическая формула под всеми тремя:

$$N(t) = N_0 \cdot a^{t/T} \qquad \text{или, что то же самое,} \qquad N(t) = N_0 e^{kt}$$

Это самая прикладная формула во всей школьной математике. Она описывает всё, что растёт или убывает пропорционально самому себе: чем больше денег на вкладе — тем больше процентов начислят; чем больше радиоактивных ядер — тем больше распадов в секунду; чем больше заражённых — тем больше новых заражений. Величина сама себя разгоняет (или сама себя гасит), и результат — экспонента.

Хорошая новость: чтобы решать такие задачи, тебе не нужно ничего нового. Показательную функцию ты уже разобрал, логарифмы — тоже, показательные и логарифмические уравнения — тоже. Весь этот урок — про то, как перевести человеческий текст задачи в формулу, а потом вытащить из формулы неизвестное. И почти всегда неизвестное — это время $t$, которое сидит в показателе. А значит, ключевой инструмент — логарифм.

Плохая новость (и это самая важная мысль урока): чистая экспонента всегда врёт на длинном горизонте. Бактерии не заполняют Землю, вирус не заражает 8 миллиардов человек за два месяца, а число транзисторов не растёт до бесконечности. У любого реального процесса есть потолок, и нужно понимать, где именно ломается модель — иначе ты построишь красивый прогноз, который не имеет отношения к реальности. Этим мы и закончим — логистической кривой.

🎯 Ты узнаешь:

  • Как переводить условие задачи в формулу $N_0a^{t/T}$ или $N_0e^{kt}$ и как свободно переходить между этими двумя записями
  • Как находить время $t$ через логарифм: сложный процент, период полураспада, радиоуглеродное датирование, закон Ньютона об охлаждении
  • Что такое время удвоения $T_2 = \dfrac{\ln 2}{k}$ и почему «правило 72» позволяет считать в уме без калькулятора
  • Почему чистая экспонента врёт на длинном горизонте и как её чинит логистическая кривая
  • Как всё это работает в ML: расписания learning rate, экспоненциальное скользящее среднее в Adam, weight decay — и почему scaling laws это степенной, а не экспоненциальный закон

История: откуда это взялось?

Первым человеком, который аккуратно записал формулу сложного процента, был не математик, а бухгалтер. Лука Пачоли — францисканский монах, друг Леонардо да Винчи и автор первого печатного учебника по двойной бухгалтерии — в 1494 году в трактате «Summa de arithmetica» привёл правило: чтобы узнать, за сколько лет удвоится капитал, раздели 72 на процентную ставку. Он не объяснил, откуда взялось число 72 — просто «так делают купцы». Логарифмов тогда ещё не существовало (Непер опубликует свои таблицы только через 120 лет), и объяснить это правило строго Пачоли попросту не мог. Мы объясним — в этом уроке.

Дальше эстафету принял Якоб Бернулли. В 1683 году он задал вопрос, который сегодня кажется чисто финансовым, а на деле открыл дверь в анализ: что будет, если банк начисляет 100% годовых, но не раз в год, а раз в полгода? А раз в месяц? А каждую секунду? Бернулли посчитал $(1 + 1/m)^m$ для растущих $m$ и обнаружил, что результат не улетает в бесконечность, а упирается в число между 2 и 3. Имя этому числу — $e \approx 2{,}71828$ — дал позже Эйлер. То есть основание натурального логарифма родилось буквально из вопроса «а если капитализировать проценты почаще?».

Третий поворот случился в XX веке и был не про деньги, а про распад. В 1907 году Эрнест Резерфорд с коллегами обнаружили, что радиоактивные ядра распадаются по строго экспоненциальному закону: за одинаковые промежутки времени исчезает одинаковая доля вещества, а не одинаковое количество. Отсюда — понятие периода полураспада. А в 1946–1949 годах американский химик Уиллард Либби сообразил, что этот закон можно повернуть задом наперёд: если знать, сколько углерода-14 было в живом организме, и измерить, сколько осталось, — можно вычислить возраст находки. Он проверил метод на образцах древнеегипетского дерева, чей возраст был известен из исторических записей, и получил Нобелевскую премию по химии в 1960 году. Так формула, придуманная купцами для подсчёта прибыли, стала машиной времени для археологов.

А сегодня та же самая формула лежит в файле torch/optim/lr_scheduler.py. ExponentialLR умножает шаг обучения на $\gamma$ каждую эпоху; Adam хранит экспоненциальное скользящее среднее градиентов с коэффициентом $\beta_1 = 0{,}9$; weight decay каждый шаг слегка «сжимает» веса. Пачоли, Бернулли, Резерфорд и разработчики PyTorch решают одно и то же уравнение.


Модель роста и распада: одна формула, две записи

Интуиция

Представь, что у тебя есть колония бактерий, которая удваивается каждые 3 часа. Через 3 часа — вдвое больше, через 6 часов — вчетверо, через 9 — в восемь раз. Ключевое слово тут — «раз». Не «плюс столько-то», а «во столько-то раз». Именно это отличает экспоненциальный процесс от линейного.

Сравни две зарплатные схемы. Первая: +5000 ₽ каждый год. Вторая: +5% каждый год. Первая — линейная, прибавка всегда одна и та же. Вторая — экспоненциальная, потому что 5% от большей зарплаты — это больше рублей. Через 5 лет разница ещё небольшая, через 30 — пропасть.

Формально любой такой процесс описывается одинаково: за фиксированный промежуток времени $T$ величина умножается на фиксированное число $a$. За $t$ единиц времени промежуток $T$ укладывается $t/T$ раз, значит множитель применяется $t/T$ раз:

Определение: Процесс называется экспоненциальным (показательным), если существуют такие числа $a > 0$, $a \neq 1$ и $T > 0$, что величина за каждый промежуток времени $T$ умножается на $a$. Его модель:

$$N(t) = N_0 \cdot a^{t/T},$$

где $N_0 = N(0)$ — начальное значение, $a$ — множитель за период, $T$ — длина периода.

Если $a > 1$ — это рост, если $0 < a < 1$ — распад (затухание).

Вторая, эквивалентная запись — через число $e$:

Определение: Та же модель в непрерывной форме:

$$N(t) = N_0 e^{kt},$$

где $k$ — постоянная скорости процесса (мгновенный темп). При $k > 0$ — рост, при $k < 0$ — распад.

Обе записи описывают одно и то же множество процессов, просто в разных «единицах измерения» темпа. Переход между ними — самый частый технический ход в задачах:

$$a^{t/T} = e^{kt} \quad \Longleftrightarrow \quad k = \frac{\ln a}{T} \quad \Longleftrightarrow \quad T = \frac{\ln a}{k}$$

Почему это верно: перепишем $a = e^{\ln a}$, тогда $a^{t/T} = \left(e^{\ln a}\right)^{t/T} = e^{\frac{\ln a}{T}\cdot t}$. Сравниваем показатели — получаем формулу связи.

Три главных частных случая, которые надо знать наизусть:

  • Удвоение за время $T_2$: $a = 2$, $N = N_0\cdot 2^{t/T_2}$, и $k = \dfrac{\ln 2}{T_2} \approx \dfrac{0{,}693}{T_2}$
  • Полураспад за время $T$: $a = \tfrac12$, $N = N_0\cdot 2^{-t/T}$, и $k = -\dfrac{\ln 2}{T}$
  • Процентный рост на $p$% за период: $a = 1 + \dfrac{p}{100}$, $N = N_0\left(1+\dfrac{p}{100}\right)^{t/T}$

Обрати внимание на третий пункт: если ставка 20% за период, то $a = 1{,}2$, но $k = \ln 1{,}2 \approx 0{,}182$, а не $0{,}2$. Путать $k$ и процентную ставку — одна из самых частых ошибок; вернёмся к ней в разделе про ошибки.

Примеры с разбором

Пример 1 (простой): колония бактерий утраивается каждые 4 часа. Сейчас их 5000. Сколько будет через 12 часов?

Решение:

Шаг 1. Выпишем параметры модели: $N_0 = 5000$, множитель за период $a = 3$, период $T = 4$ ч.

Шаг 2. Модель: $N(t) = 5000 \cdot 3^{t/4}$.

Шаг 3. Подставим $t = 12$:

$$N(12) = 5000 \cdot 3^{12/4} = 5000 \cdot 3^3 = 5000 \cdot 27 = 135\,000$$

Проверим наш ответ. За 12 часов период в 4 часа уложился ровно 3 раза, значит утроение произошло трижды: $5000 \to 15\,000 \to 45\,000 \to 135\,000$ ✅

Ответ: 135 000 бактерий.


Пример 2 (средний): перепиши модель $N(t) = 800\cdot 2^{-t/6}$ в форме $N_0e^{kt}$ (время в часах).

Решение:

Шаг 1. Начальное значение видно сразу: $N_0 = 800$.

Шаг 2. Приведём основание к $e$. Здесь $a = 2^{-1} = \tfrac12$ за период $T = 6$, но удобнее работать прямо с показателем:

$$2^{-t/6} = \left(e^{\ln 2}\right)^{-t/6} = e^{-\frac{\ln 2}{6}t}$$

Шаг 3. Значит $k = -\dfrac{\ln 2}{6} = -\dfrac{0{,}693147}{6} \approx -0{,}11552$ (1/час).

Шаг 4. Итоговая запись: $N(t) \approx 800\, e^{-0{,}11552\,t}$.

Проверим наш ответ. При $t = 6$ первая формула даёт $800\cdot 2^{-1} = 400$. Вторая: $800\,e^{-0{,}693147} = 800\cdot 0{,}5 = 400$ ✅ Совпало.

Ответ: $N(t) = 800e^{-0{,}11552t}$, где $k = -\dfrac{\ln 2}{6}\ \text{ч}^{-1}$.


Пример 3 (сложный): в момент $t=0$ измерили $N_0 = 1200$ единиц вещества, через 5 часов осталось 300. Найди период полураспада, постоянную $k$ и количество вещества через 8 часов.

Решение:

Шаг 1. Найдём множитель за 5 часов:

$$\frac{N(5)}{N(0)} = \frac{300}{1200} = \frac14$$

За 5 часов вещество уменьшилось в 4 раза.

Шаг 2. Уменьшение в 4 раза — это два последовательных уменьшения вдвое. Значит, за 5 часов уложилось ровно два периода полураспада:

$$2^{-5/T} = \frac14 = 2^{-2} \ \Longrightarrow\ \frac{5}{T} = 2 \ \Longrightarrow\ T = 2{,}5\ \text{ч}$$

Шаг 3. Постоянная распада:

$$k = -\frac{\ln 2}{T} = -\frac{0{,}693147}{2{,}5} \approx -0{,}27726\ \text{ч}^{-1}$$

Шаг 4. Модель: $N(t) = 1200\cdot 2^{-t/2{,}5}$. Найдём $N(8)$:

$$N(8) = 1200\cdot 2^{-8/2{,}5} = 1200\cdot 2^{-3{,}2} = \frac{1200}{2^{3{,}2}}$$

Шаг 5. Посчитаем $2^{3{,}2} = 2^3\cdot 2^{0{,}2} = 8\cdot 1{,}1487 = 9{,}1896$.

$$N(8) = \frac{1200}{9{,}1896} \approx 130{,}6$$

Проверим наш ответ. 8 часов — это чуть больше трёх периодов полураспада (три периода = 7,5 ч). После трёх периодов было бы $1200/8 = 150$. Наш ответ 130,6 — чуть меньше 150, что и должно быть ✅

Ответ: $T = 2{,}5$ ч, $k \approx -0{,}277\ \text{ч}^{-1}$, $N(8)\approx 131$ единица.

Почему это важно

Умение мгновенно переводить условие в формулу — это 80% успеха в прикладных задачах. Заметь схему: в условии всегда есть начальное значение, множитель и период, за который этот множитель применяется. Как только ты вытащил эти три вещи из текста, задача сводится к арифметике или к одному логарифму. А переход между записями $a^{t/T}$ и $e^{kt}$ нужен потому, что мир говорит на обоих языках: банкиры и биологи любят «удвоение за 3 дня», а физики и авторы ML-библиотек пишут $e^{-kt}$. Ты должен читать оба.


Сложный процент и капитализация 💰

Интуиция

Простой процент — это когда проценты каждый год начисляют на первоначальную сумму. Положил 100 000 под 10% — получаешь 10 000 в год, всегда ровно 10 000. Это линейный рост, скучный.

Сложный процент — это когда проценты начисляют на текущую сумму, включая уже начисленные проценты. Второй год ты получаешь 10% уже от 110 000, то есть 11 000. Третий — от 121 000, то есть 12 100. Проценты сами начинают зарабатывать проценты. Это и есть «капитализация».

Разница кажется мелкой на коротком горизонте и становится чудовищной на длинном. 100 000 ₽ под 10% на 30 лет: простой процент даёт $100\,000 + 30\cdot10\,000 = 400\,000$. Сложный даёт $100\,000\cdot 1{,}1^{30} \approx 1\,744\,940$ — в четыре с лишним раза больше.

Определение: При сложном проценте со ставкой $p$% за период сумма через $n$ периодов равна

$$S_n = S_0\left(1 + \frac{p}{100}\right)^n$$

Величина $\left(1+\frac{p}{100}\right)$ называется множителем наращения за период.

Теперь второй слой — частота капитализации. Банк говорит «12% годовых», но может начислять их раз в год, раз в квартал, раз в месяц или ежедневно. Правило простое: годовую ставку делят на число начислений, а показатель во столько же раз увеличивают.

Определение: При номинальной годовой ставке $r$ (в долях) и капитализации $m$ раз в год сумма через $t$ лет равна

$$S(t) = S_0\left(1 + \frac{r}{m}\right)^{mt}$$

Величина $\left(1+\frac{r}{m}\right)^m - 1$ — эффективная годовая ставка: тот процент, который ты реально получаешь за год.

Что происходит, когда $m$ растёт? Посмотри на 12% годовых:

Частота $m$ Множитель за год Эффективная ставка
раз в год 1 $1{,}12$ 12,000%
раз в полгода 2 $1{,}06^2 = 1{,}1236$ 12,360%
раз в квартал 4 $1{,}03^4 = 1{,}12551$ 12,551%
раз в месяц 12 $1{,}01^{12} = 1{,}12683$ 12,683%
ежедневно 365 $1{,}12747$ 12,747%
непрерывно $\infty$ $e^{0{,}12} = 1{,}12750$ 12,750%

Видишь, что происходит? Прибавка от учащения капитализации быстро выдыхается. Переход от года к полугодию даёт +0,36 п.п., от месяца к дню — всего +0,064 п.п., а от дня к «непрерывно» — жалкие +0,003 п.п. Последовательность $\left(1+\frac{r}{m}\right)^m$ упирается в потолок $e^r$ — это ровно тот вопрос, который задал Бернулли в 1683 году.

Отсюда третья форма записи, самая компактная — непрерывное начисление:

$$S(t) = S_0 e^{rt}$$

Это верхняя граница того, что вообще может дать ставка $r$, и именно поэтому физики и ML-инженеры сразу пишут $e^{kt}$, не заморачиваясь с частотой.

Примеры с разбором

Пример 4 (простой): 80 000 ₽ положили под 6% годовых со сложным процентом на 5 лет. Сколько будет на счету?

Решение:

Шаг 1. Множитель за год: $1 + 0{,}06 = 1{,}06$.

Шаг 2. За 5 лет множитель применяется 5 раз:

$$S = 80\,000\cdot 1{,}06^5$$

Шаг 3. Посчитаем $1{,}06^5$ по шагам, чтобы не ошибиться:

$$1{,}06^2 = 1{,}1236,\quad 1{,}06^4 = 1{,}1236^2 = 1{,}26247696,\quad 1{,}06^5 = 1{,}26247696\cdot 1{,}06 = 1{,}33822558$$

Шаг 4. $S = 80\,000\cdot 1{,}33822558 \approx 107\,058$ ₽.

Проверим наш ответ. Простой процент дал бы $80\,000 + 5\cdot 4800 = 104\,000$. Сложный чуть больше — логично ✅

Ответ: ≈ 107 058 ₽ (прибыль ≈ 27 058 ₽).


Пример 5 (средний): 150 000 ₽ кладут на 2 года под 12% годовых. Сравни три схемы: капитализация раз в год, раз в квартал, раз в месяц.

Решение:

Шаг 1. Раз в год ($m=1$, $mt = 2$):

$$S = 150\,000\cdot 1{,}12^2 = 150\,000\cdot 1{,}2544 = 188\,160\ \text{₽}$$

Шаг 2. Раз в квартал ($m=4$, ставка за квартал $0{,}12/4 = 0{,}03$, число периодов $4\cdot2 = 8$):

$$1{,}03^2 = 1{,}0609,\quad 1{,}03^4 = 1{,}12550881,\quad 1{,}03^8 = 1{,}12550881^2 = 1{,}26677008$$$$S = 150\,000\cdot 1{,}26677008 \approx 190\,015{,}51\ \text{₽}$$

Шаг 3. Раз в месяц ($m=12$, ставка за месяц $0{,}01$, число периодов $24$):

$$1{,}01^{12} = 1{,}12682503,\quad 1{,}01^{24} = 1{,}12682503^2 \approx 1{,}26973465$$$$S = 150\,000\cdot 1{,}26973465 \approx 190\,460{,}20\ \text{₽}$$

Шаг 4. Сведём в таблицу разницу с базовой схемой:

Схема Сумма Разница с годовой
раз в год 188 160 ₽
раз в квартал 190 016 ₽ +1 856 ₽
раз в месяц 190 460 ₽ +2 300 ₽

Проверим наш ответ. Переход «год → квартал» дал +1856 ₽, а куда более сильный на вид переход «квартал → месяц» — всего +444 ₽. Именно этого мы и ждали: эффект от учащения быстро насыщается ✅

Ответ: 188 160 ₽ / 190 016 ₽ / 190 460 ₽; ежемесячная капитализация выгоднее годовой на 2 300 ₽ за два года.


Пример 6 (сложный): за сколько лет вклад 50 000 ₽ вырастет до 200 000 ₽ при ставке 9% годовых с ежеквартальной капитализацией?

Решение:

Шаг 1. Ставка за квартал: $0{,}09/4 = 0{,}0225$. Пусть $n$ — число кварталов. Уравнение:

$$50\,000\cdot 1{,}0225^{\,n} = 200\,000$$

Шаг 2. Делим обе части на 50 000:

$$1{,}0225^{\,n} = 4$$

Шаг 3. Логарифмируем — неизвестное сидит в показателе, других вариантов нет:

$$n = \log_{1{,}0225} 4 = \frac{\ln 4}{\ln 1{,}0225}$$

Шаг 4. Считаем: $\ln 4 = 1{,}3862944$; $\ln 1{,}0225 \approx 0{,}0222517$.

$$n = \frac{1{,}3862944}{0{,}0222517} \approx 62{,}30\ \text{квартала}$$

Шаг 5. Переводим в годы: $62{,}30 / 4 \approx 15{,}57$ года. Но проценты начисляют только в конце квартала, поэтому нужен целый номер квартала: 63-й квартал, то есть 15 лет и 9 месяцев.

Проверим наш ответ. $1{,}0225^{63} = e^{63\cdot 0{,}0222517} = e^{1{,}40186} \approx 4{,}063 > 4$ ✅, а $1{,}0225^{62} = e^{1{,}37960}\approx 3{,}973 < 4$ ✅ Значит, порог пересекается именно на 63-м квартале.

Ответ: ≈ 15,6 года (63 квартала, то есть 15 лет 9 месяцев).

Почему это важно

Формула сложного процента — это не «задачка про банк». Это шаблон для любого мультипликативного накопления: инфляция, рост выручки компании, амортизация оборудования, рост объёма датасета, деградация модели в проде. И главное — она учит одному навыку, который переносится на всё остальное: не складывать проценты. Рост на 5% десять раз подряд — это не +50%, а $1{,}05^{10} = 1{,}6289$, то есть +62,9%. А падение на 50% и потом рост на 50% — это не возврат к нулю, а $0{,}5\cdot1{,}5 = 0{,}75$, то есть минус 25%. Проценты перемножаются, а не складываются, и это ровно тот же принцип, по которому перемножаются множители в экспоненте.


Период полураспада и радиоуглеродное датирование ☢️

Интуиция

Радиоактивный распад — самый «честный» экспоненциальный процесс в природе. Отдельное ядро распадается случайно: невозможно предсказать, когда именно распадётся вот это конкретное ядро. Но ядер в грамме вещества — порядка $10^{22}$, и статистика превращает случайность в железную закономерность: за каждый одинаковый промежуток времени распадается одинаковая доля ядер.

Представь мешок с миллионом монет. Каждую минуту ты подбрасываешь все монеты сразу и убираешь те, что выпали орлом. Через минуту останется примерно половина, через две — четверть, через три — восьмая часть. Ты не знаешь, какая конкретно монета выпадет орлом, но точно знаешь, что останется половина. Период полураспада здесь — одна минута.

Определение: Периодом полураспада $T$ называется время, за которое количество вещества уменьшается вдвое. Закон распада:

$$N(t) = N_0\cdot\left(\frac12\right)^{t/T} = N_0\cdot 2^{-t/T} = N_0 e^{-\lambda t},\quad \text{где } \lambda = \frac{\ln 2}{T}$$

Величина $\lambda$ называется постоянной распада.

Важнейшее свойство: период полураспада не зависит от того, сколько вещества было и сколько уже прошло времени. Процесс «не помнит» прошлого. Если сейчас у тебя 1 грамм — через $T$ будет полграмма. Если сейчас 1 микрограмм — через $T$ будет полмикрограмма. Это свойство называют отсутствием памяти, и именно оно делает возможным датирование.

Как работает радиоуглеродный метод. В атмосфере под действием космических лучей постоянно образуется радиоактивный изотоп углерода $^{14}\mathrm{C}$. Живой организм обменивается углеродом со средой, и доля $^{14}\mathrm{C}$ в нём такая же, как в атмосфере. Как только организм умирает, обмен прекращается — а $^{14}\mathrm{C}$ продолжает распадаться с периодом $T = 5730$ лет. Измеряем, какая доля осталась, — получаем возраст:

$$\frac{N}{N_0} = 2^{-t/T}\ \Longrightarrow\ t = T\cdot\log_2\frac{N_0}{N} = T\cdot\frac{\ln(N_0/N)}{\ln 2}$$

Полезные ориентиры, которые стоит держать в голове:

  • Осталось $1/2$ → прошёл 1 период
  • Осталось $1/4$ → 2 периода
  • Осталось $1/8$ → 3 периода
  • Осталось $1/10$ → $\log_2 10 \approx 3{,}32$ периода
  • Осталось $1/100$ → $\approx 6{,}64$ периода
  • Осталось $1/1000$ → $\approx 9{,}97 \approx 10$ периодов

Последняя строчка — отличный практический ориентир: за 10 периодов полураспада остаётся примерно тысячная доля. Именно поэтому в радиационной безопасности считают, что через 10 периодов источник «практически безопасен».

Примеры с разбором

Пример 7 (простой): период полураспада углерода-14 равен 5730 лет. Сколько останется от 1 грамма через 17 190 лет?

Решение:

Шаг 1. Сколько периодов уложилось: $17\,190 / 5730 = 3$.

Шаг 2. Три полураспада — три деления пополам:

$$N = 1\cdot\left(\frac12\right)^3 = \frac18 = 0{,}125\ \text{г}$$

Проверим наш ответ. По формуле: $N = 1\cdot 2^{-17190/5730} = 2^{-3} = 0{,}125$ ✅

Ответ: 0,125 г (одна восьмая грамма).


Пример 8 (средний): период полураспада стронция-90 равен 28,8 года. Через сколько лет его останется 1% от исходного количества?

Решение:

Шаг 1. Записываем условие как уравнение:

$$2^{-t/28{,}8} = 0{,}01$$

Шаг 2. Перевернём дробь, чтобы избавиться от минуса в показателе:

$$2^{\,t/28{,}8} = 100$$

Шаг 3. Логарифмируем по основанию 2:

$$\frac{t}{28{,}8} = \log_2 100$$

Шаг 4. Считаем $\log_2 100 = \dfrac{\ln 100}{\ln 2} = \dfrac{4{,}6051702}{0{,}6931472} \approx 6{,}6439$.

Можно и хитрее: $\log_2 100 = 2\log_2 10 \approx 2\cdot 3{,}3219 = 6{,}6439$ ✅

Шаг 5. $t = 28{,}8\cdot 6{,}6439 \approx 191{,}3$ года.

Проверим наш ответ. 6,64 периода — это между 6 периодами ($1/64 \approx 1{,}56\%$) и 7 периодами ($1/128 \approx 0{,}78\%$). Наши 1% как раз попадают в этот диапазон ✅

Ответ: ≈ 191 год.


Пример 9 (сложный): в живом дереве активность углерода-14 равна 13,6 распада в минуту на грамм углерода. В деревянной находке измерили 9,6 распада в минуту на грамм. Определи возраст находки.

Решение:

Шаг 1. Активность пропорциональна числу нераспавшихся ядер, поэтому отношение активностей — это и есть отношение $N/N_0$:

$$\frac{N}{N_0} = \frac{9{,}6}{13{,}6} = \frac{96}{136} = \frac{12}{17} \approx 0{,}70588$$

Шаг 2. Составляем уравнение:

$$2^{-t/5730} = \frac{12}{17}$$

Шаг 3. Перевернём и прологарифмируем:

$$2^{\,t/5730} = \frac{17}{12} \ \Longrightarrow\ \frac{t}{5730} = \log_2\frac{17}{12} = \frac{\ln 17 - \ln 12}{\ln 2}$$

Шаг 4. Считаем: $\ln 17 = 2{,}8332133$, $\ln 12 = 2{,}4849066$, разность $= 0{,}3483067$.

$$\frac{t}{5730} = \frac{0{,}3483067}{0{,}6931472} \approx 0{,}50250$$

Шаг 5. $t = 5730\cdot 0{,}50250 \approx 2879$ лет.

Проверим наш ответ. Осталось чуть меньше 71% — это чуть больше половины периода полураспада. Половина периода — 2865 лет, наш ответ 2879 — рядом ✅ Подстановка: $2^{-0{,}5025} = e^{-0{,}5025\cdot 0{,}693147} = e^{-0{,}348307} = 0{,}70588$ ✅

Ответ: ≈ 2880 лет (округляя до значащих цифр — примерно 2,9 тысячи лет).

Почему это важно

Датирование — прекрасный пример обратной задачи: обычно мы по времени находим количество, а здесь по количеству находим время. Такие обратные задачи повсюду в анализе данных: по текущему остатку пользователей оценить время с момента запуска когорты, по уровню сигнала — расстояние, по значению learning rate — номер эпохи. Схема одинакова: составить отношение $N/N_0$, приравнять к показательному выражению, взять логарифм. Обрати внимание и на то, что физическую величину (активность, число распадов, концентрация) почти никогда не измеряют абсолютно — измеряют отношение к эталону. Отношение убирает необходимость знать $N_0$ точно, и это общий приём: работай с относительными величинами, они устойчивее.


Находим время: логарифм, время удвоения и правило 72 ⏱️

Интуиция

Все задачи на рост и распад делятся ровно на два типа.

Прямая задача: дано время — найти количество. Подставил $t$ в формулу, посчитал. Скучно.

Обратная задача: дано количество — найти время. Вот тут время сидит в показателе степени, и достать его оттуда можно единственным инструментом — логарифмом. Это и есть главный технический навык всего урока.

Универсальный рецепт:

$$N_0\cdot a^{t/T} = N \ \Longrightarrow\ a^{t/T} = \frac{N}{N_0} \ \Longrightarrow\ \frac{t}{T} = \log_a\frac{N}{N_0} \ \Longrightarrow\ \boxed{\,t = T\cdot\frac{\ln(N/N_0)}{\ln a}\,}$$

И для непрерывной формы:

$$N_0 e^{kt} = N \ \Longrightarrow\ \boxed{\,t = \frac{1}{k}\ln\frac{N}{N_0}\,}$$

Заметь красивую вещь: время зависит только от отношения $N/N_0$, а не от самих чисел. Чтобы вклад вырос втрое, нужно одно и то же время, начинал ты с тысячи рублей или с миллиарда. Чтобы вещества осталось 10%, нужно одно и то же время независимо от массы образца. Это прямое следствие того, что процесс мультипликативен.

Из этого рецепта вырастает самая ходовая характеристика любого растущего процесса — время удвоения.

Определение: Временем удвоения $T_2$ называется время, за которое величина растёт вдвое. Для модели $N = N_0e^{kt}$:

$$T_2 = \frac{\ln 2}{k} \approx \frac{0{,}693}{k}$$

Для модели с процентной ставкой $p$% за период: $T_2 = \dfrac{\ln 2}{\ln\left(1+\frac{p}{100}\right)}$.

Аналогично для распада вводится время полураспада: $T_{1/2} = \dfrac{\ln 2}{|k|}$ — та же формула, просто $k$ отрицательное.

Правило 72: как считать удвоение в уме

Логарифм в уме не посчитаешь, а прикинуть срок удвоения хочется прямо в разговоре. Для этого купцы XV века придумали правило:

Правило 72: при ставке $p$% за период капитал удваивается примерно за $\dfrac{72}{p}$ периодов.

Откуда берётся 72? Давай разберёмся честно.

Шаг 1. Точная формула: $T_2 = \dfrac{\ln 2}{\ln(1 + r)}$, где $r = p/100$.

Шаг 2. При малых $r$ работает приближение $\ln(1+r)\approx r$. Тогда

$$T_2 \approx \frac{0{,}693}{r} = \frac{69{,}3}{p}$$

То есть «честное» число — не 72, а 69,3.

Шаг 3. Но приближение $\ln(1+r)\approx r$ систематически завышает знаменатель ($\ln(1+r) < r$ при $r>0$), а значит занижает $T_2$. Чтобы это скомпенсировать, числитель немного увеличивают. Насколько? Точный «идеальный числитель» равен

$$C(p) = 69{,}3\cdot\frac{r}{\ln(1+r)}$$

При $r = 0{,}08$: $C = 69{,}3\cdot\dfrac{0{,}08}{0{,}076961} = 69{,}3\cdot1{,}0395 \approx 72{,}0$.

Вот и ответ: число 72 — это точный числитель для ставки около 8%, то есть для типичной купеческой (и типичной рыночной) доходности. Плюс 72 делится на 1, 2, 3, 4, 6, 8, 9, 12 — считать в уме одно удовольствие.

Насколько правило врёт на практике:

Ставка $p$ Точное $T_2$ Правило 72 Правило 69,3
1% 69,7 72,0 69,3
2% 35,0 36,0 34,7
4% 17,7 18,0 17,3
6% 11,9 12,0 11,6
8% 9,01 9,00 8,66
10% 7,27 7,20 6,93
15% 4,96 4,80 4,62
20% 3,80 3,60 3,47

Вывод для практики:

  • Ставки 4–12% — правило 72 отличное, ошибка меньше 1%
  • Очень маленькие ставки и непрерывный рост ($N_0e^{kt}$) — используй правило 70 или прямо $0{,}693/k$
  • Ставки выше 15% — правило 72 заметно занижает срок, лучше считать логарифмом

И зеркальный вариант для убывания: при падении на $p$% за период величина уменьшается вдвое примерно за $72/p$ периодов. Инфляция 6% в год → покупательная способность денег падает вдвое за 12 лет. Learning rate падает на 5% за эпоху → он уменьшается вдвое примерно за 14 эпох (точнее — за $\ln 2/\ln(1/0{,}95) = 13{,}5$).

Ещё одна прикидка, которую стоит запомнить: рост в 10 раз — это 3,32 удвоения ($\log_2 10 \approx 3{,}3219$). Отсюда мгновенно: если что-то удваивается каждые 2 года, то в 10 раз оно вырастет за 6,6 года, в 100 раз — за 13,3 года, в 1000 раз — за 20 лет. И родственный факт: $2^{10} = 1024 \approx 10^3$, поэтому «десять удвоений ≈ тысяча раз» — самая быстрая прикидка в мире.

Примеры с разбором

Пример 10 (простой): найди $t$ из уравнения $2^{t/3} = 32$.

Решение:

Шаг 1. Приведём правую часть к основанию 2: $32 = 2^5$.

Шаг 2. $2^{t/3} = 2^5$. Основания равны, показательная функция монотонна — значит равны показатели:

$$\frac{t}{3} = 5 \ \Longrightarrow\ t = 15$$

Проверим наш ответ. $2^{15/3} = 2^5 = 32$ ✅

Ответ: $t = 15$.


Пример 11 (средний): за сколько лет удвоится вклад под 11% годовых? Сравни точный ответ с правилом 72.

Решение:

Шаг 1. Точное уравнение: $1{,}11^{\,t} = 2$.

Шаг 2. Логарифмируем:

$$t = \frac{\ln 2}{\ln 1{,}11} = \frac{0{,}693147}{0{,}104360} \approx 6{,}64\ \text{года}$$

Шаг 3. Правило 72: $72/11 = 6{,}55$ года.

Шаг 4. Разница: $6{,}64 - 6{,}55 = 0{,}09$ года, то есть примерно месяц, или 1,4% относительной ошибки. Для устной прикидки — прекрасно.

Шаг 5. Но если речь о реальном вкладе, проценты капитализируются в конце года, поэтому удвоение фактически наступит только на 7-м году.

Проверим наш ответ. $1{,}11^6 = 1{,}8704$ — ещё не удвоился. $1{,}11^7 = 2{,}0762$ — уже больше двух ✅

Ответ: точно ≈ 6,64 года; правило 72 даёт 6,55; фактически удвоение произойдёт по итогам 7-го года.


Пример 12 (сложный): популяция описывается моделью $N(t) = 400\,e^{0{,}15t}$ ($t$ в годах). Найди: а) время удвоения; б) через сколько лет популяция достигнет 10 000; в) сколько удвоений произойдёт за это время.

Решение:

а) Время удвоения.

$$T_2 = \frac{\ln 2}{k} = \frac{0{,}693147}{0{,}15} \approx 4{,}62\ \text{года}$$

Правило 72 дало бы $72/15 = 4{,}8$ — завышение на 3,9%. Правило 70 даёт $70/15 = 4{,}67$ — уже гораздо ближе. Для непрерывного роста правильный числитель — именно 69,3, а не 72.

б) Когда $N = 10\,000$?

Шаг 1. Составляем уравнение:

$$400\,e^{0{,}15t} = 10\,000$$

Шаг 2. Делим на 400:

$$e^{0{,}15t} = 25$$

Шаг 3. Берём натуральный логарифм обеих частей:

$$0{,}15t = \ln 25 = 3{,}2188758$$

Шаг 4.

$$t = \frac{3{,}2188758}{0{,}15} \approx 21{,}46\ \text{года}$$

в) Сколько удвоений?

$$\frac{t}{T_2} = \frac{21{,}46}{4{,}62} \approx 4{,}64\ \text{удвоения}$$

Проверим наш ответ. $2^{4{,}64} = e^{4{,}64\cdot 0{,}693147} = e^{3{,}2162} \approx 24{,}9 \approx 25$ ✅ Ровно во столько раз и должна была вырасти популяция ($10\,000/400 = 25$).

Ещё одна проверка через прикидку: рост в 25 раз — это чуть меньше, чем в 32 раза, то есть чуть меньше 5 удвоений. $5\cdot4{,}62 = 23{,}1$ года — наш ответ 21,5 чуть меньше ✅

Ответ: а) $T_2\approx 4{,}62$ года; б) $t \approx 21{,}5$ года; в) ≈ 4,64 удвоения.

Почему это важно

Время удвоения — это язык, на котором люди реально обсуждают экспоненциальные процессы. Никто не говорит «постоянная скорости роста эпидемии равна 0,182 в сутки» — говорят «удваивается каждые четыре дня», и все понимают. Точно так же в ML: никто не пишет «постоянная затухания learning rate равна 0,0513 на эпоху» — пишут «падает вдвое каждые 13,5 эпох». Умение мгновенно переводить $k \leftrightarrow T_2$ и прикидывать удвоение в уме по правилу 72 — это то, что отличает человека, который чувствует масштаб процесса, от того, кто просто подставляет числа в калькулятор.


Закон Ньютона об охлаждении: распад со смещением ☕

Интуиция

Ты налил кофе при 90 °C в комнате с температурой 20 °C. Он остывает. Но остывает он не до нуля — он стремится к 20 °C, к температуре комнаты. Значит, чистая экспонента $T_0e^{-kt}$ здесь не подойдёт: она всегда стремится к нулю.

Ключевая идея, которую Ньютон сформулировал ещё в 1701 году в анонимной заметке в «Philosophical Transactions»: экспоненциально убывает не сама температура, а разность между телом и средой. Чем горячее кофе относительно комнаты, тем быстрее он теряет тепло; когда разность становится маленькой, остывание почти останавливается.

Обозначим $\Delta(t) = T(t) - T_{\text{ср}}$ — «превышение» над средой. Тогда $\Delta$ ведёт себя как обычное радиоактивное вещество: убывает вдвое за фиксированное время.

Определение (закон Ньютона об охлаждении): если тело с начальной температурой $T_0$ помещено в среду с постоянной температурой $T_{\text{ср}}$, то

$$T(t) = T_{\text{ср}} + (T_0 - T_{\text{ср}})\,e^{-kt}$$

где $k > 0$ — коэффициент, зависящий от тела и условий теплообмена.

Как с этим работать практически — три правила:

  • Сначала вычитай среду. Переходи к $\Delta = T - T_{\text{ср}}$, и задача превращается в обычный распад
  • Разность делится вдвое за $\ln 2/k$ — у остывания есть свой «период полураспада»
  • Ответ всегда выше $T_{\text{ср}}$ при остывании и ниже при нагревании; если получилось наоборот — где-то знак потерян

Тот же закон описывает нагрев (кладём холодное в тёплое — тогда $T_0 < T_{\text{ср}}$ и скобка отрицательная), разряд конденсатора, растворение таблетки, выведение лекарства из крови и — да — затухание momentum в оптимизаторе, когда градиенты вдруг стали нулевыми.

Примеры с разбором

Пример 13 (простой): суп с температурой 80 °C стоит в комнате при 22 °C, коэффициент $k = 0{,}05$ мин⁻¹. Какая температура будет через 15 минут?

Решение:

Шаг 1. Начальная разность: $\Delta_0 = 80 - 22 = 58$ °C.

Шаг 2. Через 15 минут разность уменьшится в $e^{0{,}05\cdot 15} = e^{0{,}75}$ раз:

$$\Delta(15) = 58\,e^{-0{,}75} = 58\cdot 0{,}472367 \approx 27{,}4\ \text{°C}$$

Шаг 3. Возвращаем среду обратно:

$$T(15) = 22 + 27{,}4 = 49{,}4\ \text{°C}$$

Проверим наш ответ. «Период полураспада» разности: $\ln 2/0{,}05 = 13{,}86$ мин. За 15 минут разность должна упасть чуть больше чем вдвое: $58/2 = 29$, а у нас 27,4 — чуть меньше ✅

Ответ: ≈ 49,4 °C.


Пример 14 (средний): кофе при 90 °C поставили в комнату при 20 °C. Через 10 минут он остыл до 70 °C. Когда он остынет до 40 °C?

Решение:

Шаг 1. Переходим к разностям:

$$\Delta_0 = 90 - 20 = 70,\qquad \Delta(10) = 70 - 20 = 50,\qquad \Delta_{\text{цель}} = 40 - 20 = 20$$

Шаг 2. Находим $k$ из первого условия:

$$70\,e^{-10k} = 50 \ \Longrightarrow\ e^{-10k} = \frac57 \ \Longrightarrow\ 10k = \ln\frac75$$$$k = \frac{\ln 1{,}4}{10} = \frac{0{,}3364722}{10} \approx 0{,}0336472\ \text{мин}^{-1}$$

Шаг 3. Решаем целевое уравнение:

$$70\,e^{-kt} = 20 \ \Longrightarrow\ e^{-kt} = \frac27 \ \Longrightarrow\ kt = \ln\frac72 = 1{,}2527629$$

Шаг 4.

$$t = \frac{1{,}2527629}{0{,}0336472} \approx 37{,}2\ \text{минуты}$$

Проверим наш ответ. Разность падает вдвое за $\ln 2/k = 0{,}693147/0{,}0336472 = 20{,}6$ минуты. Нам нужно, чтобы разность упала с 70 до 20, то есть в 3,5 раза — это между одним удвоением (в 2 раза, 20,6 мин) и двумя (в 4 раза, 41,2 мин), ближе ко второму. Наши 37,2 минуты попадают точно в этот интервал ✅

Ответ: ≈ 37 минут после того, как кофе поставили.


Пример 15 (сложный): тело обнаружили в комнате при 18 °C. В момент обнаружения его температура была 30 °C, нормальная температура живого тела 36,6 °C. Через сколько часов после обнаружения температура тела опустится до 24 °C, если коэффициент охлаждения таков, что от 36,6 °C до 30 °C тело остывало 2 часа?

Решение:

Шаг 1. Разности от среды:

$$\Delta_0 = 36{,}6 - 18 = 18{,}6;\qquad \Delta(2) = 30 - 18 = 12;\qquad \Delta_{\text{цель}} = 24 - 18 = 6$$

Шаг 2. Находим $k$:

$$e^{-2k} = \frac{12}{18{,}6} = \frac{120}{186} = \frac{20}{31} \approx 0{,}645161$$$$2k = \ln\frac{31}{20} = \ln 1{,}55 = 0{,}4382549 \ \Longrightarrow\ k \approx 0{,}2191275\ \text{ч}^{-1}$$

Шаг 3. Замечаем изящный ход: целевая разность 6 — это ровно половина от 12. То есть от момента «через 2 часа» до цели должно пройти ровно одно время полураспада разности!

$$T_{1/2} = \frac{\ln 2}{k} = \frac{0{,}693147}{0{,}2191275} \approx 3{,}163\ \text{часа}$$

Шаг 4. Общее время от смерти: $t = 2 + 3{,}163 = 5{,}163$ часа. А от момента обнаружения (то есть от отметки 2 часа) пройдёт $3{,}163$ часа.

Проверим наш ответ. Прямой расчёт: $18{,}6\,e^{-0{,}2191275\cdot 5{,}163} = 18{,}6\,e^{-1{,}13146} = 18{,}6\cdot 0{,}32258 = 6{,}0$ ✅ Температура $18 + 6 = 24$ °C ✅

Ответ: ≈ 3,16 часа после обнаружения (или ≈ 5,16 часа с момента, когда температура была 36,6 °C).

Почему это важно

Закон Ньютона учит главному трюку прикладной математики: если процесс стремится не к нулю, а к какому-то уровню — вычти этот уровень и получишь чистую экспоненту. Этот приём переносится буквально всюду. Модель «выручка растёт к насыщению» — вычти потолок. Модель «loss падает к неустранимому уровню (irreducible loss)» — вычти этот уровень, и остаток может оказаться красивой убывающей кривой. Кстати, именно так устроены современные формулы scaling laws: $L(N) = L_\infty + (N_c/N)^\alpha$, где $L_\infty$ — та самая «температура комнаты», ниже которой модель не опустится никогда, сколько параметров ни добавляй.


Затухание сигнала и децибелы 📡

Интуиция

Свет в оптоволокне, радиоволна в воздухе, звук в стене — все они слабеют по одному закону: на каждом одинаковом отрезке пути теряется одинаковая доля мощности. Прошёл километр — осталось, скажем, 95,5%. Ещё километр — 95,5% от того, что было. Классическая экспонента, только вместо времени в показателе — расстояние:

$$P(x) = P_0 e^{-\alpha x}$$

Но инженеры почти никогда не пишут это в таком виде. Они пишут «затухание 0,2 дБ/км». Почему?

Потому что перемножать множители неудобно, а складывать числа — удобно. Если сигнал прошёл участок, ослабевший в 2 раза, потом соединитель, ослабляющий в 1,2 раза, потом ещё участок в 5 раз — общее ослабление $2\cdot1{,}2\cdot5 = 12$ раз. А в децибелах эти потери просто складываются. Децибел — это и есть логарифмическая шкала, специально придуманная, чтобы превращать умножение в сложение (в честь Александра Белла, отсюда «бел», а «деци» — десятая часть бела).

Определение: Уровень мощности в децибелах относительно опорной мощности $P_0$:

$$L = 10\lg\frac{P}{P_0}\ \text{дБ}$$

Ослабление (затухание) в децибелах: $A = 10\lg\dfrac{P_{\text{вход}}}{P_{\text{выход}}}$.

Чтобы читать децибелы «с листа», достаточно запомнить три числа:

  • 3 дБ ≈ в 2 раза (точно: $10\lg 2 = 3{,}0103$) — знаменитое «правило трёх децибел»
  • 10 дБ = в 10 раз (по определению шкалы)
  • 20 дБ = в 100 раз, 30 дБ = в 1000 раз — каждые 10 дБ добавляют порядок

Отсюда мгновенно: 6 дБ ≈ в 4 раза, 13 дБ ≈ в 20 раз, 23 дБ ≈ в 200 раз. Складываешь децибелы — перемножаешь разы.

Связь двух записей. Если затухание $\beta$ дБ/км, то

$$P(x) = P_0\cdot 10^{-\beta x/10} = P_0\,e^{-\alpha x},\qquad \alpha = \frac{\beta\ln 10}{10} \approx 0{,}2303\,\beta$$

А «длина полуослабления» (на которой мощность падает вдвое) равна $\dfrac{10\lg 2}{\beta} = \dfrac{3{,}0103}{\beta}$ км.

Примеры с разбором

Пример 16 (простой): во сколько раз ослабевает сигнал при затухании 20 дБ? А при 43 дБ?

Решение:

Шаг 1. По определению $20 = 10\lg\dfrac{P_{\text{вх}}}{P_{\text{вых}}}$, значит $\lg\dfrac{P_{\text{вх}}}{P_{\text{вых}}} = 2$, то есть отношение равно $10^2 = 100$.

Шаг 2. Для 43 дБ разложим на удобные слагаемые: $43 = 40 + 3$.

$$40\ \text{дБ} \to 10^4 = 10\,000\ \text{раз};\qquad 3\ \text{дБ} \to \approx 2\ \text{раза}$$

Складываем децибелы — перемножаем разы: $10\,000\cdot 2 = 20\,000$ раз.

Проверим наш ответ. Точно: $10^{4{,}3} = 19\,952{,}6$ — наша прикидка 20 000 отличается на 0,2% ✅

Ответ: 20 дБ → в 100 раз; 43 дБ → примерно в 20 000 раз.


Пример 17 (средний): в оптоволокне затухание 0,25 дБ/км. Передатчик даёт 1 мВт, приёмник надёжно работает от 1 мкВт. Какова максимальная длина линии?

Решение:

Шаг 1. Во сколько раз может ослабнуть сигнал: $\dfrac{1\ \text{мВт}}{1\ \text{мкВт}} = \dfrac{10^{-3}}{10^{-6}} = 1000$ раз.

Шаг 2. Переводим в децибелы:

$$A = 10\lg 1000 = 30\ \text{дБ}$$

Шаг 3. Делим бюджет на удельное затухание:

$$L = \frac{30\ \text{дБ}}{0{,}25\ \text{дБ/км}} = 120\ \text{км}$$

Проверим наш ответ. На 120 км затухание $120\cdot0{,}25 = 30$ дБ, мощность на выходе $1\ \text{мВт}\cdot10^{-3} = 1$ мкВт ✅ Ровно на пороге.

Ответ: 120 км.


Пример 18 (сложный): линия связи имеет бюджет 25 дБ. В неё врезаны 4 соединителя, каждый съедает 0,5 дБ. Волокно даёт 0,2 дБ/км. а) Какова максимальная длина? б) На какой длине волокна сигнал слабеет вдвое? в) Запиши затухание в форме $P_0e^{-\alpha x}$.

Решение:

а) Максимальная длина.

Шаг 1. Потери на соединителях: $4\cdot 0{,}5 = 2$ дБ.

Шаг 2. На волокно остаётся: $25 - 2 = 23$ дБ.

Шаг 3. Длина: $L = 23/0{,}2 = 115$ км.

б) Длина полуослабления.

Нужно потерять 3,0103 дБ:

$$x_{1/2} = \frac{3{,}0103}{0{,}2} \approx 15{,}05\ \text{км}$$

То есть каждые примерно 15 километров сигнал слабеет ровно вдвое.

в) Непрерывная форма.

$$\alpha = \frac{0{,}2\cdot\ln 10}{10} = \frac{0{,}2\cdot 2{,}302585}{10} = 0{,}04605\ \text{км}^{-1}$$$$P(x) = P_0\,e^{-0{,}04605\,x}$$

Проверим наш ответ. Проверим пункт (б) через непрерывную форму: $\ln 2/0{,}04605 = 0{,}693147/0{,}04605 = 15{,}05$ км ✅ Совпало. И проверим (а): $P(115)/P_0 = e^{-0{,}04605\cdot115} = e^{-5{,}2958} = 0{,}005012$, то есть ослабление в 199,5 раза = $10\lg 199{,}5 = 23{,}0$ дБ ✅

Ответ: а) 115 км; б) ≈ 15,05 км; в) $P(x) = P_0e^{-0{,}04605x}$, $x$ в км.

Почему это важно

Децибелы — это не «инженерная причуда», а образец инженерного мышления: если величина меняется на много порядков, работай с её логарифмом. Ровно по этой причине в машинном обучении loss рисуют в логарифмической шкале, learning rate подбирают по сетке $10^{-5}, 10^{-4}, 10^{-3}$ (а не $0{,}001; 0{,}002; 0{,}003$), а вероятности в моделях хранят как логарифмы (log_softmax, logsumexp) — иначе произведение тысячи вероятностей мгновенно превратится в машинный ноль. Логарифм превращает умножение в сложение и «сжимает» огромный диапазон в удобный — и децибелы просто самый старый и знаменитый пример этого приёма.


Рост популяций, вирусы, закон Мура — и почему экспонента всегда врёт 🦠

Интуиция

Есть старая индийская легенда. Изобретатель шахмат попросил у раджи скромную награду: одно зерно на первую клетку доски, два на вторую, четыре на третью, и так далее — каждый раз вдвое больше. Раджа расхохотался и согласился. На 64-й клетке потребовалось бы $2^{63}$ зёрен, а всего — $2^{64}-1 \approx 1{,}8\cdot10^{19}$ зёрен, то есть около 500 миллиардов тонн риса — примерно тысяча современных мировых годовых урожаев.

Мораль легенды обычно формулируют как «экспонента растёт невероятно быстро». Но правильная мораль другая и куда полезнее: экспоненциальная модель ломается раньше, чем ты успеваешь дойти до 64-й клетки. Зерна физически нет. Модель была верной первые 20 клеток и стала фантастикой на 40-й.

Ровно то же самое происходит со всеми реальными процессами.

Популяция. Бактерии в чашке Петри удваиваются каждые 20 минут. Одна бактерия за 48 часов дала бы $2^{144}\approx 2{,}2\cdot10^{43}$ клеток — масса больше массы Земли. Реально колония выходит на плато за сутки: кончается питательная среда.

Вирусное распространение. Базовое репродуктивное число $R_0$ — среднее количество людей, которых заражает один больной в полностью восприимчивой популяции. Если $R_0 > 1$, число заражённых растёт как $N_0 R_0^{\,g}$, где $g$ — число поколений заражения. Но популяция конечна: как только значительная доля переболела, «топливо» кончается. Эффективное репродуктивное число $R = R_0\cdot s$, где $s$ — доля ещё восприимчивых, и рост останавливается при $s = 1/R_0$.

Закон Мура. Гордон Мур в 1965 году заметил, что число транзисторов на чипе удваивается примерно каждый год, и в 1975-м скорректировал период до двух лет. Полвека это работало. Но транзистор не может быть меньше атома: постоянная решётки кремния около 0,54 нм, и техпроцессы уже подошли к масштабам в единицы нанометров. Удвоение замедлилось до 2,5–3 лет и продолжает замедляться.

Общий вывод, который надо усвоить намертво:

Чистая экспонента — это модель процесса, у которого есть неограниченный ресурс. Как только ресурс (еда, восприимчивые люди, атомы кремния, рынок, деньги) начинает кончаться — экспонента перестаёт описывать реальность.

Где именно ломается экспонента

Причина всегда одна: у экспоненты относительная скорость роста постоянна. Каждый день прирастает одна и та же доля — скажем, 30%. Реальные системы так себя не ведут: когда популяция приближается к ёмкости среды, относительная скорость падает.

Простейшая правка модели: пусть относительная скорость роста не константа $k$, а убывает линейно по мере заполнения:

$$\text{относительный темп} = k\left(1 - \frac{N}{K}\right)$$

где $K$ — ёмкость среды (потолок). Пока $N \ll K$ — множитель почти 1, растём как экспонента. Когда $N \to K$ — множитель стремится к нулю, рост останавливается. Кривая, которая получается из этого условия, называется логистической.

Определение: Логистическая кривая (кривая Ферхюльста, 1838):

$$N(t) = \frac{K}{1 + A\,e^{-kt}},\qquad A = \frac{K - N_0}{N_0}$$

где $K$ — ёмкость среды, $N_0 = N(0)$, $k$ — начальный темп роста.

Три её ключевых свойства:

  • В начале ($N \ll K$) логистика практически совпадает с экспонентой $N_0e^{kt}$ — на этом участке отличить их по данным почти невозможно
  • В середине кривая проходит через точку перегиба при $N = K/2$, и это происходит в момент $t^* = \dfrac{\ln A}{k}$ — момент максимальной абсолютной скорости роста
  • В конце кривая выходит на плато $N \to K$ снизу, никогда его не превышая

Форма получается S-образной («сигмоида»). И да — это ровно та самая сигмоида $\sigma(z) = \dfrac{1}{1+e^{-z}}$, которая работает функцией активации в нейросетях и превращает логит в вероятность. Логистическая кривая роста популяции и сигмоида в классификаторе — одна и та же функция, просто с разными подстановками.

Практическое правило прогнозиста: экспоненциальная модель даёт ошибку меньше 10%, пока $N < 0{,}1K$. Дальше она начинает систематически завышать, и чем дальше — тем катастрофичнее. Проблема в том, что $K$ обычно неизвестно. Поэтому прогноз «через месяц будет миллион заражённых», построенный экстраполяцией экспоненты, — почти всегда завышен, и вопрос только в том, насколько.

Примеры с разбором

Пример 19 (простой): в очаге 5 заражённых, $R_0 = 3$, средний интервал между поколениями заражения — 6 дней. Сколько заражённых будет через 30 дней при неограниченном росте?

Решение:

Шаг 1. Число поколений: $g = 30/6 = 5$.

Шаг 2. Модель: $N = N_0\,R_0^{\,g} = 5\cdot 3^5$.

Шаг 3. $3^5 = 243$, значит $N = 5\cdot 243 = 1215$.

Шаг 4. Заодно найдём время удвоения. Непрерывная форма: $k = \dfrac{\ln R_0}{T_g} = \dfrac{\ln 3}{6} = \dfrac{1{,}0986123}{6} = 0{,}1831$ сут⁻¹, значит

$$T_2 = \frac{\ln 2}{k} = \frac{0{,}693147}{0{,}1831} \approx 3{,}79\ \text{суток}$$

Проверим наш ответ. За 30 дней должно уложиться $30/3{,}79 = 7{,}92$ удвоения, то есть рост в $2^{7{,}92} = 242$ раза. И правда, $3^5 = 243$ ✅

Ответ: 1215 заражённых; удвоение примерно каждые 3,8 суток.


Пример 20 (средний): в 2010 году топовый процессор содержал около $2\cdot10^9$ транзисторов. Сколько предсказывает закон Мура (удвоение каждые 2 года) на 2030 год? Через сколько лет по этому закону число вырастет в 1000 раз?

Решение:

Шаг 1. Число удвоений с 2010 по 2030: $(2030-2010)/2 = 10$.

Шаг 2. Множитель: $2^{10} = 1024$.

$$N_{2030} = 2\cdot10^9\cdot 1024 = 2{,}048\cdot 10^{12}$$

Два триллиона транзисторов на чипе.

Шаг 3. Рост в 1000 раз — это $\log_2 1000 = \dfrac{\ln 1000}{\ln 2} = \dfrac{6{,}907755}{0{,}693147} \approx 9{,}966$ удвоения.

Шаг 4. Время: $9{,}966\cdot 2 \approx 19{,}9$ года — почти ровно 20 лет.

Шаг 5. А теперь — критика модели. Самые крупные реальные чипы сегодня содержат порядка $10^{11}$ транзисторов, то есть на порядок с лишним меньше предсказания. Причина не в математике, а в физике: транзистор не может быть меньше нескольких атомов кремния. Экспонента, которая полвека работала идеально, упирается в жёсткий физический потолок — классический пример «поломки на длинном горизонте».

Проверим наш ответ. Прикидка $2^{10}\approx 10^3$ ✅ — отсюда сразу видно, что 10 удвоений ≈ рост в 1000 раз, что и подтверждает шаги 3–4.

Ответ: $\approx 2{,}05\cdot10^{12}$ по формуле; в 1000 раз — за ≈ 20 лет; реальность заметно отстаёт от модели.


Пример 21 (сложный): популяция описывается логистической моделью с $K = 10\,000$, $N_0 = 100$, $k = 0{,}3$ сут⁻¹. Найди: а) момент, когда популяция достигнет половины ёмкости; б) значение через 30 суток; в) что предсказала бы на 30 сутки чистая экспонента; г) на каком горизонте обе модели ещё согласуются.

Решение:

Шаг 1. Находим параметр $A$:

$$A = \frac{K - N_0}{N_0} = \frac{10\,000 - 100}{100} = 99$$

Модель: $N(t) = \dfrac{10\,000}{1 + 99\,e^{-0{,}3t}}$.

а) Половина ёмкости, $N = 5000$.

Шаг 2. Подставляем:

$$\frac{10\,000}{1 + 99e^{-0{,}3t}} = 5000 \ \Longrightarrow\ 1 + 99e^{-0{,}3t} = 2 \ \Longrightarrow\ 99e^{-0{,}3t} = 1$$

Шаг 3.

$$e^{-0{,}3t} = \frac{1}{99} \ \Longrightarrow\ 0{,}3t = \ln 99 = 4{,}59512 \ \Longrightarrow\ t \approx 15{,}32\ \text{суток}$$

б) Значение на 30-е сутки.

Шаг 4. $e^{-0{,}3\cdot30} = e^{-9} = 1{,}2341\cdot10^{-4}$.

Шаг 5. $99\cdot 1{,}2341\cdot10^{-4} = 0{,}012218$.

$$N(30) = \frac{10\,000}{1{,}012218} \approx 9879$$

в) Что сказала бы экспонента.

Шаг 6. $N_{\exp}(30) = 100\,e^{0{,}3\cdot30} = 100\,e^{9} = 100\cdot 8103{,}08 \approx 810\,308$.

Экспонента предсказывает в 81 раз больше самой ёмкости среды. Это не «неточность» — это полная потеря связи с реальностью.

г) Где модели ещё согласуются.

Шаг 7. Возьмём $t = 5$:

$$N_{\text{лог}}(5) = \frac{10\,000}{1 + 99e^{-1{,}5}} = \frac{10\,000}{1 + 99\cdot 0{,}22313} = \frac{10\,000}{23{,}090} \approx 433$$$$N_{\exp}(5) = 100\,e^{1{,}5} = 100\cdot 4{,}4817 \approx 448$$

Расхождение всего 3,4%. При $N \approx 0{,}04K$ модели практически неразличимы.

Сведём всё в таблицу:

$t$, сут Логистика Экспонента Расхождение
5 433 448 +3,5%
10 1 687 2 009 +19%
15,3 5 000 9 900 +98%
20 8 030 40 343 ×5,0
30 9 879 810 308 ×82

Проверим наш ответ. Проверим строку $t=10$: $99e^{-3} = 99\cdot 0{,}0497871 = 4{,}9289$; $N = 10\,000/5{,}9289 = 1687$ ✅ И строку $t=20$: $99e^{-6} = 99\cdot 0{,}00247875 = 0{,}24540$; $N = 10\,000/1{,}24540 = 8030$ ✅ Логистика при $t=30$ практически упёрлась в потолок $K = 10\,000$, как и должна ✅

Ответ: а) ≈ 15,3 суток; б) ≈ 9879; в) ≈ 810 000 (бессмыслица, в 81 раз выше ёмкости); г) модели совпадают в пределах нескольких процентов примерно до $t = 5{-}7$ суток, пока $N < 0{,}1K$.

Почему это важно

Это самый практически ценный раздел урока. Каждый раз, когда ты видишь график, уходящий вверх по экспоненте, — от числа пользователей продукта до размера обучающих датасетов — задавай два вопроса: что здесь ресурс и где потолок. Если ресурс не назван, значит модель просто ещё не дошла до места своего слома.

В машинном обучении это работает буквально. Число параметров моделей росло экспоненциально с 2018 по 2021 год — и остановилось, упершись в стоимость и в доступный объём качественных текстовых данных. Кривые обучения (loss от числа шагов) в начале падают почти экспоненциально, а потом выходят на плато — потому что есть неустранимый уровень ошибки, определяемый шумом в данных. Метрика на валидации растёт-растёт и упирается. Логистика — это язык, на котором описывается любое насыщение, и умение вовремя сказать «здесь экспонента кончается» стоит дороже, чем умение её посчитать.


Экспоненты в машинном обучении 🤖

Интуиция

Открой почти любой ML-конфиг — и ты увидишь три экспоненты, лежащие рядом и делающие совершенно разные вещи.

Первая — расписание learning rate. В начале обучения шаг делают большим, чтобы быстро добраться до нужной области, а к концу — маленьким, чтобы аккуратно «сесть» в минимум и не прыгать вокруг него. Самое простое расписание — экспоненциальное затухание:

$$lr_n = lr_0\cdot\gamma^{\,n}$$

где $n$ — номер эпохи (или шага), $\gamma$ чуть меньше единицы: 0,95, 0,99, 0,999. Это буквально радиоактивный распад, только распадается шаг обучения.

Второй популярный вариант — ступенчатое расписание (StepLR): каждые $S$ эпох умножать lr на $\gamma_{\text{step}}$ (обычно 0,1). Это та же экспонента, просто с крупным периодом:

$$lr_n = lr_0\cdot\gamma_{\text{step}}^{\,\lfloor n/S\rfloor}$$

Вторая — экспоненциальное скользящее среднее (EMA). Adam хранит не сам градиент, а его сглаженную историю:

$$m_t = \beta m_{t-1} + (1-\beta)g_t$$

Если раскрыть рекурсию, получится, что градиент, полученный $j$ шагов назад, входит в $m_t$ с весом $(1-\beta)\beta^{\,j}$ — то есть вес старых наблюдений затухает экспоненциально.

Третья — weight decay. Каждый шаг веса дополнительно чуть-чуть уменьшают:

$$w_{n+1} = (1 - \eta\lambda)\,w_n$$

и в отсутствие градиента вес просто экспоненциально сползает к нулю — это регуляризация, мешающая модели «выучить наизусть» тренировочные данные.

Эффективное окно EMA

Разберём вторую экспоненту подробнее, потому что тут людей путает интуиция.

Веса $(1-\beta)\beta^{\,j}$ образуют бесконечную геометрическую последовательность, сумма которой равна ровно 1 (это важно: EMA — честное усреднение). Насколько «глубоко в прошлое» смотрит такое среднее?

Определение: Эффективное окно экспоненциального скользящего среднего с коэффициентом $\beta$ равно

$$W = \frac{1}{1-\beta}$$

а «период полураспада» вклада наблюдения — $h = \dfrac{\ln 2}{\ln(1/\beta)}$.

Стандартные значения из Adam:

$\beta$ Окно $W$ Полураспад $h$ Что это значит
0,9 10 шагов 6,6 шага $\beta_1$: сглаживание направления градиента
0,99 100 шагов 69 шагов промежуточный вариант
0,999 1000 шагов 693 шага $\beta_2$: оценка масштаба градиента

Отсюда, кстати, понятна необходимость коррекции смещения (bias correction) в Adam. На старте $m_0 = 0$, и первые шаги среднее сильно занижено — ведь оно усредняется с нулём. Поправочный множитель $\dfrac{1}{1-\beta^t}$ — снова экспонента, и она заметна дольше, чем кажется: при $\beta = 0{,}999$ даже на 1000-м шаге поправка ещё почти в 1,6 раза.

Scaling laws — это степенной закон, а не экспоненциальный ⚠️

Вот место, где путаница стоит дороже всего.

Loss большой языковой модели в зависимости от числа параметров $N$ описывается формулой вида

$$L(N) = \left(\frac{N_c}{N}\right)^{\alpha},\qquad \alpha \approx 0{,}076$$

Это степенной закон: $L \propto N^{-\alpha}$. Не экспоненциальный $L \propto e^{-\alpha N}$. Разница гигантская.

Ключевое различие:

  • У экспоненты постоянный прирост аргумента даёт постоянный множитель отклика. Добавил ещё миллиард параметров — loss упал вдвое; добавил ещё миллиард — ещё вдвое
  • У степенного закона постоянное отношение аргументов даёт постоянный множитель отклика. Удвоил число параметров — loss упал на 5%; ещё удвоил — ещё на 5%

Экспонента «платит» линейно, степенной закон — мультипликативно. Именно поэтому обучение фронтирных моделей дорожает так стремительно: чтобы получить фиксированное улучшение, надо каждый раз умножать бюджет, а не прибавлять к нему.

Как отличить их по данным, если у тебя есть только точки на графике:

  • Постройте $\ln L$ против $\ln N$ (log-log). Прямая → степенной закон, наклон = $-\alpha$
  • Постройте $\ln L$ против $N$ (semi-log). Прямая → экспоненциальный закон

Это же и есть практический тест, который стоит проводить всегда, прежде чем экстраполировать.

И ещё одно наблюдение, из-за которого путаница живуча. Вычислительный бюджет обучения рос экспоненциально по времени (удвоение каждые несколько месяцев), а loss падает степенным образом по бюджету. Подставим одно в другое: если $C(t) = C_0e^{gt}$ и $L \propto C^{-\alpha}$, то

$$L(t) \propto \left(C_0e^{gt}\right)^{-\alpha} = \text{const}\cdot e^{-\alpha g\,t}$$

То есть во времени loss действительно падает экспоненциально — но только пока продолжается экспоненциальный рост бюджета. Как только вычисления перестают удваиваться, красивая экспонента по времени мгновенно исчезает, а суровый степенной закон по ресурсу остаётся. Ровно та же история, что с законом Мура.

Примеры с разбором

Пример 22 (простой): ExponentialLR с $lr_0 = 0{,}01$ и $\gamma = 0{,}9$. Чему равен learning rate после 20 эпох и во сколько раз он упал?

Решение:

Шаг 1. Формула: $lr_{20} = 0{,}01\cdot 0{,}9^{20}$.

Шаг 2. Считаем степень пошагово:

$$0{,}9^2 = 0{,}81,\quad 0{,}9^4 = 0{,}6561,\quad 0{,}9^5 = 0{,}59049,\quad 0{,}9^{10} = 0{,}34868,\quad 0{,}9^{20} = 0{,}12158$$

Шаг 3. $lr_{20} = 0{,}01\cdot 0{,}12158 = 1{,}216\cdot10^{-3}$.

Шаг 4. Упал в $1/0{,}12158 \approx 8{,}2$ раза.

Проверим наш ответ. Полураспад: $\ln 2/\ln(1/0{,}9) = 0{,}693147/0{,}105361 = 6{,}58$ эпохи. За 20 эпох — три полураспада, то есть примерно в 8 раз ✅

Ответ: $lr_{20} \approx 0{,}00122$, падение в 8,2 раза.


Пример 23 (средний): $lr_0 = 0{,}1$, $\gamma = 0{,}95$ за эпоху. На какой эпохе learning rate впервые станет меньше $0{,}001$? Сколько эпох понадобилось бы при $\gamma = 0{,}99$?

Решение:

Шаг 1. Условие: $0{,}1\cdot 0{,}95^{\,n} < 0{,}001$, то есть $0{,}95^{\,n} < 0{,}01$.

Шаг 2. Логарифмируем. Внимание на знак: $\ln 0{,}95 < 0$, поэтому при делении неравенство переворачивается:

$$n\ln 0{,}95 < \ln 0{,}01 \ \Longrightarrow\ n > \frac{\ln 0{,}01}{\ln 0{,}95} = \frac{-4{,}605170}{-0{,}051293} = 89{,}78$$

Шаг 3. Значит первое целое $n = 90$.

Шаг 4. Проверим границу честно:

$$0{,}95^{89} = e^{-89\cdot0{,}051293} = e^{-4{,}5651} = 0{,}010423 \ \Rightarrow\ lr = 1{,}042\cdot10^{-3} > 10^{-3}$$$$0{,}95^{90} = e^{-4{,}6164} = 0{,}009902 \ \Rightarrow\ lr = 9{,}902\cdot10^{-4} < 10^{-3}\ ✅$$

Шаг 5. Для $\gamma = 0{,}99$:

$$n > \frac{\ln 0{,}01}{\ln 0{,}99} = \frac{-4{,}605170}{-0{,}010050} = 458{,}2 \ \Longrightarrow\ n = 459$$

Шаг 6. Полезное сравнение. Изменение $\gamma$ с 0,95 на 0,99 — на вид «мелочь», четыре сотых. А число эпох до того же порога выросло в 5,1 раза. Это типичная ловушка гиперпараметров: чувствительность к $\gamma$ огромная, потому что $\gamma$ сидит в основании степени.

Ответ: при $\gamma = 0{,}95$ — эпоха 90; при $\gamma = 0{,}99$ — эпоха 459.


Пример 24 (средний): в Adam используется $\beta_2 = 0{,}999$. Найди эффективное окно, период полураспада вклада градиента, величину bias-correction на шагах 100 и 1000 и номер шага, после которого коррекцией можно пренебречь (менее 1%).

Решение:

Шаг 1. Эффективное окно.

$$W = \frac{1}{1-\beta_2} = \frac{1}{0{,}001} = 1000\ \text{шагов}$$

Шаг 2. Период полураспада вклада. Вес наблюдения давности $j$ пропорционален $\beta_2^{\,j}$:

$$h = \frac{\ln 2}{\ln(1/0{,}999)} = \frac{0{,}693147}{0{,}0010005} \approx 692{,}8\ \text{шага}$$

То есть градиент, полученный ~693 шага назад, влияет вдвое слабее свежего.

Шаг 3. Коррекция на шаге 100.

$$\beta_2^{100} = e^{100\cdot\ln 0{,}999} = e^{-0{,}10005} = 0{,}904787$$$$1 - \beta_2^{100} = 0{,}095213 \ \Longrightarrow\ \text{множитель коррекции} = \frac{1}{0{,}095213} \approx 10{,}5$$

На сотом шаге сырая оценка занижена более чем в десять раз!

Шаг 4. Коррекция на шаге 1000.

$$\beta_2^{1000} = e^{-1{,}0005} = 0{,}367695;\qquad 1-\beta_2^{1000} = 0{,}632305 \ \Longrightarrow\ \text{множитель} \approx 1{,}582$$

Шаг 5. Когда коррекция меньше 1%? Нужно $\beta_2^{\,t} < 0{,}01$:

$$t > \frac{\ln 0{,}01}{\ln 0{,}999} = \frac{-4{,}605170}{-0{,}0010005} = 4602{,}4 \ \Longrightarrow\ t = 4603$$

Проверим наш ответ. Шаг 4603 — это $4603/692{,}8 = 6{,}64$ периода полураспада, а $2^{-6{,}64} \approx 0{,}01$ ✅ Всё сходится (и это ровно те же 6,64 периода, что мы получали в задаче про стронций — приятное совпадение, показывающее, что математика одна).

Ответ: $W = 1000$; $h \approx 693$ шага; коррекция ×10,5 на шаге 100 и ×1,58 на шаге 1000; пренебречь можно примерно с шага 4600.


Пример 25 (сложный): scaling law $L(N) = (N_c/N)^{0{,}076}$. а) На сколько процентов упадёт loss при удвоении числа параметров? б) Во сколько раз надо увеличить $N$, чтобы loss упал на 10%? в) Во сколько раз — чтобы упал вдвое? г) Как выглядели бы ответы, если бы закон был экспоненциальным?

Решение:

а) Удвоение $N$.

Шаг 1. Отношение loss:

$$\frac{L(2N)}{L(N)} = \left(\frac{N}{2N}\right)^{0{,}076} = 2^{-0{,}076}$$

Шаг 2. $2^{-0{,}076} = e^{-0{,}076\cdot 0{,}693147} = e^{-0{,}0526792} = 0{,}948684$.

Loss падает на $1 - 0{,}9487 = 5{,}13\%$.

б) Падение loss на 10% (в 0,9 раза).

Шаг 3. Пусть $N$ надо умножить на $x$. Тогда

$$x^{-0{,}076} = 0{,}9 \ \Longrightarrow\ -0{,}076\ln x = \ln 0{,}9 \ \Longrightarrow\ \ln x = \frac{-\ln 0{,}9}{0{,}076} = \frac{0{,}1053605}{0{,}076} = 1{,}386322$$

Шаг 4. $x = e^{1{,}386322} = 4{,}00$.

Красивый результат: чтобы срезать 10% loss, нужно вчетверо больше параметров.

в) Падение loss вдвое.

Шаг 5.

$$\ln x = \frac{\ln 2}{0{,}076} = \frac{0{,}693147}{0{,}076} = 9{,}12036 \ \Longrightarrow\ x = e^{9{,}12036} \approx 9140$$

Модель должна вырасти примерно в девять тысяч раз. Была модель на 7 миллиардов параметров — понадобится 64 триллиона.

Шаг 6. Тот же ответ через удвоения: одно удвоение даёт множитель $0{,}9487$, нужно $m$ удвоений, чтобы $0{,}9487^m = 0{,}5$:

$$m = \frac{\ln 0{,}5}{\ln 0{,}948684} = \frac{-0{,}693147}{-0{,}0526792} = 13{,}158$$$$x = 2^{13{,}158} = 2^{13}\cdot 2^{0{,}158} = 8192\cdot 1{,}1157 \approx 9140\ ✅$$

г) Если бы закон был экспоненциальным.

Шаг 7. Пусть $L = L_0e^{-cN}$. Тогда падение вдвое требует фиксированной прибавки $\Delta N = \dfrac{\ln 2}{c}$ — одной и той же каждый раз. Первое удешевление и сотое стоили бы одинаково.

Шаг 8. Экономический смысл разницы: при степенном законе каждое следующее улучшение loss на одну и ту же величину требует умножения бюджета на постоянный коэффициент — то есть экспоненциально растущих затрат. При экспоненциальном законе затраты росли бы линейно. Именно поэтому прогресс упирается в деньги, а не в идеи.

Проверим наш ответ. Проверим (б) обратной подстановкой: $4^{-0{,}076} = e^{-0{,}076\cdot 1{,}386294} = e^{-0{,}1053584} = 0{,}90000$ ✅ Ровно 0,9.

Ответ: а) −5,13%; б) в 4 раза; в) примерно в 9140 раз; г) экспоненциальный закон требовал бы одинаковой добавки параметров на каждое удвоение качества, а не одинакового множителя.


Пример 26 (сложный): в AdamW используется decoupled weight decay: $w_{n+1} = (1-\eta\lambda)w_n$ (плюс градиентная часть). При $\eta = 0{,}05$ и $\lambda = 0{,}002$ найди: а) через сколько шагов вес уменьшится вдвое, если градиент по нему нулевой; б) во сколько раз он уменьшится за 10 000 шагов; в) какое $\lambda$ нужно, чтобы полураспад составлял 2000 шагов?

Решение:

Шаг 1. Множитель за шаг:

$$1 - \eta\lambda = 1 - 0{,}05\cdot 0{,}002 = 1 - 0{,}0001 = 0{,}9999$$

а) Полураспад.

Шаг 2.

$$0{,}9999^{\,n} = 0{,}5 \ \Longrightarrow\ n = \frac{\ln 0{,}5}{\ln 0{,}9999} = \frac{-0{,}693147}{-0{,}000100005} \approx 6931\ \text{шаг}$$

Шаг 3. Удобное приближение: при малом $\eta\lambda$ работает $\ln(1-\eta\lambda)\approx -\eta\lambda$, поэтому

$$n_{1/2}\approx\frac{\ln 2}{\eta\lambda} = \frac{0{,}693147}{0{,}0001} = 6931{,}5$$

Приближение сошлось с точным ответом до четвёртого знака.

б) За 10 000 шагов.

Шаг 4.

$$0{,}9999^{10\,000} = e^{10\,000\cdot(-0{,}000100005)} = e^{-1{,}00005} \approx 0{,}36786$$

Вес упадёт до 36,8% — то есть ровно в $e$ раз. Это не совпадение: при $\eta\lambda\cdot n = 1$ множитель всегда $\approx 1/e$.

в) Подбор $\lambda$ под заданный полураспад.

Шаг 5.

$$\frac{\ln 2}{\eta\lambda} = 2000 \ \Longrightarrow\ \eta\lambda = \frac{0{,}693147}{2000} = 3{,}4657\cdot10^{-4}$$$$\lambda = \frac{3{,}4657\cdot10^{-4}}{0{,}05} = 6{,}93\cdot10^{-3} \approx 0{,}0069$$

Проверим наш ответ. $(1 - 0{,}05\cdot 0{,}0069)^{2000} = (1-3{,}465\cdot10^{-4})^{2000} = e^{2000\cdot(-3{,}4656\cdot10^{-4})} = e^{-0{,}69312} \approx 0{,}5$ ✅

Ответ: а) ≈ 6931 шаг; б) до 36,8% (в $e$ раз); в) $\lambda \approx 0{,}0069$.

Почему это важно

Тут стоит остановиться и оценить, что произошло. Мы взяли ровно ту же формулу, которой считали банковский вклад и возраст мамонта, и не меняя в ней ни одного символа посчитали номер эпохи, когда обучение фактически замрёт; глубину памяти оптимизатора; силу регуляризации. Не потому, что «математика везде» — а потому, что все эти процессы устроены одинаково: каждый шаг умножает величину на одно и то же число.

Практическая польза совершенно конкретная. Умея за десять секунд прикинуть $n = \ln(\text{порог})/\ln\gamma$, ты сразу видишь, что конфиг с $\gamma = 0{,}99$ на 30 эпох вообще ничего не затухнет ($0{,}99^{30} = 0{,}74$ — lr упал всего на четверть), а с $\gamma = 0{,}9$ на 200 эпох модель перестанет учиться после первой сотни. Это экономит часы GPU-времени и избавляет от расследований «почему loss встал на плато».


Практика: 30 заданий

Базовые (задания 1-10)

Задание 1: На вклад положили 50 000 ₽ под 10% годовых со сложным процентом. Сколько будет на счету через 3 года?


Задание 2: Период полураспада йода-131 равен 8 суткам. Сколько останется от 40 г через 24 суток?


Задание 3: Дана модель $N(t) = 100\cdot 2^{t/5}$, где $t$ — время в часах. Найди $N(15)$.


Задание 4: В образце древесины осталось 25% исходного углерода-14. Период полураспада $^{14}\mathrm{C}$ — 5730 лет. Каков возраст образца?


Задание 5: Оцени по правилу 72, за сколько лет удвоится вклад под 6% годовых. Затем посчитай точно и сравни.


Задание 6: Расписание learning rate задано формулой $lr_n = 0{,}2\cdot 0{,}5^{\,n}$, где $n$ — число выполненных понижений. Чему равен $lr$ после четвёртого понижения?


Задание 7: Величина растёт по закону $N(t) = N_0e^{0{,}05t}$, где $t$ — годы. Во сколько раз она вырастет за 20 лет?


Задание 8: Мощность сигнала ослабла в 1000 раз. Сколько это децибел?


Задание 9: Бактерии удваиваются каждые 20 минут. Сейчас их 500. Сколько будет через 2 часа?


Задание 10: В оптимизаторе используется экспоненциальное скользящее среднее с $\beta = 0{,}98$. Найди эффективное окно и период полураспада вклада наблюдения.


Средние (задания 11-20)

Задание 11: За сколько лет вклад под 7% годовых вырастет в 3 раза? Дай точный ответ и число полных лет.


Задание 12: В археологической находке сохранилось 30% исходного количества $^{14}\mathrm{C}$. Определи возраст ($T = 5730$ лет).


Задание 13: Чай при 95 °C остывает в комнате при 25 °C. Через 5 минут его температура 80 °C. Какой она будет через 20 минут от начала?


Задание 14: ExponentialLR с $lr_0 = 0{,}1$ и $\gamma = 0{,}98$. На какой эпохе learning rate впервые станет меньше $0{,}01$?


Задание 15: В 1971 году процессор Intel 4004 содержал 2300 транзисторов. Что предсказывает закон Мура (удвоение каждые 2 года) на 2021 год?


Задание 16: В очаге 20 заражённых, базовое репродуктивное число $R_0 = 1{,}8$, интервал между поколениями заражения 4 дня. Сколько заражённых будет через 24 дня? Найди также время удвоения.


Задание 17: Банк предлагает 8% годовых. Что выгоднее — годовая или ежеквартальная капитализация? Посчитай разницу на сумме 200 000 ₽ за один год.


Задание 18: Оптическое волокно имеет затухание 0,35 дБ/км. а) На какой длине сигнал ослабнет ровно вдвое? б) Какова максимальная длина линии при бюджете 21 дБ?


Задание 19: В EMA с $\beta = 0{,}9$ вклад градиента затухает как $\beta^{\,j}$. Через сколько шагов вклад станет меньше 1% от первоначального?


Задание 20: Логистическая модель: $K = 1000$, $N_0 = 50$, $k = 0{,}4$ сут⁻¹. а) Когда популяция достигнет 500? б) Чему равна популяция на 10-е сутки?


Продвинутые (задания 21-30)

Задание 21: За 3 часа от препарата осталось 40% исходного количества. Найди период полураспада.


Задание 22: Банк A предлагает 10% годовых с годовой капитализацией, банк B — 9,6% годовых с ежемесячной. Какой вклад выгоднее? Посчитай разницу на 500 000 ₽ за год.


Задание 23: В образце содержание $^{14}\mathrm{C}$ в 4,2 раза меньше, чем в живой ткани. Определи возраст образца ($T = 5730$ лет).


Задание 24: Печь выключили в 12:00, её температура была 220 °C. В 12:30 она остыла до 120 °C. Температура цеха 20 °C. Когда печь остынет до 40 °C?


Задание 25: У стартапа 5000 пользователей, база растёт на 12% в месяц. Ёмкость рынка — 2 000 000 человек. а) Когда наивная экспоненциальная модель предсказывает захват всего рынка? б) Когда логистическая модель с тем же начальным темпом даст половину рынка? в) Насколько модели расходятся на 36-м месяце?


Задание 26: Scaling law по объёму данных: $L(D) = (D_c/D)^{0{,}095}$. а) Во сколько раз надо увеличить датасет, чтобы loss упал на 20%? б) Если объём доступных данных растёт на 40% в год, сколько лет на это уйдёт?


Задание 27: В SGD с weight decay вес без градиента меняется как $w_{n+1} = (1-\eta\lambda)w_n$. При $\eta = 0{,}01$ подбери $\lambda$ так, чтобы за 50 000 шагов вес уменьшился в 100 раз. Найди также период полураспада веса.


Задание 28: Вычислительный бюджет обучения передовых моделей одно время удваивался каждые 3,4 месяца. а) За какое время он вырос бы в 1000 раз? б) Во сколько раз за то же время вырос бы показатель, подчиняющийся закону Мура (удвоение за 24 месяца)? в) Во сколько раз одно опережает другое?


Задание 29: Капитал растёт на 15% в год, инфляция составляет 8% в год. а) Каков реальный годовой рост покупательной способности? б) За сколько лет она удвоится? в) Насколько ошибётся наивный расчёт «15% − 8% = 7%»?


Задание 30: В образце смешаны два изотопа: по 100 г каждого. У изотопа A период полураспада 2 суток, у изотопа B — 10 суток. а) Через сколько суток масса A составит 10% от массы B? б) Во сколько раз масса B будет больше массы A через 20 суток?


Частые ошибки

Ошибка 1: складывать проценты вместо перемножения множителей

Неправильно: «Вклад под 5% годовых за 10 лет вырастет на $5\cdot10 = 50\%$». Или: «Акция упала на 50%, потом выросла на 50% — вернулась обратно».

Правильно: множители перемножаются. За 10 лет под 5%: $1{,}05^{10} = 1{,}6289$, то есть рост на 62,9%, а не на 50%. Падение и рост на 50%: $0{,}5\cdot 1{,}5 = 0{,}75$ — итог минус 25%, а не ноль.

Почему важно: это фундаментальное свойство мультипликативных процессов, и оно ломает интуицию во всех задачах сразу. Ошибка растёт с горизонтом: за 30 лет под 5% «сложение» даст 150%, а реальность — 332%. Тот же принцип в ML: если ты понижаешь lr на 10% каждую эпоху, за 20 эпох он упадёт не на 200% (что бессмысленно), а до $0{,}9^{20} = 12{,}2\%$ от исходного.


Ошибка 2: путать процент за период с непрерывной ставкой $k$

Неправильно: «Рост 20% в год, значит модель $N = N_0e^{0{,}2t}$».

Правильно: это две разные вещи. Если рост дискретный, 20% раз в год — модель $N = N_0\cdot 1{,}2^{\,t}$, и её непрерывный эквивалент — $N = N_0e^{kt}$ с $k = \ln 1{,}2 = 0{,}1823$, а не $0{,}2$. Наоборот, если дана непрерывная ставка $k = 0{,}2$, то фактический годовой прирост равен $e^{0{,}2} - 1 = 22{,}14\%$, а не 20%.

Почему важно: при малых ставках разница мала ($k = 0{,}0488$ против 5% — расхождение 2,4%), но при больших она взрывается: для 100% годовых $k = \ln 2 = 0{,}693$, а $e^{1{,}0} = 2{,}718$ — это уже рост в 2,7 раза вместо 2. Та же путаница живёт в финансах под названием «номинальная ставка против эффективной»: 12% с ежемесячной капитализацией — это на самом деле 12,683% за год.


Ошибка 3: считать, что за два периода полураспада вещество исчезнет полностью

Неправильно: «Период полураспада 8 суток, значит за 16 суток вещества не останется».

Правильно: за каждый период остаётся половина от того, что было, а не «уходит половина исходного». За 2 периода останется $1/4$, за 3 — $1/8$, за 10 — примерно $1/1000$. Формально $N$ никогда не обращается в ноль: показательная функция положительна при любом $t$.

Почему важно: отсюда практическое правило радиационной безопасности «10 периодов — и источник практически безопасен» (осталась тысячная доля). И та же логика в ML: сколько бы эпох ни прошло, ExponentialLR никогда не сделает lr равным нулю — он просто станет неразличимо малым. Если тебе нужен именно ноль, нужен другой планировщик.


Ошибка 4: делить вместо логарифмирования

Неправильно: «$2^{t/5} = 40$, значит $t/5 = 20$, потому что $40/2 = 20$».

Правильно: неизвестное сидит в показателе, и достать его оттуда можно только логарифмом:

$$\frac{t}{5} = \log_2 40 = \frac{\ln 40}{\ln 2} = \frac{3{,}6888795}{0{,}6931472} = 5{,}3219 \ \Longrightarrow\ t = 26{,}61$$

Почему важно: это самая механическая из ошибок, и её легко поймать проверкой. Подставь свой ответ обратно: $2^{20} = 1\,048\,576$ — очевидно не 40. Всегда прогоняй обратную подстановку хотя бы приблизительно; в задачах на рост порядок величины сразу выдаёт ошибку.


Ошибка 5: экстраполировать чистую экспоненту на длинный горизонт

Неправильно: «Число пользователей растёт на 12% в месяц, значит через 5 лет их будет $5000\cdot 1{,}12^{60} = 4{,}6$ млн» — при том, что весь рынок составляет 2 млн человек.

Правильно: экспонента описывает процесс только пока ресурс не ограничивает рост. Как только величина приближается к ёмкости $K$, нужна логистическая модель

$$N(t) = \frac{K}{1+Ae^{-kt}},\qquad A = \frac{K-N_0}{N_0}$$

Практическая граница: пока $N < 0{,}1K$, экспонента ошибается меньше чем на 10%; дальше расхождение растёт стремительно.

Почему важно: это ошибка не арифметическая, а модельная — и потому самая дорогая. Экспоненциальные прогнозы «через месяц будет миллион заражённых», «через пять лет модели вырастут в тысячу раз», «выручка удвоится ещё десять раз подряд» — почти всегда завышены. Прежде чем экстраполировать, назови ресурс и оцени потолок. Если ресурс не назван — модель ещё просто не дошла до места своего слома.


Ошибка 6: путать степенной закон с экспоненциальным

Неправильно: «Loss падает по scaling law, то есть экспоненциально по числу параметров».

Правильно: scaling laws — это степенной закон $L \propto N^{-\alpha}$, а не экспоненциальный $L\propto e^{-\alpha N}$. У степенного закона постоянный множитель отклика даёт постоянное отношение аргументов (удвоил $N$ — срезал 5% loss), у экспоненциального — постоянную добавку к аргументу.

Почему важно: от этого зависит вся экономика проекта. При степенном законе каждое следующее одинаковое улучшение требует умножения бюджета на постоянный коэффициент — затраты растут экспоненциально. Проверить, какой у тебя закон, можно за две минуты: построй $\ln y$ против $\ln x$ (прямая → степенной) и $\ln y$ против $x$ (прямая → экспоненциальный).


Ошибка 7: не согласовать единицы времени и период

Неправильно: «$k = 0{,}05$ в сутки, прошло 12 часов, значит $e^{-0{,}05\cdot 12}$». Или: «12% годовых, капитализация ежемесячная — значит $(1+0{,}12)^{12}$».

Правильно: в первом случае 12 часов — это 0,5 суток, и надо считать $e^{-0{,}05\cdot 0{,}5}$. Во втором ставку тоже надо привести к периоду: $(1+0{,}12/12)^{12} = 1{,}01^{12}$.

Почему важно: ошибка в единицах не даёт «немного другой» ответ — она даёт ответ, отличающийся на порядки. $(1{,}12)^{12} = 3{,}896$ вместо $1{,}127$ — это разница в 3,5 раза. Возьми за правило: первым делом выписывай, в каких единицах измеряется $t$, и приводи к ним всё остальное.


Ошибка 8: забыть вычесть температуру среды в законе Ньютона

Неправильно: «Кофе 90 °C остывает, через 10 минут 70 °C, значит множитель $70/90 = 0{,}778$ за 10 минут».

Правильно: экспоненциально убывает разность с температурой среды. При комнате 20 °C: $\Delta_0 = 70$, $\Delta(10) = 50$, множитель $50/70 = 0{,}714$ — совсем другое число.

Почему важно: без вычитания среды модель предсказывает остывание до абсолютного нуля, что физически невозможно. И это общий приём: если процесс стремится не к нулю, а к какому-то уровню — вычти этот уровень, и получишь чистую экспоненту. Тот же ход применяется к формулам вида $L(N) = L_\infty + (N_c/N)^\alpha$, где $L_\infty$ — неустранимый уровень ошибки.


Главное запомнить

  1. Единая модель. Всё, что растёт или убывает пропорционально самому себе, описывается формулой $N(t) = N_0a^{t/T} = N_0e^{kt}$, где $N_0$ — начальное значение, $a$ — множитель за период $T$, $k$ — непрерывный темп.

  2. Перевод между записями. $k = \dfrac{\ln a}{T}$ и $T = \dfrac{\ln a}{k}$. При процентной ставке $p$% за период $a = 1+\dfrac{p}{100}$, а $k = \ln\left(1+\dfrac{p}{100}\right)$ — не $p/100$!

  3. Обратная задача решается логарифмом. $t = T\cdot\dfrac{\ln(N/N_0)}{\ln a}$ или $t = \dfrac{1}{k}\ln\dfrac{N}{N_0}$. Время зависит только от отношения $N/N_0$, а не от самих чисел.

  4. Время удвоения: $T_2 = \dfrac{\ln 2}{k} \approx \dfrac{0{,}693}{k}$. Время полураспада — та же формула с $|k|$: $T_{1/2} = \dfrac{\ln 2}{|k|}$.

  5. Правило 72: удвоение при ставке $p$% за период происходит примерно за $\dfrac{72}{p}$ периодов. Ошибка меньше 1% при $p$ от 4 до 12; для непрерывного роста точнее правило 70 (а строго — 69,3).

  6. Сложный процент и капитализация. $S(t) = S_0\left(1+\dfrac{r}{m}\right)^{mt}$, эффективная годовая ставка $= \left(1+\dfrac{r}{m}\right)^m - 1$. При $m\to\infty$ получается предел $e^{r}$ — сравнивать вклады нужно по эффективной ставке, а не по номинальной.

  7. Период полураспада не зависит ни от начального количества, ни от прошедшего времени. За 2 периода остаётся $1/4$, за 3 — $1/8$, за 10 — примерно $1/1000$. Полностью вещество не исчезает никогда.

  8. Закон Ньютона об охлаждении: $T(t) = T_{\text{ср}} + (T_0-T_{\text{ср}})e^{-kt}$. Сначала вычти среду — дальше обычный распад. Общий приём для любого процесса с ненулевым пределом.

  9. Децибелы: $L = 10\lg\dfrac{P}{P_0}$; 3 дБ ≈ вдвое, 10 дБ = в 10 раз, 20 дБ = в 100 раз. Децибелы складываются там, где разы перемножаются.

  10. Экспонента всегда врёт на длинном горизонте. Реальные процессы описываются логистикой $N(t) = \dfrac{K}{1+Ae^{-kt}}$, $A = \dfrac{K-N_0}{N_0}$; половина ёмкости достигается при $t^*=\dfrac{\ln A}{k}$. Экспонента годна, пока $N < 0{,}1K$.

  11. Степенной закон $\ne$ экспоненциальный. Scaling laws $L\propto N^{-\alpha}$ — степенные: постоянное отношение аргументов даёт постоянный множитель отклика. При $\alpha = 0{,}076$ удвоение $N$ срезает 5% loss, а падение loss вдвое требует роста $N$ примерно в 9000 раз.

  12. Полезные константы наизусть: $\ln 2 \approx 0{,}693$; $\ln 10 \approx 2{,}303$; $\log_2 10 \approx 3{,}322$; $2^{10} = 1024\approx 10^3$; $e \approx 2{,}718$; $10\lg 2 \approx 3{,}01$.


Связь с другими темами курса

Что было до этого. Этот урок — прямое приложение трёх предыдущих больших блоков. Показательная функция и её свойства дали саму модель $a^{t/T}$: монотонность, положительность, правила действий со степенями. Логарифмы (уроки 116–122) дали инструмент обратного хода — без них уравнение $a^{t/T} = b$ вообще нерешаемо аналитически, а именно оно возникает в 90% прикладных задач. Показательные и логарифмические уравнения (123–124) дали технику: приведение к одному основанию, логарифмирование обеих частей, переход к новой переменной. Здесь всё это встретилось в задачах с реальными числами и единицами измерения.

Что дальше. Следующий урок — последовательности (126), а за ним геометрическая прогрессия (128), которая и есть дискретная версия экспоненты: $b_n = b_1q^{n-1}$ — это ровно наш $N_0a^{t/T}$ при целых значениях $t/T$. Вклад со сложным процентом буквально образует геометрическую прогрессию по годам. Дальше в курсе появится понятие предела (129) — и предел $\left(1+\frac1m\right)^m$ при $m\to\infty$ строго определит число $e$, которое мы пока брали как готовую константу. В уроке 133 придёт производная, и окажется, что экспонента — единственная функция, у которой скорость изменения пропорциональна самому значению; это объяснит, почему все процессы «пропорциональные самим себе» описываются именно ей. А в уроках 223–225 (дифференциальные уравнения) ты научишься не подставлять готовую формулу, а выводить её из условия «скорость роста пропорциональна количеству» — и получишь тот же $N_0e^{kt}$ как решение.

Где это применяется в жизни и в ML/данных:

📊 В машинном обучении: расписания learning rate (ExponentialLR, StepLR), экспоненциальное скользящее среднее в Adam/RMSProp и его эффективное окно $1/(1-\beta)$, bias correction, weight decay в AdamW, EMA-копия весов модели для инференса, экспоненциальное сглаживание метрик в логах.

📈 В data science: экспоненциальное сглаживание рядов (Holt-Winters), кривые удержания пользователей (retention), оценка half-life интереса к контенту, логистическая регрессия (та же сигмоида), S-образные кривые принятия продукта.

💰 В финансах: сложный процент, эффективная ставка, дисконтирование будущих денежных потоков, реальная доходность с поправкой на инфляцию, амортизация.

🔬 В физике и химии: радиоактивный распад и датирование, разряд конденсатора, закон Бугера — Ламберта — Бера для поглощения света, кинетика реакций первого порядка, барометрическая формула.

🏥 В медицине и биологии: период полувыведения лекарства, рост колоний, эпидемиологические модели с $R_0$, фармакокинетика дозирования.

📡 В связи: затухание в кабеле и волокне, бюджет линии, децибелы, отношение сигнал/шум.


Интересные факты

💡 Правилу 72 больше 500 лет, и придумал его бухгалтер. Лука Пачоли записал его в 1494 году в «Summa de arithmetica» — за 120 лет до изобретения логарифмов. То есть правило существовало и работало, хотя объяснить его никто не мог: для этого нужны были и $\ln 2$, и разложение $\ln(1+r)$. Пачоли просто зафиксировал приём, которым купцы пользовались на практике. Забавно, что число 72 оказалось точным именно для 8% — типичной доходности венецианской торговли того времени.

💡 Ядерные испытания создали «бомбовый пик» и подарили биологам машину времени. В 1950-х годах атмосферные ядерные испытания почти удвоили содержание $^{14}\mathrm{C}$ в атмосфере, а после Договора о запрете испытаний 1963 года концентрация начала экспоненциально падать. Этот резкий всплеск с известной формой кривой позволил датировать современные образцы с точностью до года. Шведский исследователь Йонас Фризен использовал его, чтобы измерить возраст клеток человеческого тела: оказалось, что клетки коры головного мозга ровесники самого человека, а клетки кишечника обновляются за считанные дни.

💡 Бернулли не смог посчитать своё собственное число. Задав в 1683 году вопрос про непрерывное начисление процентов, Якоб Бернулли доказал, что предел $\left(1+\frac1m\right)^m$ существует и лежит между 2 и 3, — но точное значение вычислить не сумел. Число получило имя и обозначение только через полвека, у Эйлера. Сегодня $e = 2{,}718281828\ldots$ вычислено на триллионы знаков, и первые из них легко запомнить по подсказке «2,7 — и дважды 1828, год рождения Льва Толстого».

💡 Закон Мура — не закон природы, а самосбывающееся пророчество. Гордон Мур в 1965 году построил экстраполяцию всего по пяти точкам данных и предсказал ежегодное удвоение; в 1975-м скорректировал период до двух лет. Дальше произошло удивительное: индустрия приняла его прогноз как план. Дорожные карты производителей десятилетиями строились так, чтобы попадать в кривую Мура, и закон работал во многом потому, что все в него верили. Как только физика поставила жёсткий предел (транзистор не может быть меньше нескольких атомов кремния с постоянной решётки 0,54 нм), никакая вера уже не помогла — период удвоения растянулся.

💡 Легенда о шахматной доске недооценена. $2^{64}-1 \approx 1{,}8\cdot10^{19}$ зёрен риса — это около 500 миллиардов тонн, примерно тысяча современных мировых годовых урожаев. Но самое интересное в другом: больше половины всего зерна приходится на последнюю клетку. У любой экспоненты последний шаг весит больше, чем вся история до него — свойство, из-за которого экспоненциальные процессы всегда застают врасплох.


Лайфхаки и полезные трюки

1. Считай в «числе периодов», а не в единицах времени

Прежде чем брать калькулятор, спроси: сколько периодов уложилось? Если период полураспада 8 суток, а прошло 24 — это 3 периода, значит делим на 8. Никаких логарифмов. Логарифм нужен только тогда, когда число периодов не целое. Этот вопрос сразу разбивает все задачи на устные и «настоящие».


2. Держи в голове две константы: $\log_2 10 = 3{,}32$ и $2^{10}\approx 10^3$

Из них мгновенно следует всё остальное. Рост в 10 раз — это 3,32 удвоения. В 100 раз — 6,64. В 1000 раз — 9,97, то есть практически ровно 10. Поэтому: «удваивается каждые 2 года» → в 1000 раз за 20 лет. «Полураспад 5730 лет» → до одной тысячной за 57 тысяч лет. Устно, без калькулятора.


3. Правило 72 — и знай, когда оно врёт

$T_2 \approx 72/p$ отлично работает для дискретных ставок 4–12%. Для непрерывного роста ($e^{kt}$) правильное число — 69,3, а не 72, поэтому бери правило 70. Для ставок выше 15% правило 72 систематически занижает срок — там уже считай логарифмом. И зеркально: при падении на $p$% за период величина уменьшается вдвое за те же $72/p$ периодов.


4. Раскладывай децибелы на 10 и 3

Любое число децибел разбивай на десятки (порядки) и тройки (двойки). 26 дБ $= 20 + 3 + 3$ → $100\cdot2\cdot2 = 400$ раз. 37 дБ $= 30+3+3+1$ → $1000\cdot2\cdot2\cdot1{,}26 = 5040$ раз (точно 5012). Точность порядка 1% — более чем достаточно для инженерной прикидки, и всё в уме.


5. Отличай степенной закон от экспоненциального двумя графиками

Есть точки, надо понять природу зависимости — строй два графика подряд: $\ln y$ от $\ln x$ и $\ln y$ от $x$. Где вышла прямая — тот закон и работает (log-log → степенной, наклон даёт показатель; semi-log → экспоненциальный, наклон даёт $k$). Две строки на numpy, а решение о том, можно ли экстраполировать, принимается на порядок увереннее. И помни: экстраполировать по прямой в log-log намного безопаснее, чем в semi-log — степенной закон растёт медленнее и прощает ошибки.


6. Всегда делай обратную подстановку и проверку порядка

Получил $t$ — подставь обратно и посмотри, сходится ли отношение $N/N_0$. Получил «через 20 лет население города вырастет в 400 раз» — остановись и подумай, бывает ли так. Экспоненциальные задачи коварны тем, что ошибка в одном знаке даёт ответ, отличающийся на порядки, и глазом это не ловится. Зато ловится вопросом «а это вообще физически возможно?».


7. Для процентов пользуйся приближением $\ln(1+r)\approx r$, но знай его границу

При $r < 0{,}05$ приближение даёт ошибку меньше 2,5% — можно считать в уме. При $r = 0{,}1$ ошибка уже 5%, при $r = 0{,}2$ — 10%. Похожее приближение работает и для малых множителей затухания: $(1-u)^n \approx e^{-un}$, что мгновенно даёт «weight decay с $\eta\lambda = 10^{-4}$ ужимает вес в $e$ раз за 10 000 шагов».


8. Читай ML-конфиг как задачу на распад

Увидел gamma=0.99 — сразу считай: полураспад lr равен $\ln 2/\ln(1/0{,}99) = 69$ эпох. Если обучение идёт 30 эпох, lr упадёт всего на 26% — расписание фактически не работает. Увидел beta2=0.999 — эффективное окно 1000 шагов, и если у тебя всего 500 шагов на эпоху, оптимизатор «помнит» больше одной эпохи целиком. Эти прикидки занимают секунды и экономят часы отладки.


Возьми любую задачу из этого урока — про вклад, мамонта, кофе, оптоволокно или learning rate — и посмотри на неё ещё раз. Ты решал их одной и той же формулой, меняя только буквы. В этом и есть настоящая сила математики: не в том, чтобы знать двадцать формул, а в том, чтобы увидеть, что двадцать разных задач — это одна задача в разных костюмах.

И одна мысль на будущее, самая важная из всего урока. Экспонента — это модель мира без ограничений, а мир с ограничениями всегда побеждает. Каждый раз, когда ты видишь график, уходящий вертикально вверх, задавай два вопроса: что здесь ресурс и где потолок. Умение посчитать экспоненту делает тебя грамотным. Умение вовремя сказать «а вот здесь она перестанет работать» — делает тебя аналитиком.

Дальше в курсе — последовательности и прогрессии, где та же экспонента предстанет в дискретном виде, а потом пределы, которые наконец строго объяснят, откуда взялось число $e$. Инструмент у тебя уже в руках — осталось разобрать, как он устроен изнутри. 🚀

Понял тему? Закрепи в боте! 🚀

Попрактикуйся на задачах и получи персональные рекомендации от AI

💪 Начать тренировку
💬 Есть вопрос? Спроси бота!