Применение в задачах (рост, распад) 📉
Ты запускаешь обучение нейросети. В конфиге написано lr=0.1, gamma=0.95, ExponentialLR. Через сколько эпох learning rate станет меньше $0{,}001$ — то есть шаг обучения фактически превратится в топтание на месте? В соседней вкладке у тебя открыт калькулятор вклада: банк обещает 12% годовых, но с ежемесячной капитализацией — это правда больше, чем 12%, и насколько? А в новостях пишут, что число заражённых удваивается каждые 3,8 дня и «через месяц будет катастрофа».
Три совершенно разных мира — оптимизация, финансы, эпидемиология. И одна-единственная математическая формула под всеми тремя:
$$N(t) = N_0 \cdot a^{t/T} \qquad \text{или, что то же самое,} \qquad N(t) = N_0 e^{kt}$$Это самая прикладная формула во всей школьной математике. Она описывает всё, что растёт или убывает пропорционально самому себе: чем больше денег на вкладе — тем больше процентов начислят; чем больше радиоактивных ядер — тем больше распадов в секунду; чем больше заражённых — тем больше новых заражений. Величина сама себя разгоняет (или сама себя гасит), и результат — экспонента.
Хорошая новость: чтобы решать такие задачи, тебе не нужно ничего нового. Показательную функцию ты уже разобрал, логарифмы — тоже, показательные и логарифмические уравнения — тоже. Весь этот урок — про то, как перевести человеческий текст задачи в формулу, а потом вытащить из формулы неизвестное. И почти всегда неизвестное — это время $t$, которое сидит в показателе. А значит, ключевой инструмент — логарифм.
Плохая новость (и это самая важная мысль урока): чистая экспонента всегда врёт на длинном горизонте. Бактерии не заполняют Землю, вирус не заражает 8 миллиардов человек за два месяца, а число транзисторов не растёт до бесконечности. У любого реального процесса есть потолок, и нужно понимать, где именно ломается модель — иначе ты построишь красивый прогноз, который не имеет отношения к реальности. Этим мы и закончим — логистической кривой.
🎯 Ты узнаешь:
- Как переводить условие задачи в формулу $N_0a^{t/T}$ или $N_0e^{kt}$ и как свободно переходить между этими двумя записями
- Как находить время $t$ через логарифм: сложный процент, период полураспада, радиоуглеродное датирование, закон Ньютона об охлаждении
- Что такое время удвоения $T_2 = \dfrac{\ln 2}{k}$ и почему «правило 72» позволяет считать в уме без калькулятора
- Почему чистая экспонента врёт на длинном горизонте и как её чинит логистическая кривая
- Как всё это работает в ML: расписания learning rate, экспоненциальное скользящее среднее в Adam, weight decay — и почему scaling laws это степенной, а не экспоненциальный закон
История: откуда это взялось?
Первым человеком, который аккуратно записал формулу сложного процента, был не математик, а бухгалтер. Лука Пачоли — францисканский монах, друг Леонардо да Винчи и автор первого печатного учебника по двойной бухгалтерии — в 1494 году в трактате «Summa de arithmetica» привёл правило: чтобы узнать, за сколько лет удвоится капитал, раздели 72 на процентную ставку. Он не объяснил, откуда взялось число 72 — просто «так делают купцы». Логарифмов тогда ещё не существовало (Непер опубликует свои таблицы только через 120 лет), и объяснить это правило строго Пачоли попросту не мог. Мы объясним — в этом уроке.
Дальше эстафету принял Якоб Бернулли. В 1683 году он задал вопрос, который сегодня кажется чисто финансовым, а на деле открыл дверь в анализ: что будет, если банк начисляет 100% годовых, но не раз в год, а раз в полгода? А раз в месяц? А каждую секунду? Бернулли посчитал $(1 + 1/m)^m$ для растущих $m$ и обнаружил, что результат не улетает в бесконечность, а упирается в число между 2 и 3. Имя этому числу — $e \approx 2{,}71828$ — дал позже Эйлер. То есть основание натурального логарифма родилось буквально из вопроса «а если капитализировать проценты почаще?».
Третий поворот случился в XX веке и был не про деньги, а про распад. В 1907 году Эрнест Резерфорд с коллегами обнаружили, что радиоактивные ядра распадаются по строго экспоненциальному закону: за одинаковые промежутки времени исчезает одинаковая доля вещества, а не одинаковое количество. Отсюда — понятие периода полураспада. А в 1946–1949 годах американский химик Уиллард Либби сообразил, что этот закон можно повернуть задом наперёд: если знать, сколько углерода-14 было в живом организме, и измерить, сколько осталось, — можно вычислить возраст находки. Он проверил метод на образцах древнеегипетского дерева, чей возраст был известен из исторических записей, и получил Нобелевскую премию по химии в 1960 году. Так формула, придуманная купцами для подсчёта прибыли, стала машиной времени для археологов.
А сегодня та же самая формула лежит в файле torch/optim/lr_scheduler.py. ExponentialLR умножает шаг обучения на $\gamma$ каждую эпоху; Adam хранит экспоненциальное скользящее среднее градиентов с коэффициентом $\beta_1 = 0{,}9$; weight decay каждый шаг слегка «сжимает» веса. Пачоли, Бернулли, Резерфорд и разработчики PyTorch решают одно и то же уравнение.
Модель роста и распада: одна формула, две записи
Интуиция
Представь, что у тебя есть колония бактерий, которая удваивается каждые 3 часа. Через 3 часа — вдвое больше, через 6 часов — вчетверо, через 9 — в восемь раз. Ключевое слово тут — «раз». Не «плюс столько-то», а «во столько-то раз». Именно это отличает экспоненциальный процесс от линейного.
Сравни две зарплатные схемы. Первая: +5000 ₽ каждый год. Вторая: +5% каждый год. Первая — линейная, прибавка всегда одна и та же. Вторая — экспоненциальная, потому что 5% от большей зарплаты — это больше рублей. Через 5 лет разница ещё небольшая, через 30 — пропасть.
Формально любой такой процесс описывается одинаково: за фиксированный промежуток времени $T$ величина умножается на фиксированное число $a$. За $t$ единиц времени промежуток $T$ укладывается $t/T$ раз, значит множитель применяется $t/T$ раз:
Определение: Процесс называется экспоненциальным (показательным), если существуют такие числа $a > 0$, $a \neq 1$ и $T > 0$, что величина за каждый промежуток времени $T$ умножается на $a$. Его модель:
$$N(t) = N_0 \cdot a^{t/T},$$где $N_0 = N(0)$ — начальное значение, $a$ — множитель за период, $T$ — длина периода.
Если $a > 1$ — это рост, если $0 < a < 1$ — распад (затухание).
Вторая, эквивалентная запись — через число $e$:
Определение: Та же модель в непрерывной форме:
$$N(t) = N_0 e^{kt},$$где $k$ — постоянная скорости процесса (мгновенный темп). При $k > 0$ — рост, при $k < 0$ — распад.
Обе записи описывают одно и то же множество процессов, просто в разных «единицах измерения» темпа. Переход между ними — самый частый технический ход в задачах:
$$a^{t/T} = e^{kt} \quad \Longleftrightarrow \quad k = \frac{\ln a}{T} \quad \Longleftrightarrow \quad T = \frac{\ln a}{k}$$Почему это верно: перепишем $a = e^{\ln a}$, тогда $a^{t/T} = \left(e^{\ln a}\right)^{t/T} = e^{\frac{\ln a}{T}\cdot t}$. Сравниваем показатели — получаем формулу связи.
Три главных частных случая, которые надо знать наизусть:
- Удвоение за время $T_2$: $a = 2$, $N = N_0\cdot 2^{t/T_2}$, и $k = \dfrac{\ln 2}{T_2} \approx \dfrac{0{,}693}{T_2}$
- Полураспад за время $T$: $a = \tfrac12$, $N = N_0\cdot 2^{-t/T}$, и $k = -\dfrac{\ln 2}{T}$
- Процентный рост на $p$% за период: $a = 1 + \dfrac{p}{100}$, $N = N_0\left(1+\dfrac{p}{100}\right)^{t/T}$
Обрати внимание на третий пункт: если ставка 20% за период, то $a = 1{,}2$, но $k = \ln 1{,}2 \approx 0{,}182$, а не $0{,}2$. Путать $k$ и процентную ставку — одна из самых частых ошибок; вернёмся к ней в разделе про ошибки.
Примеры с разбором
Пример 1 (простой): колония бактерий утраивается каждые 4 часа. Сейчас их 5000. Сколько будет через 12 часов?
Решение:
Шаг 1. Выпишем параметры модели: $N_0 = 5000$, множитель за период $a = 3$, период $T = 4$ ч.
Шаг 2. Модель: $N(t) = 5000 \cdot 3^{t/4}$.
Шаг 3. Подставим $t = 12$:
$$N(12) = 5000 \cdot 3^{12/4} = 5000 \cdot 3^3 = 5000 \cdot 27 = 135\,000$$Проверим наш ответ. За 12 часов период в 4 часа уложился ровно 3 раза, значит утроение произошло трижды: $5000 \to 15\,000 \to 45\,000 \to 135\,000$ ✅
Ответ: 135 000 бактерий.
Пример 2 (средний): перепиши модель $N(t) = 800\cdot 2^{-t/6}$ в форме $N_0e^{kt}$ (время в часах).
Решение:
Шаг 1. Начальное значение видно сразу: $N_0 = 800$.
Шаг 2. Приведём основание к $e$. Здесь $a = 2^{-1} = \tfrac12$ за период $T = 6$, но удобнее работать прямо с показателем:
$$2^{-t/6} = \left(e^{\ln 2}\right)^{-t/6} = e^{-\frac{\ln 2}{6}t}$$Шаг 3. Значит $k = -\dfrac{\ln 2}{6} = -\dfrac{0{,}693147}{6} \approx -0{,}11552$ (1/час).
Шаг 4. Итоговая запись: $N(t) \approx 800\, e^{-0{,}11552\,t}$.
Проверим наш ответ. При $t = 6$ первая формула даёт $800\cdot 2^{-1} = 400$. Вторая: $800\,e^{-0{,}693147} = 800\cdot 0{,}5 = 400$ ✅ Совпало.
Ответ: $N(t) = 800e^{-0{,}11552t}$, где $k = -\dfrac{\ln 2}{6}\ \text{ч}^{-1}$.
Пример 3 (сложный): в момент $t=0$ измерили $N_0 = 1200$ единиц вещества, через 5 часов осталось 300. Найди период полураспада, постоянную $k$ и количество вещества через 8 часов.
Решение:
Шаг 1. Найдём множитель за 5 часов:
$$\frac{N(5)}{N(0)} = \frac{300}{1200} = \frac14$$За 5 часов вещество уменьшилось в 4 раза.
Шаг 2. Уменьшение в 4 раза — это два последовательных уменьшения вдвое. Значит, за 5 часов уложилось ровно два периода полураспада:
$$2^{-5/T} = \frac14 = 2^{-2} \ \Longrightarrow\ \frac{5}{T} = 2 \ \Longrightarrow\ T = 2{,}5\ \text{ч}$$Шаг 3. Постоянная распада:
$$k = -\frac{\ln 2}{T} = -\frac{0{,}693147}{2{,}5} \approx -0{,}27726\ \text{ч}^{-1}$$Шаг 4. Модель: $N(t) = 1200\cdot 2^{-t/2{,}5}$. Найдём $N(8)$:
$$N(8) = 1200\cdot 2^{-8/2{,}5} = 1200\cdot 2^{-3{,}2} = \frac{1200}{2^{3{,}2}}$$Шаг 5. Посчитаем $2^{3{,}2} = 2^3\cdot 2^{0{,}2} = 8\cdot 1{,}1487 = 9{,}1896$.
$$N(8) = \frac{1200}{9{,}1896} \approx 130{,}6$$Проверим наш ответ. 8 часов — это чуть больше трёх периодов полураспада (три периода = 7,5 ч). После трёх периодов было бы $1200/8 = 150$. Наш ответ 130,6 — чуть меньше 150, что и должно быть ✅
Ответ: $T = 2{,}5$ ч, $k \approx -0{,}277\ \text{ч}^{-1}$, $N(8)\approx 131$ единица.
Почему это важно
Умение мгновенно переводить условие в формулу — это 80% успеха в прикладных задачах. Заметь схему: в условии всегда есть начальное значение, множитель и период, за который этот множитель применяется. Как только ты вытащил эти три вещи из текста, задача сводится к арифметике или к одному логарифму. А переход между записями $a^{t/T}$ и $e^{kt}$ нужен потому, что мир говорит на обоих языках: банкиры и биологи любят «удвоение за 3 дня», а физики и авторы ML-библиотек пишут $e^{-kt}$. Ты должен читать оба.
Сложный процент и капитализация 💰
Интуиция
Простой процент — это когда проценты каждый год начисляют на первоначальную сумму. Положил 100 000 под 10% — получаешь 10 000 в год, всегда ровно 10 000. Это линейный рост, скучный.
Сложный процент — это когда проценты начисляют на текущую сумму, включая уже начисленные проценты. Второй год ты получаешь 10% уже от 110 000, то есть 11 000. Третий — от 121 000, то есть 12 100. Проценты сами начинают зарабатывать проценты. Это и есть «капитализация».
Разница кажется мелкой на коротком горизонте и становится чудовищной на длинном. 100 000 ₽ под 10% на 30 лет: простой процент даёт $100\,000 + 30\cdot10\,000 = 400\,000$. Сложный даёт $100\,000\cdot 1{,}1^{30} \approx 1\,744\,940$ — в четыре с лишним раза больше.
Определение: При сложном проценте со ставкой $p$% за период сумма через $n$ периодов равна
$$S_n = S_0\left(1 + \frac{p}{100}\right)^n$$Величина $\left(1+\frac{p}{100}\right)$ называется множителем наращения за период.
Теперь второй слой — частота капитализации. Банк говорит «12% годовых», но может начислять их раз в год, раз в квартал, раз в месяц или ежедневно. Правило простое: годовую ставку делят на число начислений, а показатель во столько же раз увеличивают.
Определение: При номинальной годовой ставке $r$ (в долях) и капитализации $m$ раз в год сумма через $t$ лет равна
$$S(t) = S_0\left(1 + \frac{r}{m}\right)^{mt}$$Величина $\left(1+\frac{r}{m}\right)^m - 1$ — эффективная годовая ставка: тот процент, который ты реально получаешь за год.
Что происходит, когда $m$ растёт? Посмотри на 12% годовых:
| Частота | $m$ | Множитель за год | Эффективная ставка |
|---|---|---|---|
| раз в год | 1 | $1{,}12$ | 12,000% |
| раз в полгода | 2 | $1{,}06^2 = 1{,}1236$ | 12,360% |
| раз в квартал | 4 | $1{,}03^4 = 1{,}12551$ | 12,551% |
| раз в месяц | 12 | $1{,}01^{12} = 1{,}12683$ | 12,683% |
| ежедневно | 365 | $1{,}12747$ | 12,747% |
| непрерывно | $\infty$ | $e^{0{,}12} = 1{,}12750$ | 12,750% |
Видишь, что происходит? Прибавка от учащения капитализации быстро выдыхается. Переход от года к полугодию даёт +0,36 п.п., от месяца к дню — всего +0,064 п.п., а от дня к «непрерывно» — жалкие +0,003 п.п. Последовательность $\left(1+\frac{r}{m}\right)^m$ упирается в потолок $e^r$ — это ровно тот вопрос, который задал Бернулли в 1683 году.
Отсюда третья форма записи, самая компактная — непрерывное начисление:
$$S(t) = S_0 e^{rt}$$Это верхняя граница того, что вообще может дать ставка $r$, и именно поэтому физики и ML-инженеры сразу пишут $e^{kt}$, не заморачиваясь с частотой.
Примеры с разбором
Пример 4 (простой): 80 000 ₽ положили под 6% годовых со сложным процентом на 5 лет. Сколько будет на счету?
Решение:
Шаг 1. Множитель за год: $1 + 0{,}06 = 1{,}06$.
Шаг 2. За 5 лет множитель применяется 5 раз:
$$S = 80\,000\cdot 1{,}06^5$$Шаг 3. Посчитаем $1{,}06^5$ по шагам, чтобы не ошибиться:
$$1{,}06^2 = 1{,}1236,\quad 1{,}06^4 = 1{,}1236^2 = 1{,}26247696,\quad 1{,}06^5 = 1{,}26247696\cdot 1{,}06 = 1{,}33822558$$Шаг 4. $S = 80\,000\cdot 1{,}33822558 \approx 107\,058$ ₽.
Проверим наш ответ. Простой процент дал бы $80\,000 + 5\cdot 4800 = 104\,000$. Сложный чуть больше — логично ✅
Ответ: ≈ 107 058 ₽ (прибыль ≈ 27 058 ₽).
Пример 5 (средний): 150 000 ₽ кладут на 2 года под 12% годовых. Сравни три схемы: капитализация раз в год, раз в квартал, раз в месяц.
Решение:
Шаг 1. Раз в год ($m=1$, $mt = 2$):
$$S = 150\,000\cdot 1{,}12^2 = 150\,000\cdot 1{,}2544 = 188\,160\ \text{₽}$$Шаг 2. Раз в квартал ($m=4$, ставка за квартал $0{,}12/4 = 0{,}03$, число периодов $4\cdot2 = 8$):
$$1{,}03^2 = 1{,}0609,\quad 1{,}03^4 = 1{,}12550881,\quad 1{,}03^8 = 1{,}12550881^2 = 1{,}26677008$$$$S = 150\,000\cdot 1{,}26677008 \approx 190\,015{,}51\ \text{₽}$$Шаг 3. Раз в месяц ($m=12$, ставка за месяц $0{,}01$, число периодов $24$):
$$1{,}01^{12} = 1{,}12682503,\quad 1{,}01^{24} = 1{,}12682503^2 \approx 1{,}26973465$$$$S = 150\,000\cdot 1{,}26973465 \approx 190\,460{,}20\ \text{₽}$$Шаг 4. Сведём в таблицу разницу с базовой схемой:
| Схема | Сумма | Разница с годовой |
|---|---|---|
| раз в год | 188 160 ₽ | — |
| раз в квартал | 190 016 ₽ | +1 856 ₽ |
| раз в месяц | 190 460 ₽ | +2 300 ₽ |
Проверим наш ответ. Переход «год → квартал» дал +1856 ₽, а куда более сильный на вид переход «квартал → месяц» — всего +444 ₽. Именно этого мы и ждали: эффект от учащения быстро насыщается ✅
Ответ: 188 160 ₽ / 190 016 ₽ / 190 460 ₽; ежемесячная капитализация выгоднее годовой на 2 300 ₽ за два года.
Пример 6 (сложный): за сколько лет вклад 50 000 ₽ вырастет до 200 000 ₽ при ставке 9% годовых с ежеквартальной капитализацией?
Решение:
Шаг 1. Ставка за квартал: $0{,}09/4 = 0{,}0225$. Пусть $n$ — число кварталов. Уравнение:
$$50\,000\cdot 1{,}0225^{\,n} = 200\,000$$Шаг 2. Делим обе части на 50 000:
$$1{,}0225^{\,n} = 4$$Шаг 3. Логарифмируем — неизвестное сидит в показателе, других вариантов нет:
$$n = \log_{1{,}0225} 4 = \frac{\ln 4}{\ln 1{,}0225}$$Шаг 4. Считаем: $\ln 4 = 1{,}3862944$; $\ln 1{,}0225 \approx 0{,}0222517$.
$$n = \frac{1{,}3862944}{0{,}0222517} \approx 62{,}30\ \text{квартала}$$Шаг 5. Переводим в годы: $62{,}30 / 4 \approx 15{,}57$ года. Но проценты начисляют только в конце квартала, поэтому нужен целый номер квартала: 63-й квартал, то есть 15 лет и 9 месяцев.
Проверим наш ответ. $1{,}0225^{63} = e^{63\cdot 0{,}0222517} = e^{1{,}40186} \approx 4{,}063 > 4$ ✅, а $1{,}0225^{62} = e^{1{,}37960}\approx 3{,}973 < 4$ ✅ Значит, порог пересекается именно на 63-м квартале.
Ответ: ≈ 15,6 года (63 квартала, то есть 15 лет 9 месяцев).
Почему это важно
Формула сложного процента — это не «задачка про банк». Это шаблон для любого мультипликативного накопления: инфляция, рост выручки компании, амортизация оборудования, рост объёма датасета, деградация модели в проде. И главное — она учит одному навыку, который переносится на всё остальное: не складывать проценты. Рост на 5% десять раз подряд — это не +50%, а $1{,}05^{10} = 1{,}6289$, то есть +62,9%. А падение на 50% и потом рост на 50% — это не возврат к нулю, а $0{,}5\cdot1{,}5 = 0{,}75$, то есть минус 25%. Проценты перемножаются, а не складываются, и это ровно тот же принцип, по которому перемножаются множители в экспоненте.
Период полураспада и радиоуглеродное датирование ☢️
Интуиция
Радиоактивный распад — самый «честный» экспоненциальный процесс в природе. Отдельное ядро распадается случайно: невозможно предсказать, когда именно распадётся вот это конкретное ядро. Но ядер в грамме вещества — порядка $10^{22}$, и статистика превращает случайность в железную закономерность: за каждый одинаковый промежуток времени распадается одинаковая доля ядер.
Представь мешок с миллионом монет. Каждую минуту ты подбрасываешь все монеты сразу и убираешь те, что выпали орлом. Через минуту останется примерно половина, через две — четверть, через три — восьмая часть. Ты не знаешь, какая конкретно монета выпадет орлом, но точно знаешь, что останется половина. Период полураспада здесь — одна минута.
Определение: Периодом полураспада $T$ называется время, за которое количество вещества уменьшается вдвое. Закон распада:
$$N(t) = N_0\cdot\left(\frac12\right)^{t/T} = N_0\cdot 2^{-t/T} = N_0 e^{-\lambda t},\quad \text{где } \lambda = \frac{\ln 2}{T}$$Величина $\lambda$ называется постоянной распада.
Важнейшее свойство: период полураспада не зависит от того, сколько вещества было и сколько уже прошло времени. Процесс «не помнит» прошлого. Если сейчас у тебя 1 грамм — через $T$ будет полграмма. Если сейчас 1 микрограмм — через $T$ будет полмикрограмма. Это свойство называют отсутствием памяти, и именно оно делает возможным датирование.
Как работает радиоуглеродный метод. В атмосфере под действием космических лучей постоянно образуется радиоактивный изотоп углерода $^{14}\mathrm{C}$. Живой организм обменивается углеродом со средой, и доля $^{14}\mathrm{C}$ в нём такая же, как в атмосфере. Как только организм умирает, обмен прекращается — а $^{14}\mathrm{C}$ продолжает распадаться с периодом $T = 5730$ лет. Измеряем, какая доля осталась, — получаем возраст:
$$\frac{N}{N_0} = 2^{-t/T}\ \Longrightarrow\ t = T\cdot\log_2\frac{N_0}{N} = T\cdot\frac{\ln(N_0/N)}{\ln 2}$$Полезные ориентиры, которые стоит держать в голове:
- Осталось $1/2$ → прошёл 1 период
- Осталось $1/4$ → 2 периода
- Осталось $1/8$ → 3 периода
- Осталось $1/10$ → $\log_2 10 \approx 3{,}32$ периода
- Осталось $1/100$ → $\approx 6{,}64$ периода
- Осталось $1/1000$ → $\approx 9{,}97 \approx 10$ периодов
Последняя строчка — отличный практический ориентир: за 10 периодов полураспада остаётся примерно тысячная доля. Именно поэтому в радиационной безопасности считают, что через 10 периодов источник «практически безопасен».
Примеры с разбором
Пример 7 (простой): период полураспада углерода-14 равен 5730 лет. Сколько останется от 1 грамма через 17 190 лет?
Решение:
Шаг 1. Сколько периодов уложилось: $17\,190 / 5730 = 3$.
Шаг 2. Три полураспада — три деления пополам:
$$N = 1\cdot\left(\frac12\right)^3 = \frac18 = 0{,}125\ \text{г}$$Проверим наш ответ. По формуле: $N = 1\cdot 2^{-17190/5730} = 2^{-3} = 0{,}125$ ✅
Ответ: 0,125 г (одна восьмая грамма).
Пример 8 (средний): период полураспада стронция-90 равен 28,8 года. Через сколько лет его останется 1% от исходного количества?
Решение:
Шаг 1. Записываем условие как уравнение:
$$2^{-t/28{,}8} = 0{,}01$$Шаг 2. Перевернём дробь, чтобы избавиться от минуса в показателе:
$$2^{\,t/28{,}8} = 100$$Шаг 3. Логарифмируем по основанию 2:
$$\frac{t}{28{,}8} = \log_2 100$$Шаг 4. Считаем $\log_2 100 = \dfrac{\ln 100}{\ln 2} = \dfrac{4{,}6051702}{0{,}6931472} \approx 6{,}6439$.
Можно и хитрее: $\log_2 100 = 2\log_2 10 \approx 2\cdot 3{,}3219 = 6{,}6439$ ✅
Шаг 5. $t = 28{,}8\cdot 6{,}6439 \approx 191{,}3$ года.
Проверим наш ответ. 6,64 периода — это между 6 периодами ($1/64 \approx 1{,}56\%$) и 7 периодами ($1/128 \approx 0{,}78\%$). Наши 1% как раз попадают в этот диапазон ✅
Ответ: ≈ 191 год.
Пример 9 (сложный): в живом дереве активность углерода-14 равна 13,6 распада в минуту на грамм углерода. В деревянной находке измерили 9,6 распада в минуту на грамм. Определи возраст находки.
Решение:
Шаг 1. Активность пропорциональна числу нераспавшихся ядер, поэтому отношение активностей — это и есть отношение $N/N_0$:
$$\frac{N}{N_0} = \frac{9{,}6}{13{,}6} = \frac{96}{136} = \frac{12}{17} \approx 0{,}70588$$Шаг 2. Составляем уравнение:
$$2^{-t/5730} = \frac{12}{17}$$Шаг 3. Перевернём и прологарифмируем:
$$2^{\,t/5730} = \frac{17}{12} \ \Longrightarrow\ \frac{t}{5730} = \log_2\frac{17}{12} = \frac{\ln 17 - \ln 12}{\ln 2}$$Шаг 4. Считаем: $\ln 17 = 2{,}8332133$, $\ln 12 = 2{,}4849066$, разность $= 0{,}3483067$.
$$\frac{t}{5730} = \frac{0{,}3483067}{0{,}6931472} \approx 0{,}50250$$Шаг 5. $t = 5730\cdot 0{,}50250 \approx 2879$ лет.
Проверим наш ответ. Осталось чуть меньше 71% — это чуть больше половины периода полураспада. Половина периода — 2865 лет, наш ответ 2879 — рядом ✅ Подстановка: $2^{-0{,}5025} = e^{-0{,}5025\cdot 0{,}693147} = e^{-0{,}348307} = 0{,}70588$ ✅
Ответ: ≈ 2880 лет (округляя до значащих цифр — примерно 2,9 тысячи лет).
Почему это важно
Датирование — прекрасный пример обратной задачи: обычно мы по времени находим количество, а здесь по количеству находим время. Такие обратные задачи повсюду в анализе данных: по текущему остатку пользователей оценить время с момента запуска когорты, по уровню сигнала — расстояние, по значению learning rate — номер эпохи. Схема одинакова: составить отношение $N/N_0$, приравнять к показательному выражению, взять логарифм. Обрати внимание и на то, что физическую величину (активность, число распадов, концентрация) почти никогда не измеряют абсолютно — измеряют отношение к эталону. Отношение убирает необходимость знать $N_0$ точно, и это общий приём: работай с относительными величинами, они устойчивее.
Находим время: логарифм, время удвоения и правило 72 ⏱️
Интуиция
Все задачи на рост и распад делятся ровно на два типа.
Прямая задача: дано время — найти количество. Подставил $t$ в формулу, посчитал. Скучно.
Обратная задача: дано количество — найти время. Вот тут время сидит в показателе степени, и достать его оттуда можно единственным инструментом — логарифмом. Это и есть главный технический навык всего урока.
Универсальный рецепт:
$$N_0\cdot a^{t/T} = N \ \Longrightarrow\ a^{t/T} = \frac{N}{N_0} \ \Longrightarrow\ \frac{t}{T} = \log_a\frac{N}{N_0} \ \Longrightarrow\ \boxed{\,t = T\cdot\frac{\ln(N/N_0)}{\ln a}\,}$$И для непрерывной формы:
$$N_0 e^{kt} = N \ \Longrightarrow\ \boxed{\,t = \frac{1}{k}\ln\frac{N}{N_0}\,}$$Заметь красивую вещь: время зависит только от отношения $N/N_0$, а не от самих чисел. Чтобы вклад вырос втрое, нужно одно и то же время, начинал ты с тысячи рублей или с миллиарда. Чтобы вещества осталось 10%, нужно одно и то же время независимо от массы образца. Это прямое следствие того, что процесс мультипликативен.
Из этого рецепта вырастает самая ходовая характеристика любого растущего процесса — время удвоения.
Определение: Временем удвоения $T_2$ называется время, за которое величина растёт вдвое. Для модели $N = N_0e^{kt}$:
$$T_2 = \frac{\ln 2}{k} \approx \frac{0{,}693}{k}$$Для модели с процентной ставкой $p$% за период: $T_2 = \dfrac{\ln 2}{\ln\left(1+\frac{p}{100}\right)}$.
Аналогично для распада вводится время полураспада: $T_{1/2} = \dfrac{\ln 2}{|k|}$ — та же формула, просто $k$ отрицательное.
Правило 72: как считать удвоение в уме
Логарифм в уме не посчитаешь, а прикинуть срок удвоения хочется прямо в разговоре. Для этого купцы XV века придумали правило:
Правило 72: при ставке $p$% за период капитал удваивается примерно за $\dfrac{72}{p}$ периодов.
Откуда берётся 72? Давай разберёмся честно.
Шаг 1. Точная формула: $T_2 = \dfrac{\ln 2}{\ln(1 + r)}$, где $r = p/100$.
Шаг 2. При малых $r$ работает приближение $\ln(1+r)\approx r$. Тогда
$$T_2 \approx \frac{0{,}693}{r} = \frac{69{,}3}{p}$$То есть «честное» число — не 72, а 69,3.
Шаг 3. Но приближение $\ln(1+r)\approx r$ систематически завышает знаменатель ($\ln(1+r) < r$ при $r>0$), а значит занижает $T_2$. Чтобы это скомпенсировать, числитель немного увеличивают. Насколько? Точный «идеальный числитель» равен
$$C(p) = 69{,}3\cdot\frac{r}{\ln(1+r)}$$При $r = 0{,}08$: $C = 69{,}3\cdot\dfrac{0{,}08}{0{,}076961} = 69{,}3\cdot1{,}0395 \approx 72{,}0$.
Вот и ответ: число 72 — это точный числитель для ставки около 8%, то есть для типичной купеческой (и типичной рыночной) доходности. Плюс 72 делится на 1, 2, 3, 4, 6, 8, 9, 12 — считать в уме одно удовольствие.
Насколько правило врёт на практике:
| Ставка $p$ | Точное $T_2$ | Правило 72 | Правило 69,3 |
|---|---|---|---|
| 1% | 69,7 | 72,0 | 69,3 |
| 2% | 35,0 | 36,0 | 34,7 |
| 4% | 17,7 | 18,0 | 17,3 |
| 6% | 11,9 | 12,0 | 11,6 |
| 8% | 9,01 | 9,00 | 8,66 |
| 10% | 7,27 | 7,20 | 6,93 |
| 15% | 4,96 | 4,80 | 4,62 |
| 20% | 3,80 | 3,60 | 3,47 |
Вывод для практики:
- Ставки 4–12% — правило 72 отличное, ошибка меньше 1%
- Очень маленькие ставки и непрерывный рост ($N_0e^{kt}$) — используй правило 70 или прямо $0{,}693/k$
- Ставки выше 15% — правило 72 заметно занижает срок, лучше считать логарифмом
И зеркальный вариант для убывания: при падении на $p$% за период величина уменьшается вдвое примерно за $72/p$ периодов. Инфляция 6% в год → покупательная способность денег падает вдвое за 12 лет. Learning rate падает на 5% за эпоху → он уменьшается вдвое примерно за 14 эпох (точнее — за $\ln 2/\ln(1/0{,}95) = 13{,}5$).
Ещё одна прикидка, которую стоит запомнить: рост в 10 раз — это 3,32 удвоения ($\log_2 10 \approx 3{,}3219$). Отсюда мгновенно: если что-то удваивается каждые 2 года, то в 10 раз оно вырастет за 6,6 года, в 100 раз — за 13,3 года, в 1000 раз — за 20 лет. И родственный факт: $2^{10} = 1024 \approx 10^3$, поэтому «десять удвоений ≈ тысяча раз» — самая быстрая прикидка в мире.
Примеры с разбором
Пример 10 (простой): найди $t$ из уравнения $2^{t/3} = 32$.
Решение:
Шаг 1. Приведём правую часть к основанию 2: $32 = 2^5$.
Шаг 2. $2^{t/3} = 2^5$. Основания равны, показательная функция монотонна — значит равны показатели:
$$\frac{t}{3} = 5 \ \Longrightarrow\ t = 15$$Проверим наш ответ. $2^{15/3} = 2^5 = 32$ ✅
Ответ: $t = 15$.
Пример 11 (средний): за сколько лет удвоится вклад под 11% годовых? Сравни точный ответ с правилом 72.
Решение:
Шаг 1. Точное уравнение: $1{,}11^{\,t} = 2$.
Шаг 2. Логарифмируем:
$$t = \frac{\ln 2}{\ln 1{,}11} = \frac{0{,}693147}{0{,}104360} \approx 6{,}64\ \text{года}$$Шаг 3. Правило 72: $72/11 = 6{,}55$ года.
Шаг 4. Разница: $6{,}64 - 6{,}55 = 0{,}09$ года, то есть примерно месяц, или 1,4% относительной ошибки. Для устной прикидки — прекрасно.
Шаг 5. Но если речь о реальном вкладе, проценты капитализируются в конце года, поэтому удвоение фактически наступит только на 7-м году.
Проверим наш ответ. $1{,}11^6 = 1{,}8704$ — ещё не удвоился. $1{,}11^7 = 2{,}0762$ — уже больше двух ✅
Ответ: точно ≈ 6,64 года; правило 72 даёт 6,55; фактически удвоение произойдёт по итогам 7-го года.
Пример 12 (сложный): популяция описывается моделью $N(t) = 400\,e^{0{,}15t}$ ($t$ в годах). Найди: а) время удвоения; б) через сколько лет популяция достигнет 10 000; в) сколько удвоений произойдёт за это время.
Решение:
а) Время удвоения.
$$T_2 = \frac{\ln 2}{k} = \frac{0{,}693147}{0{,}15} \approx 4{,}62\ \text{года}$$Правило 72 дало бы $72/15 = 4{,}8$ — завышение на 3,9%. Правило 70 даёт $70/15 = 4{,}67$ — уже гораздо ближе. Для непрерывного роста правильный числитель — именно 69,3, а не 72.
б) Когда $N = 10\,000$?
Шаг 1. Составляем уравнение:
$$400\,e^{0{,}15t} = 10\,000$$Шаг 2. Делим на 400:
$$e^{0{,}15t} = 25$$Шаг 3. Берём натуральный логарифм обеих частей:
$$0{,}15t = \ln 25 = 3{,}2188758$$Шаг 4.
$$t = \frac{3{,}2188758}{0{,}15} \approx 21{,}46\ \text{года}$$в) Сколько удвоений?
$$\frac{t}{T_2} = \frac{21{,}46}{4{,}62} \approx 4{,}64\ \text{удвоения}$$Проверим наш ответ. $2^{4{,}64} = e^{4{,}64\cdot 0{,}693147} = e^{3{,}2162} \approx 24{,}9 \approx 25$ ✅ Ровно во столько раз и должна была вырасти популяция ($10\,000/400 = 25$).
Ещё одна проверка через прикидку: рост в 25 раз — это чуть меньше, чем в 32 раза, то есть чуть меньше 5 удвоений. $5\cdot4{,}62 = 23{,}1$ года — наш ответ 21,5 чуть меньше ✅
Ответ: а) $T_2\approx 4{,}62$ года; б) $t \approx 21{,}5$ года; в) ≈ 4,64 удвоения.
Почему это важно
Время удвоения — это язык, на котором люди реально обсуждают экспоненциальные процессы. Никто не говорит «постоянная скорости роста эпидемии равна 0,182 в сутки» — говорят «удваивается каждые четыре дня», и все понимают. Точно так же в ML: никто не пишет «постоянная затухания learning rate равна 0,0513 на эпоху» — пишут «падает вдвое каждые 13,5 эпох». Умение мгновенно переводить $k \leftrightarrow T_2$ и прикидывать удвоение в уме по правилу 72 — это то, что отличает человека, который чувствует масштаб процесса, от того, кто просто подставляет числа в калькулятор.
Закон Ньютона об охлаждении: распад со смещением ☕
Интуиция
Ты налил кофе при 90 °C в комнате с температурой 20 °C. Он остывает. Но остывает он не до нуля — он стремится к 20 °C, к температуре комнаты. Значит, чистая экспонента $T_0e^{-kt}$ здесь не подойдёт: она всегда стремится к нулю.
Ключевая идея, которую Ньютон сформулировал ещё в 1701 году в анонимной заметке в «Philosophical Transactions»: экспоненциально убывает не сама температура, а разность между телом и средой. Чем горячее кофе относительно комнаты, тем быстрее он теряет тепло; когда разность становится маленькой, остывание почти останавливается.
Обозначим $\Delta(t) = T(t) - T_{\text{ср}}$ — «превышение» над средой. Тогда $\Delta$ ведёт себя как обычное радиоактивное вещество: убывает вдвое за фиксированное время.
Определение (закон Ньютона об охлаждении): если тело с начальной температурой $T_0$ помещено в среду с постоянной температурой $T_{\text{ср}}$, то
$$T(t) = T_{\text{ср}} + (T_0 - T_{\text{ср}})\,e^{-kt}$$где $k > 0$ — коэффициент, зависящий от тела и условий теплообмена.
Как с этим работать практически — три правила:
- Сначала вычитай среду. Переходи к $\Delta = T - T_{\text{ср}}$, и задача превращается в обычный распад
- Разность делится вдвое за $\ln 2/k$ — у остывания есть свой «период полураспада»
- Ответ всегда выше $T_{\text{ср}}$ при остывании и ниже при нагревании; если получилось наоборот — где-то знак потерян
Тот же закон описывает нагрев (кладём холодное в тёплое — тогда $T_0 < T_{\text{ср}}$ и скобка отрицательная), разряд конденсатора, растворение таблетки, выведение лекарства из крови и — да — затухание momentum в оптимизаторе, когда градиенты вдруг стали нулевыми.
Примеры с разбором
Пример 13 (простой): суп с температурой 80 °C стоит в комнате при 22 °C, коэффициент $k = 0{,}05$ мин⁻¹. Какая температура будет через 15 минут?
Решение:
Шаг 1. Начальная разность: $\Delta_0 = 80 - 22 = 58$ °C.
Шаг 2. Через 15 минут разность уменьшится в $e^{0{,}05\cdot 15} = e^{0{,}75}$ раз:
$$\Delta(15) = 58\,e^{-0{,}75} = 58\cdot 0{,}472367 \approx 27{,}4\ \text{°C}$$Шаг 3. Возвращаем среду обратно:
$$T(15) = 22 + 27{,}4 = 49{,}4\ \text{°C}$$Проверим наш ответ. «Период полураспада» разности: $\ln 2/0{,}05 = 13{,}86$ мин. За 15 минут разность должна упасть чуть больше чем вдвое: $58/2 = 29$, а у нас 27,4 — чуть меньше ✅
Ответ: ≈ 49,4 °C.
Пример 14 (средний): кофе при 90 °C поставили в комнату при 20 °C. Через 10 минут он остыл до 70 °C. Когда он остынет до 40 °C?
Решение:
Шаг 1. Переходим к разностям:
$$\Delta_0 = 90 - 20 = 70,\qquad \Delta(10) = 70 - 20 = 50,\qquad \Delta_{\text{цель}} = 40 - 20 = 20$$Шаг 2. Находим $k$ из первого условия:
$$70\,e^{-10k} = 50 \ \Longrightarrow\ e^{-10k} = \frac57 \ \Longrightarrow\ 10k = \ln\frac75$$$$k = \frac{\ln 1{,}4}{10} = \frac{0{,}3364722}{10} \approx 0{,}0336472\ \text{мин}^{-1}$$Шаг 3. Решаем целевое уравнение:
$$70\,e^{-kt} = 20 \ \Longrightarrow\ e^{-kt} = \frac27 \ \Longrightarrow\ kt = \ln\frac72 = 1{,}2527629$$Шаг 4.
$$t = \frac{1{,}2527629}{0{,}0336472} \approx 37{,}2\ \text{минуты}$$Проверим наш ответ. Разность падает вдвое за $\ln 2/k = 0{,}693147/0{,}0336472 = 20{,}6$ минуты. Нам нужно, чтобы разность упала с 70 до 20, то есть в 3,5 раза — это между одним удвоением (в 2 раза, 20,6 мин) и двумя (в 4 раза, 41,2 мин), ближе ко второму. Наши 37,2 минуты попадают точно в этот интервал ✅
Ответ: ≈ 37 минут после того, как кофе поставили.
Пример 15 (сложный): тело обнаружили в комнате при 18 °C. В момент обнаружения его температура была 30 °C, нормальная температура живого тела 36,6 °C. Через сколько часов после обнаружения температура тела опустится до 24 °C, если коэффициент охлаждения таков, что от 36,6 °C до 30 °C тело остывало 2 часа?
Решение:
Шаг 1. Разности от среды:
$$\Delta_0 = 36{,}6 - 18 = 18{,}6;\qquad \Delta(2) = 30 - 18 = 12;\qquad \Delta_{\text{цель}} = 24 - 18 = 6$$Шаг 2. Находим $k$:
$$e^{-2k} = \frac{12}{18{,}6} = \frac{120}{186} = \frac{20}{31} \approx 0{,}645161$$$$2k = \ln\frac{31}{20} = \ln 1{,}55 = 0{,}4382549 \ \Longrightarrow\ k \approx 0{,}2191275\ \text{ч}^{-1}$$Шаг 3. Замечаем изящный ход: целевая разность 6 — это ровно половина от 12. То есть от момента «через 2 часа» до цели должно пройти ровно одно время полураспада разности!
$$T_{1/2} = \frac{\ln 2}{k} = \frac{0{,}693147}{0{,}2191275} \approx 3{,}163\ \text{часа}$$Шаг 4. Общее время от смерти: $t = 2 + 3{,}163 = 5{,}163$ часа. А от момента обнаружения (то есть от отметки 2 часа) пройдёт $3{,}163$ часа.
Проверим наш ответ. Прямой расчёт: $18{,}6\,e^{-0{,}2191275\cdot 5{,}163} = 18{,}6\,e^{-1{,}13146} = 18{,}6\cdot 0{,}32258 = 6{,}0$ ✅ Температура $18 + 6 = 24$ °C ✅
Ответ: ≈ 3,16 часа после обнаружения (или ≈ 5,16 часа с момента, когда температура была 36,6 °C).
Почему это важно
Закон Ньютона учит главному трюку прикладной математики: если процесс стремится не к нулю, а к какому-то уровню — вычти этот уровень и получишь чистую экспоненту. Этот приём переносится буквально всюду. Модель «выручка растёт к насыщению» — вычти потолок. Модель «loss падает к неустранимому уровню (irreducible loss)» — вычти этот уровень, и остаток может оказаться красивой убывающей кривой. Кстати, именно так устроены современные формулы scaling laws: $L(N) = L_\infty + (N_c/N)^\alpha$, где $L_\infty$ — та самая «температура комнаты», ниже которой модель не опустится никогда, сколько параметров ни добавляй.
Затухание сигнала и децибелы 📡
Интуиция
Свет в оптоволокне, радиоволна в воздухе, звук в стене — все они слабеют по одному закону: на каждом одинаковом отрезке пути теряется одинаковая доля мощности. Прошёл километр — осталось, скажем, 95,5%. Ещё километр — 95,5% от того, что было. Классическая экспонента, только вместо времени в показателе — расстояние:
$$P(x) = P_0 e^{-\alpha x}$$Но инженеры почти никогда не пишут это в таком виде. Они пишут «затухание 0,2 дБ/км». Почему?
Потому что перемножать множители неудобно, а складывать числа — удобно. Если сигнал прошёл участок, ослабевший в 2 раза, потом соединитель, ослабляющий в 1,2 раза, потом ещё участок в 5 раз — общее ослабление $2\cdot1{,}2\cdot5 = 12$ раз. А в децибелах эти потери просто складываются. Децибел — это и есть логарифмическая шкала, специально придуманная, чтобы превращать умножение в сложение (в честь Александра Белла, отсюда «бел», а «деци» — десятая часть бела).
Определение: Уровень мощности в децибелах относительно опорной мощности $P_0$:
$$L = 10\lg\frac{P}{P_0}\ \text{дБ}$$Ослабление (затухание) в децибелах: $A = 10\lg\dfrac{P_{\text{вход}}}{P_{\text{выход}}}$.
Чтобы читать децибелы «с листа», достаточно запомнить три числа:
- 3 дБ ≈ в 2 раза (точно: $10\lg 2 = 3{,}0103$) — знаменитое «правило трёх децибел»
- 10 дБ = в 10 раз (по определению шкалы)
- 20 дБ = в 100 раз, 30 дБ = в 1000 раз — каждые 10 дБ добавляют порядок
Отсюда мгновенно: 6 дБ ≈ в 4 раза, 13 дБ ≈ в 20 раз, 23 дБ ≈ в 200 раз. Складываешь децибелы — перемножаешь разы.
Связь двух записей. Если затухание $\beta$ дБ/км, то
$$P(x) = P_0\cdot 10^{-\beta x/10} = P_0\,e^{-\alpha x},\qquad \alpha = \frac{\beta\ln 10}{10} \approx 0{,}2303\,\beta$$А «длина полуослабления» (на которой мощность падает вдвое) равна $\dfrac{10\lg 2}{\beta} = \dfrac{3{,}0103}{\beta}$ км.
Примеры с разбором
Пример 16 (простой): во сколько раз ослабевает сигнал при затухании 20 дБ? А при 43 дБ?
Решение:
Шаг 1. По определению $20 = 10\lg\dfrac{P_{\text{вх}}}{P_{\text{вых}}}$, значит $\lg\dfrac{P_{\text{вх}}}{P_{\text{вых}}} = 2$, то есть отношение равно $10^2 = 100$.
Шаг 2. Для 43 дБ разложим на удобные слагаемые: $43 = 40 + 3$.
$$40\ \text{дБ} \to 10^4 = 10\,000\ \text{раз};\qquad 3\ \text{дБ} \to \approx 2\ \text{раза}$$Складываем децибелы — перемножаем разы: $10\,000\cdot 2 = 20\,000$ раз.
Проверим наш ответ. Точно: $10^{4{,}3} = 19\,952{,}6$ — наша прикидка 20 000 отличается на 0,2% ✅
Ответ: 20 дБ → в 100 раз; 43 дБ → примерно в 20 000 раз.
Пример 17 (средний): в оптоволокне затухание 0,25 дБ/км. Передатчик даёт 1 мВт, приёмник надёжно работает от 1 мкВт. Какова максимальная длина линии?
Решение:
Шаг 1. Во сколько раз может ослабнуть сигнал: $\dfrac{1\ \text{мВт}}{1\ \text{мкВт}} = \dfrac{10^{-3}}{10^{-6}} = 1000$ раз.
Шаг 2. Переводим в децибелы:
$$A = 10\lg 1000 = 30\ \text{дБ}$$Шаг 3. Делим бюджет на удельное затухание:
$$L = \frac{30\ \text{дБ}}{0{,}25\ \text{дБ/км}} = 120\ \text{км}$$Проверим наш ответ. На 120 км затухание $120\cdot0{,}25 = 30$ дБ, мощность на выходе $1\ \text{мВт}\cdot10^{-3} = 1$ мкВт ✅ Ровно на пороге.
Ответ: 120 км.
Пример 18 (сложный): линия связи имеет бюджет 25 дБ. В неё врезаны 4 соединителя, каждый съедает 0,5 дБ. Волокно даёт 0,2 дБ/км. а) Какова максимальная длина? б) На какой длине волокна сигнал слабеет вдвое? в) Запиши затухание в форме $P_0e^{-\alpha x}$.
Решение:
а) Максимальная длина.
Шаг 1. Потери на соединителях: $4\cdot 0{,}5 = 2$ дБ.
Шаг 2. На волокно остаётся: $25 - 2 = 23$ дБ.
Шаг 3. Длина: $L = 23/0{,}2 = 115$ км.
б) Длина полуослабления.
Нужно потерять 3,0103 дБ:
$$x_{1/2} = \frac{3{,}0103}{0{,}2} \approx 15{,}05\ \text{км}$$То есть каждые примерно 15 километров сигнал слабеет ровно вдвое.
в) Непрерывная форма.
$$\alpha = \frac{0{,}2\cdot\ln 10}{10} = \frac{0{,}2\cdot 2{,}302585}{10} = 0{,}04605\ \text{км}^{-1}$$$$P(x) = P_0\,e^{-0{,}04605\,x}$$Проверим наш ответ. Проверим пункт (б) через непрерывную форму: $\ln 2/0{,}04605 = 0{,}693147/0{,}04605 = 15{,}05$ км ✅ Совпало. И проверим (а): $P(115)/P_0 = e^{-0{,}04605\cdot115} = e^{-5{,}2958} = 0{,}005012$, то есть ослабление в 199,5 раза = $10\lg 199{,}5 = 23{,}0$ дБ ✅
Ответ: а) 115 км; б) ≈ 15,05 км; в) $P(x) = P_0e^{-0{,}04605x}$, $x$ в км.
Почему это важно
Децибелы — это не «инженерная причуда», а образец инженерного мышления: если величина меняется на много порядков, работай с её логарифмом. Ровно по этой причине в машинном обучении loss рисуют в логарифмической шкале, learning rate подбирают по сетке $10^{-5}, 10^{-4}, 10^{-3}$ (а не $0{,}001; 0{,}002; 0{,}003$), а вероятности в моделях хранят как логарифмы (log_softmax, logsumexp) — иначе произведение тысячи вероятностей мгновенно превратится в машинный ноль. Логарифм превращает умножение в сложение и «сжимает» огромный диапазон в удобный — и децибелы просто самый старый и знаменитый пример этого приёма.
Рост популяций, вирусы, закон Мура — и почему экспонента всегда врёт 🦠
Интуиция
Есть старая индийская легенда. Изобретатель шахмат попросил у раджи скромную награду: одно зерно на первую клетку доски, два на вторую, четыре на третью, и так далее — каждый раз вдвое больше. Раджа расхохотался и согласился. На 64-й клетке потребовалось бы $2^{63}$ зёрен, а всего — $2^{64}-1 \approx 1{,}8\cdot10^{19}$ зёрен, то есть около 500 миллиардов тонн риса — примерно тысяча современных мировых годовых урожаев.
Мораль легенды обычно формулируют как «экспонента растёт невероятно быстро». Но правильная мораль другая и куда полезнее: экспоненциальная модель ломается раньше, чем ты успеваешь дойти до 64-й клетки. Зерна физически нет. Модель была верной первые 20 клеток и стала фантастикой на 40-й.
Ровно то же самое происходит со всеми реальными процессами.
Популяция. Бактерии в чашке Петри удваиваются каждые 20 минут. Одна бактерия за 48 часов дала бы $2^{144}\approx 2{,}2\cdot10^{43}$ клеток — масса больше массы Земли. Реально колония выходит на плато за сутки: кончается питательная среда.
Вирусное распространение. Базовое репродуктивное число $R_0$ — среднее количество людей, которых заражает один больной в полностью восприимчивой популяции. Если $R_0 > 1$, число заражённых растёт как $N_0 R_0^{\,g}$, где $g$ — число поколений заражения. Но популяция конечна: как только значительная доля переболела, «топливо» кончается. Эффективное репродуктивное число $R = R_0\cdot s$, где $s$ — доля ещё восприимчивых, и рост останавливается при $s = 1/R_0$.
Закон Мура. Гордон Мур в 1965 году заметил, что число транзисторов на чипе удваивается примерно каждый год, и в 1975-м скорректировал период до двух лет. Полвека это работало. Но транзистор не может быть меньше атома: постоянная решётки кремния около 0,54 нм, и техпроцессы уже подошли к масштабам в единицы нанометров. Удвоение замедлилось до 2,5–3 лет и продолжает замедляться.
Общий вывод, который надо усвоить намертво:
Чистая экспонента — это модель процесса, у которого есть неограниченный ресурс. Как только ресурс (еда, восприимчивые люди, атомы кремния, рынок, деньги) начинает кончаться — экспонента перестаёт описывать реальность.
Где именно ломается экспонента
Причина всегда одна: у экспоненты относительная скорость роста постоянна. Каждый день прирастает одна и та же доля — скажем, 30%. Реальные системы так себя не ведут: когда популяция приближается к ёмкости среды, относительная скорость падает.
Простейшая правка модели: пусть относительная скорость роста не константа $k$, а убывает линейно по мере заполнения:
$$\text{относительный темп} = k\left(1 - \frac{N}{K}\right)$$где $K$ — ёмкость среды (потолок). Пока $N \ll K$ — множитель почти 1, растём как экспонента. Когда $N \to K$ — множитель стремится к нулю, рост останавливается. Кривая, которая получается из этого условия, называется логистической.
Определение: Логистическая кривая (кривая Ферхюльста, 1838):
$$N(t) = \frac{K}{1 + A\,e^{-kt}},\qquad A = \frac{K - N_0}{N_0}$$где $K$ — ёмкость среды, $N_0 = N(0)$, $k$ — начальный темп роста.
Три её ключевых свойства:
- В начале ($N \ll K$) логистика практически совпадает с экспонентой $N_0e^{kt}$ — на этом участке отличить их по данным почти невозможно
- В середине кривая проходит через точку перегиба при $N = K/2$, и это происходит в момент $t^* = \dfrac{\ln A}{k}$ — момент максимальной абсолютной скорости роста
- В конце кривая выходит на плато $N \to K$ снизу, никогда его не превышая
Форма получается S-образной («сигмоида»). И да — это ровно та самая сигмоида $\sigma(z) = \dfrac{1}{1+e^{-z}}$, которая работает функцией активации в нейросетях и превращает логит в вероятность. Логистическая кривая роста популяции и сигмоида в классификаторе — одна и та же функция, просто с разными подстановками.
Практическое правило прогнозиста: экспоненциальная модель даёт ошибку меньше 10%, пока $N < 0{,}1K$. Дальше она начинает систематически завышать, и чем дальше — тем катастрофичнее. Проблема в том, что $K$ обычно неизвестно. Поэтому прогноз «через месяц будет миллион заражённых», построенный экстраполяцией экспоненты, — почти всегда завышен, и вопрос только в том, насколько.
Примеры с разбором
Пример 19 (простой): в очаге 5 заражённых, $R_0 = 3$, средний интервал между поколениями заражения — 6 дней. Сколько заражённых будет через 30 дней при неограниченном росте?
Решение:
Шаг 1. Число поколений: $g = 30/6 = 5$.
Шаг 2. Модель: $N = N_0\,R_0^{\,g} = 5\cdot 3^5$.
Шаг 3. $3^5 = 243$, значит $N = 5\cdot 243 = 1215$.
Шаг 4. Заодно найдём время удвоения. Непрерывная форма: $k = \dfrac{\ln R_0}{T_g} = \dfrac{\ln 3}{6} = \dfrac{1{,}0986123}{6} = 0{,}1831$ сут⁻¹, значит
$$T_2 = \frac{\ln 2}{k} = \frac{0{,}693147}{0{,}1831} \approx 3{,}79\ \text{суток}$$Проверим наш ответ. За 30 дней должно уложиться $30/3{,}79 = 7{,}92$ удвоения, то есть рост в $2^{7{,}92} = 242$ раза. И правда, $3^5 = 243$ ✅
Ответ: 1215 заражённых; удвоение примерно каждые 3,8 суток.
Пример 20 (средний): в 2010 году топовый процессор содержал около $2\cdot10^9$ транзисторов. Сколько предсказывает закон Мура (удвоение каждые 2 года) на 2030 год? Через сколько лет по этому закону число вырастет в 1000 раз?
Решение:
Шаг 1. Число удвоений с 2010 по 2030: $(2030-2010)/2 = 10$.
Шаг 2. Множитель: $2^{10} = 1024$.
$$N_{2030} = 2\cdot10^9\cdot 1024 = 2{,}048\cdot 10^{12}$$Два триллиона транзисторов на чипе.
Шаг 3. Рост в 1000 раз — это $\log_2 1000 = \dfrac{\ln 1000}{\ln 2} = \dfrac{6{,}907755}{0{,}693147} \approx 9{,}966$ удвоения.
Шаг 4. Время: $9{,}966\cdot 2 \approx 19{,}9$ года — почти ровно 20 лет.
Шаг 5. А теперь — критика модели. Самые крупные реальные чипы сегодня содержат порядка $10^{11}$ транзисторов, то есть на порядок с лишним меньше предсказания. Причина не в математике, а в физике: транзистор не может быть меньше нескольких атомов кремния. Экспонента, которая полвека работала идеально, упирается в жёсткий физический потолок — классический пример «поломки на длинном горизонте».
Проверим наш ответ. Прикидка $2^{10}\approx 10^3$ ✅ — отсюда сразу видно, что 10 удвоений ≈ рост в 1000 раз, что и подтверждает шаги 3–4.
Ответ: $\approx 2{,}05\cdot10^{12}$ по формуле; в 1000 раз — за ≈ 20 лет; реальность заметно отстаёт от модели.
Пример 21 (сложный): популяция описывается логистической моделью с $K = 10\,000$, $N_0 = 100$, $k = 0{,}3$ сут⁻¹. Найди: а) момент, когда популяция достигнет половины ёмкости; б) значение через 30 суток; в) что предсказала бы на 30 сутки чистая экспонента; г) на каком горизонте обе модели ещё согласуются.
Решение:
Шаг 1. Находим параметр $A$:
$$A = \frac{K - N_0}{N_0} = \frac{10\,000 - 100}{100} = 99$$Модель: $N(t) = \dfrac{10\,000}{1 + 99\,e^{-0{,}3t}}$.
а) Половина ёмкости, $N = 5000$.
Шаг 2. Подставляем:
$$\frac{10\,000}{1 + 99e^{-0{,}3t}} = 5000 \ \Longrightarrow\ 1 + 99e^{-0{,}3t} = 2 \ \Longrightarrow\ 99e^{-0{,}3t} = 1$$Шаг 3.
$$e^{-0{,}3t} = \frac{1}{99} \ \Longrightarrow\ 0{,}3t = \ln 99 = 4{,}59512 \ \Longrightarrow\ t \approx 15{,}32\ \text{суток}$$б) Значение на 30-е сутки.
Шаг 4. $e^{-0{,}3\cdot30} = e^{-9} = 1{,}2341\cdot10^{-4}$.
Шаг 5. $99\cdot 1{,}2341\cdot10^{-4} = 0{,}012218$.
$$N(30) = \frac{10\,000}{1{,}012218} \approx 9879$$в) Что сказала бы экспонента.
Шаг 6. $N_{\exp}(30) = 100\,e^{0{,}3\cdot30} = 100\,e^{9} = 100\cdot 8103{,}08 \approx 810\,308$.
Экспонента предсказывает в 81 раз больше самой ёмкости среды. Это не «неточность» — это полная потеря связи с реальностью.
г) Где модели ещё согласуются.
Шаг 7. Возьмём $t = 5$:
$$N_{\text{лог}}(5) = \frac{10\,000}{1 + 99e^{-1{,}5}} = \frac{10\,000}{1 + 99\cdot 0{,}22313} = \frac{10\,000}{23{,}090} \approx 433$$$$N_{\exp}(5) = 100\,e^{1{,}5} = 100\cdot 4{,}4817 \approx 448$$Расхождение всего 3,4%. При $N \approx 0{,}04K$ модели практически неразличимы.
Сведём всё в таблицу:
| $t$, сут | Логистика | Экспонента | Расхождение |
|---|---|---|---|
| 5 | 433 | 448 | +3,5% |
| 10 | 1 687 | 2 009 | +19% |
| 15,3 | 5 000 | 9 900 | +98% |
| 20 | 8 030 | 40 343 | ×5,0 |
| 30 | 9 879 | 810 308 | ×82 |
Проверим наш ответ. Проверим строку $t=10$: $99e^{-3} = 99\cdot 0{,}0497871 = 4{,}9289$; $N = 10\,000/5{,}9289 = 1687$ ✅ И строку $t=20$: $99e^{-6} = 99\cdot 0{,}00247875 = 0{,}24540$; $N = 10\,000/1{,}24540 = 8030$ ✅ Логистика при $t=30$ практически упёрлась в потолок $K = 10\,000$, как и должна ✅
Ответ: а) ≈ 15,3 суток; б) ≈ 9879; в) ≈ 810 000 (бессмыслица, в 81 раз выше ёмкости); г) модели совпадают в пределах нескольких процентов примерно до $t = 5{-}7$ суток, пока $N < 0{,}1K$.
Почему это важно
Это самый практически ценный раздел урока. Каждый раз, когда ты видишь график, уходящий вверх по экспоненте, — от числа пользователей продукта до размера обучающих датасетов — задавай два вопроса: что здесь ресурс и где потолок. Если ресурс не назван, значит модель просто ещё не дошла до места своего слома.
В машинном обучении это работает буквально. Число параметров моделей росло экспоненциально с 2018 по 2021 год — и остановилось, упершись в стоимость и в доступный объём качественных текстовых данных. Кривые обучения (loss от числа шагов) в начале падают почти экспоненциально, а потом выходят на плато — потому что есть неустранимый уровень ошибки, определяемый шумом в данных. Метрика на валидации растёт-растёт и упирается. Логистика — это язык, на котором описывается любое насыщение, и умение вовремя сказать «здесь экспонента кончается» стоит дороже, чем умение её посчитать.
Экспоненты в машинном обучении 🤖
Интуиция
Открой почти любой ML-конфиг — и ты увидишь три экспоненты, лежащие рядом и делающие совершенно разные вещи.
Первая — расписание learning rate. В начале обучения шаг делают большим, чтобы быстро добраться до нужной области, а к концу — маленьким, чтобы аккуратно «сесть» в минимум и не прыгать вокруг него. Самое простое расписание — экспоненциальное затухание:
$$lr_n = lr_0\cdot\gamma^{\,n}$$где $n$ — номер эпохи (или шага), $\gamma$ чуть меньше единицы: 0,95, 0,99, 0,999. Это буквально радиоактивный распад, только распадается шаг обучения.
Второй популярный вариант — ступенчатое расписание (StepLR): каждые $S$ эпох умножать lr на $\gamma_{\text{step}}$ (обычно 0,1). Это та же экспонента, просто с крупным периодом:
Вторая — экспоненциальное скользящее среднее (EMA). Adam хранит не сам градиент, а его сглаженную историю:
$$m_t = \beta m_{t-1} + (1-\beta)g_t$$Если раскрыть рекурсию, получится, что градиент, полученный $j$ шагов назад, входит в $m_t$ с весом $(1-\beta)\beta^{\,j}$ — то есть вес старых наблюдений затухает экспоненциально.
Третья — weight decay. Каждый шаг веса дополнительно чуть-чуть уменьшают:
$$w_{n+1} = (1 - \eta\lambda)\,w_n$$и в отсутствие градиента вес просто экспоненциально сползает к нулю — это регуляризация, мешающая модели «выучить наизусть» тренировочные данные.
Эффективное окно EMA
Разберём вторую экспоненту подробнее, потому что тут людей путает интуиция.
Веса $(1-\beta)\beta^{\,j}$ образуют бесконечную геометрическую последовательность, сумма которой равна ровно 1 (это важно: EMA — честное усреднение). Насколько «глубоко в прошлое» смотрит такое среднее?
Определение: Эффективное окно экспоненциального скользящего среднего с коэффициентом $\beta$ равно
$$W = \frac{1}{1-\beta}$$а «период полураспада» вклада наблюдения — $h = \dfrac{\ln 2}{\ln(1/\beta)}$.
Стандартные значения из Adam:
| $\beta$ | Окно $W$ | Полураспад $h$ | Что это значит |
|---|---|---|---|
| 0,9 | 10 шагов | 6,6 шага | $\beta_1$: сглаживание направления градиента |
| 0,99 | 100 шагов | 69 шагов | промежуточный вариант |
| 0,999 | 1000 шагов | 693 шага | $\beta_2$: оценка масштаба градиента |
Отсюда, кстати, понятна необходимость коррекции смещения (bias correction) в Adam. На старте $m_0 = 0$, и первые шаги среднее сильно занижено — ведь оно усредняется с нулём. Поправочный множитель $\dfrac{1}{1-\beta^t}$ — снова экспонента, и она заметна дольше, чем кажется: при $\beta = 0{,}999$ даже на 1000-м шаге поправка ещё почти в 1,6 раза.
Scaling laws — это степенной закон, а не экспоненциальный ⚠️
Вот место, где путаница стоит дороже всего.
Loss большой языковой модели в зависимости от числа параметров $N$ описывается формулой вида
$$L(N) = \left(\frac{N_c}{N}\right)^{\alpha},\qquad \alpha \approx 0{,}076$$Это степенной закон: $L \propto N^{-\alpha}$. Не экспоненциальный $L \propto e^{-\alpha N}$. Разница гигантская.
Ключевое различие:
- У экспоненты постоянный прирост аргумента даёт постоянный множитель отклика. Добавил ещё миллиард параметров — loss упал вдвое; добавил ещё миллиард — ещё вдвое
- У степенного закона постоянное отношение аргументов даёт постоянный множитель отклика. Удвоил число параметров — loss упал на 5%; ещё удвоил — ещё на 5%
Экспонента «платит» линейно, степенной закон — мультипликативно. Именно поэтому обучение фронтирных моделей дорожает так стремительно: чтобы получить фиксированное улучшение, надо каждый раз умножать бюджет, а не прибавлять к нему.
Как отличить их по данным, если у тебя есть только точки на графике:
- Постройте $\ln L$ против $\ln N$ (log-log). Прямая → степенной закон, наклон = $-\alpha$
- Постройте $\ln L$ против $N$ (semi-log). Прямая → экспоненциальный закон
Это же и есть практический тест, который стоит проводить всегда, прежде чем экстраполировать.
И ещё одно наблюдение, из-за которого путаница живуча. Вычислительный бюджет обучения рос экспоненциально по времени (удвоение каждые несколько месяцев), а loss падает степенным образом по бюджету. Подставим одно в другое: если $C(t) = C_0e^{gt}$ и $L \propto C^{-\alpha}$, то
$$L(t) \propto \left(C_0e^{gt}\right)^{-\alpha} = \text{const}\cdot e^{-\alpha g\,t}$$То есть во времени loss действительно падает экспоненциально — но только пока продолжается экспоненциальный рост бюджета. Как только вычисления перестают удваиваться, красивая экспонента по времени мгновенно исчезает, а суровый степенной закон по ресурсу остаётся. Ровно та же история, что с законом Мура.
Примеры с разбором
Пример 22 (простой): ExponentialLR с $lr_0 = 0{,}01$ и $\gamma = 0{,}9$. Чему равен learning rate после 20 эпох и во сколько раз он упал?
Решение:
Шаг 1. Формула: $lr_{20} = 0{,}01\cdot 0{,}9^{20}$.
Шаг 2. Считаем степень пошагово:
$$0{,}9^2 = 0{,}81,\quad 0{,}9^4 = 0{,}6561,\quad 0{,}9^5 = 0{,}59049,\quad 0{,}9^{10} = 0{,}34868,\quad 0{,}9^{20} = 0{,}12158$$Шаг 3. $lr_{20} = 0{,}01\cdot 0{,}12158 = 1{,}216\cdot10^{-3}$.
Шаг 4. Упал в $1/0{,}12158 \approx 8{,}2$ раза.
Проверим наш ответ. Полураспад: $\ln 2/\ln(1/0{,}9) = 0{,}693147/0{,}105361 = 6{,}58$ эпохи. За 20 эпох — три полураспада, то есть примерно в 8 раз ✅
Ответ: $lr_{20} \approx 0{,}00122$, падение в 8,2 раза.
Пример 23 (средний): $lr_0 = 0{,}1$, $\gamma = 0{,}95$ за эпоху. На какой эпохе learning rate впервые станет меньше $0{,}001$? Сколько эпох понадобилось бы при $\gamma = 0{,}99$?
Решение:
Шаг 1. Условие: $0{,}1\cdot 0{,}95^{\,n} < 0{,}001$, то есть $0{,}95^{\,n} < 0{,}01$.
Шаг 2. Логарифмируем. Внимание на знак: $\ln 0{,}95 < 0$, поэтому при делении неравенство переворачивается:
$$n\ln 0{,}95 < \ln 0{,}01 \ \Longrightarrow\ n > \frac{\ln 0{,}01}{\ln 0{,}95} = \frac{-4{,}605170}{-0{,}051293} = 89{,}78$$Шаг 3. Значит первое целое $n = 90$.
Шаг 4. Проверим границу честно:
$$0{,}95^{89} = e^{-89\cdot0{,}051293} = e^{-4{,}5651} = 0{,}010423 \ \Rightarrow\ lr = 1{,}042\cdot10^{-3} > 10^{-3}$$$$0{,}95^{90} = e^{-4{,}6164} = 0{,}009902 \ \Rightarrow\ lr = 9{,}902\cdot10^{-4} < 10^{-3}\ ✅$$Шаг 5. Для $\gamma = 0{,}99$:
$$n > \frac{\ln 0{,}01}{\ln 0{,}99} = \frac{-4{,}605170}{-0{,}010050} = 458{,}2 \ \Longrightarrow\ n = 459$$Шаг 6. Полезное сравнение. Изменение $\gamma$ с 0,95 на 0,99 — на вид «мелочь», четыре сотых. А число эпох до того же порога выросло в 5,1 раза. Это типичная ловушка гиперпараметров: чувствительность к $\gamma$ огромная, потому что $\gamma$ сидит в основании степени.
Ответ: при $\gamma = 0{,}95$ — эпоха 90; при $\gamma = 0{,}99$ — эпоха 459.
Пример 24 (средний): в Adam используется $\beta_2 = 0{,}999$. Найди эффективное окно, период полураспада вклада градиента, величину bias-correction на шагах 100 и 1000 и номер шага, после которого коррекцией можно пренебречь (менее 1%).
Решение:
Шаг 1. Эффективное окно.
$$W = \frac{1}{1-\beta_2} = \frac{1}{0{,}001} = 1000\ \text{шагов}$$Шаг 2. Период полураспада вклада. Вес наблюдения давности $j$ пропорционален $\beta_2^{\,j}$:
$$h = \frac{\ln 2}{\ln(1/0{,}999)} = \frac{0{,}693147}{0{,}0010005} \approx 692{,}8\ \text{шага}$$То есть градиент, полученный ~693 шага назад, влияет вдвое слабее свежего.
Шаг 3. Коррекция на шаге 100.
$$\beta_2^{100} = e^{100\cdot\ln 0{,}999} = e^{-0{,}10005} = 0{,}904787$$$$1 - \beta_2^{100} = 0{,}095213 \ \Longrightarrow\ \text{множитель коррекции} = \frac{1}{0{,}095213} \approx 10{,}5$$На сотом шаге сырая оценка занижена более чем в десять раз!
Шаг 4. Коррекция на шаге 1000.
$$\beta_2^{1000} = e^{-1{,}0005} = 0{,}367695;\qquad 1-\beta_2^{1000} = 0{,}632305 \ \Longrightarrow\ \text{множитель} \approx 1{,}582$$Шаг 5. Когда коррекция меньше 1%? Нужно $\beta_2^{\,t} < 0{,}01$:
$$t > \frac{\ln 0{,}01}{\ln 0{,}999} = \frac{-4{,}605170}{-0{,}0010005} = 4602{,}4 \ \Longrightarrow\ t = 4603$$Проверим наш ответ. Шаг 4603 — это $4603/692{,}8 = 6{,}64$ периода полураспада, а $2^{-6{,}64} \approx 0{,}01$ ✅ Всё сходится (и это ровно те же 6,64 периода, что мы получали в задаче про стронций — приятное совпадение, показывающее, что математика одна).
Ответ: $W = 1000$; $h \approx 693$ шага; коррекция ×10,5 на шаге 100 и ×1,58 на шаге 1000; пренебречь можно примерно с шага 4600.
Пример 25 (сложный): scaling law $L(N) = (N_c/N)^{0{,}076}$. а) На сколько процентов упадёт loss при удвоении числа параметров? б) Во сколько раз надо увеличить $N$, чтобы loss упал на 10%? в) Во сколько раз — чтобы упал вдвое? г) Как выглядели бы ответы, если бы закон был экспоненциальным?
Решение:
а) Удвоение $N$.
Шаг 1. Отношение loss:
$$\frac{L(2N)}{L(N)} = \left(\frac{N}{2N}\right)^{0{,}076} = 2^{-0{,}076}$$Шаг 2. $2^{-0{,}076} = e^{-0{,}076\cdot 0{,}693147} = e^{-0{,}0526792} = 0{,}948684$.
Loss падает на $1 - 0{,}9487 = 5{,}13\%$.
б) Падение loss на 10% (в 0,9 раза).
Шаг 3. Пусть $N$ надо умножить на $x$. Тогда
$$x^{-0{,}076} = 0{,}9 \ \Longrightarrow\ -0{,}076\ln x = \ln 0{,}9 \ \Longrightarrow\ \ln x = \frac{-\ln 0{,}9}{0{,}076} = \frac{0{,}1053605}{0{,}076} = 1{,}386322$$Шаг 4. $x = e^{1{,}386322} = 4{,}00$.
Красивый результат: чтобы срезать 10% loss, нужно вчетверо больше параметров.
в) Падение loss вдвое.
Шаг 5.
$$\ln x = \frac{\ln 2}{0{,}076} = \frac{0{,}693147}{0{,}076} = 9{,}12036 \ \Longrightarrow\ x = e^{9{,}12036} \approx 9140$$Модель должна вырасти примерно в девять тысяч раз. Была модель на 7 миллиардов параметров — понадобится 64 триллиона.
Шаг 6. Тот же ответ через удвоения: одно удвоение даёт множитель $0{,}9487$, нужно $m$ удвоений, чтобы $0{,}9487^m = 0{,}5$:
$$m = \frac{\ln 0{,}5}{\ln 0{,}948684} = \frac{-0{,}693147}{-0{,}0526792} = 13{,}158$$$$x = 2^{13{,}158} = 2^{13}\cdot 2^{0{,}158} = 8192\cdot 1{,}1157 \approx 9140\ ✅$$г) Если бы закон был экспоненциальным.
Шаг 7. Пусть $L = L_0e^{-cN}$. Тогда падение вдвое требует фиксированной прибавки $\Delta N = \dfrac{\ln 2}{c}$ — одной и той же каждый раз. Первое удешевление и сотое стоили бы одинаково.
Шаг 8. Экономический смысл разницы: при степенном законе каждое следующее улучшение loss на одну и ту же величину требует умножения бюджета на постоянный коэффициент — то есть экспоненциально растущих затрат. При экспоненциальном законе затраты росли бы линейно. Именно поэтому прогресс упирается в деньги, а не в идеи.
Проверим наш ответ. Проверим (б) обратной подстановкой: $4^{-0{,}076} = e^{-0{,}076\cdot 1{,}386294} = e^{-0{,}1053584} = 0{,}90000$ ✅ Ровно 0,9.
Ответ: а) −5,13%; б) в 4 раза; в) примерно в 9140 раз; г) экспоненциальный закон требовал бы одинаковой добавки параметров на каждое удвоение качества, а не одинакового множителя.
Пример 26 (сложный): в AdamW используется decoupled weight decay: $w_{n+1} = (1-\eta\lambda)w_n$ (плюс градиентная часть). При $\eta = 0{,}05$ и $\lambda = 0{,}002$ найди: а) через сколько шагов вес уменьшится вдвое, если градиент по нему нулевой; б) во сколько раз он уменьшится за 10 000 шагов; в) какое $\lambda$ нужно, чтобы полураспад составлял 2000 шагов?
Решение:
Шаг 1. Множитель за шаг:
$$1 - \eta\lambda = 1 - 0{,}05\cdot 0{,}002 = 1 - 0{,}0001 = 0{,}9999$$а) Полураспад.
Шаг 2.
$$0{,}9999^{\,n} = 0{,}5 \ \Longrightarrow\ n = \frac{\ln 0{,}5}{\ln 0{,}9999} = \frac{-0{,}693147}{-0{,}000100005} \approx 6931\ \text{шаг}$$Шаг 3. Удобное приближение: при малом $\eta\lambda$ работает $\ln(1-\eta\lambda)\approx -\eta\lambda$, поэтому
$$n_{1/2}\approx\frac{\ln 2}{\eta\lambda} = \frac{0{,}693147}{0{,}0001} = 6931{,}5$$Приближение сошлось с точным ответом до четвёртого знака.
б) За 10 000 шагов.
Шаг 4.
$$0{,}9999^{10\,000} = e^{10\,000\cdot(-0{,}000100005)} = e^{-1{,}00005} \approx 0{,}36786$$Вес упадёт до 36,8% — то есть ровно в $e$ раз. Это не совпадение: при $\eta\lambda\cdot n = 1$ множитель всегда $\approx 1/e$.
в) Подбор $\lambda$ под заданный полураспад.
Шаг 5.
$$\frac{\ln 2}{\eta\lambda} = 2000 \ \Longrightarrow\ \eta\lambda = \frac{0{,}693147}{2000} = 3{,}4657\cdot10^{-4}$$$$\lambda = \frac{3{,}4657\cdot10^{-4}}{0{,}05} = 6{,}93\cdot10^{-3} \approx 0{,}0069$$Проверим наш ответ. $(1 - 0{,}05\cdot 0{,}0069)^{2000} = (1-3{,}465\cdot10^{-4})^{2000} = e^{2000\cdot(-3{,}4656\cdot10^{-4})} = e^{-0{,}69312} \approx 0{,}5$ ✅
Ответ: а) ≈ 6931 шаг; б) до 36,8% (в $e$ раз); в) $\lambda \approx 0{,}0069$.
Почему это важно
Тут стоит остановиться и оценить, что произошло. Мы взяли ровно ту же формулу, которой считали банковский вклад и возраст мамонта, и не меняя в ней ни одного символа посчитали номер эпохи, когда обучение фактически замрёт; глубину памяти оптимизатора; силу регуляризации. Не потому, что «математика везде» — а потому, что все эти процессы устроены одинаково: каждый шаг умножает величину на одно и то же число.
Практическая польза совершенно конкретная. Умея за десять секунд прикинуть $n = \ln(\text{порог})/\ln\gamma$, ты сразу видишь, что конфиг с $\gamma = 0{,}99$ на 30 эпох вообще ничего не затухнет ($0{,}99^{30} = 0{,}74$ — lr упал всего на четверть), а с $\gamma = 0{,}9$ на 200 эпох модель перестанет учиться после первой сотни. Это экономит часы GPU-времени и избавляет от расследований «почему loss встал на плато».
Практика: 30 заданий
Базовые (задания 1-10)
Задание 1: На вклад положили 50 000 ₽ под 10% годовых со сложным процентом. Сколько будет на счету через 3 года?
Задание 2: Период полураспада йода-131 равен 8 суткам. Сколько останется от 40 г через 24 суток?
Задание 3: Дана модель $N(t) = 100\cdot 2^{t/5}$, где $t$ — время в часах. Найди $N(15)$.
Задание 4: В образце древесины осталось 25% исходного углерода-14. Период полураспада $^{14}\mathrm{C}$ — 5730 лет. Каков возраст образца?
Задание 5: Оцени по правилу 72, за сколько лет удвоится вклад под 6% годовых. Затем посчитай точно и сравни.
Задание 6: Расписание learning rate задано формулой $lr_n = 0{,}2\cdot 0{,}5^{\,n}$, где $n$ — число выполненных понижений. Чему равен $lr$ после четвёртого понижения?
Задание 7: Величина растёт по закону $N(t) = N_0e^{0{,}05t}$, где $t$ — годы. Во сколько раз она вырастет за 20 лет?
Задание 8: Мощность сигнала ослабла в 1000 раз. Сколько это децибел?
Задание 9: Бактерии удваиваются каждые 20 минут. Сейчас их 500. Сколько будет через 2 часа?
Задание 10: В оптимизаторе используется экспоненциальное скользящее среднее с $\beta = 0{,}98$. Найди эффективное окно и период полураспада вклада наблюдения.
Средние (задания 11-20)
Задание 11: За сколько лет вклад под 7% годовых вырастет в 3 раза? Дай точный ответ и число полных лет.
Задание 12: В археологической находке сохранилось 30% исходного количества $^{14}\mathrm{C}$. Определи возраст ($T = 5730$ лет).
Задание 13: Чай при 95 °C остывает в комнате при 25 °C. Через 5 минут его температура 80 °C. Какой она будет через 20 минут от начала?
Задание 14: ExponentialLR с $lr_0 = 0{,}1$ и $\gamma = 0{,}98$. На какой эпохе learning rate впервые станет меньше $0{,}01$?
Задание 15: В 1971 году процессор Intel 4004 содержал 2300 транзисторов. Что предсказывает закон Мура (удвоение каждые 2 года) на 2021 год?
Задание 16: В очаге 20 заражённых, базовое репродуктивное число $R_0 = 1{,}8$, интервал между поколениями заражения 4 дня. Сколько заражённых будет через 24 дня? Найди также время удвоения.
Задание 17: Банк предлагает 8% годовых. Что выгоднее — годовая или ежеквартальная капитализация? Посчитай разницу на сумме 200 000 ₽ за один год.
Задание 18: Оптическое волокно имеет затухание 0,35 дБ/км. а) На какой длине сигнал ослабнет ровно вдвое? б) Какова максимальная длина линии при бюджете 21 дБ?
Задание 19: В EMA с $\beta = 0{,}9$ вклад градиента затухает как $\beta^{\,j}$. Через сколько шагов вклад станет меньше 1% от первоначального?
Задание 20: Логистическая модель: $K = 1000$, $N_0 = 50$, $k = 0{,}4$ сут⁻¹. а) Когда популяция достигнет 500? б) Чему равна популяция на 10-е сутки?
Продвинутые (задания 21-30)
Задание 21: За 3 часа от препарата осталось 40% исходного количества. Найди период полураспада.
Задание 22: Банк A предлагает 10% годовых с годовой капитализацией, банк B — 9,6% годовых с ежемесячной. Какой вклад выгоднее? Посчитай разницу на 500 000 ₽ за год.
Задание 23: В образце содержание $^{14}\mathrm{C}$ в 4,2 раза меньше, чем в живой ткани. Определи возраст образца ($T = 5730$ лет).
Задание 24: Печь выключили в 12:00, её температура была 220 °C. В 12:30 она остыла до 120 °C. Температура цеха 20 °C. Когда печь остынет до 40 °C?
Задание 25: У стартапа 5000 пользователей, база растёт на 12% в месяц. Ёмкость рынка — 2 000 000 человек. а) Когда наивная экспоненциальная модель предсказывает захват всего рынка? б) Когда логистическая модель с тем же начальным темпом даст половину рынка? в) Насколько модели расходятся на 36-м месяце?
Задание 26: Scaling law по объёму данных: $L(D) = (D_c/D)^{0{,}095}$. а) Во сколько раз надо увеличить датасет, чтобы loss упал на 20%? б) Если объём доступных данных растёт на 40% в год, сколько лет на это уйдёт?
Задание 27: В SGD с weight decay вес без градиента меняется как $w_{n+1} = (1-\eta\lambda)w_n$. При $\eta = 0{,}01$ подбери $\lambda$ так, чтобы за 50 000 шагов вес уменьшился в 100 раз. Найди также период полураспада веса.
Задание 28: Вычислительный бюджет обучения передовых моделей одно время удваивался каждые 3,4 месяца. а) За какое время он вырос бы в 1000 раз? б) Во сколько раз за то же время вырос бы показатель, подчиняющийся закону Мура (удвоение за 24 месяца)? в) Во сколько раз одно опережает другое?
Задание 29: Капитал растёт на 15% в год, инфляция составляет 8% в год. а) Каков реальный годовой рост покупательной способности? б) За сколько лет она удвоится? в) Насколько ошибётся наивный расчёт «15% − 8% = 7%»?
Задание 30: В образце смешаны два изотопа: по 100 г каждого. У изотопа A период полураспада 2 суток, у изотопа B — 10 суток. а) Через сколько суток масса A составит 10% от массы B? б) Во сколько раз масса B будет больше массы A через 20 суток?
Частые ошибки
❌ Ошибка 1: складывать проценты вместо перемножения множителей
Неправильно: «Вклад под 5% годовых за 10 лет вырастет на $5\cdot10 = 50\%$». Или: «Акция упала на 50%, потом выросла на 50% — вернулась обратно».
Правильно: множители перемножаются. За 10 лет под 5%: $1{,}05^{10} = 1{,}6289$, то есть рост на 62,9%, а не на 50%. Падение и рост на 50%: $0{,}5\cdot 1{,}5 = 0{,}75$ — итог минус 25%, а не ноль.
Почему важно: это фундаментальное свойство мультипликативных процессов, и оно ломает интуицию во всех задачах сразу. Ошибка растёт с горизонтом: за 30 лет под 5% «сложение» даст 150%, а реальность — 332%. Тот же принцип в ML: если ты понижаешь lr на 10% каждую эпоху, за 20 эпох он упадёт не на 200% (что бессмысленно), а до $0{,}9^{20} = 12{,}2\%$ от исходного.
❌ Ошибка 2: путать процент за период с непрерывной ставкой $k$
Неправильно: «Рост 20% в год, значит модель $N = N_0e^{0{,}2t}$».
Правильно: это две разные вещи. Если рост дискретный, 20% раз в год — модель $N = N_0\cdot 1{,}2^{\,t}$, и её непрерывный эквивалент — $N = N_0e^{kt}$ с $k = \ln 1{,}2 = 0{,}1823$, а не $0{,}2$. Наоборот, если дана непрерывная ставка $k = 0{,}2$, то фактический годовой прирост равен $e^{0{,}2} - 1 = 22{,}14\%$, а не 20%.
Почему важно: при малых ставках разница мала ($k = 0{,}0488$ против 5% — расхождение 2,4%), но при больших она взрывается: для 100% годовых $k = \ln 2 = 0{,}693$, а $e^{1{,}0} = 2{,}718$ — это уже рост в 2,7 раза вместо 2. Та же путаница живёт в финансах под названием «номинальная ставка против эффективной»: 12% с ежемесячной капитализацией — это на самом деле 12,683% за год.
❌ Ошибка 3: считать, что за два периода полураспада вещество исчезнет полностью
Неправильно: «Период полураспада 8 суток, значит за 16 суток вещества не останется».
Правильно: за каждый период остаётся половина от того, что было, а не «уходит половина исходного». За 2 периода останется $1/4$, за 3 — $1/8$, за 10 — примерно $1/1000$. Формально $N$ никогда не обращается в ноль: показательная функция положительна при любом $t$.
Почему важно: отсюда практическое правило радиационной безопасности «10 периодов — и источник практически безопасен» (осталась тысячная доля). И та же логика в ML: сколько бы эпох ни прошло, ExponentialLR никогда не сделает lr равным нулю — он просто станет неразличимо малым. Если тебе нужен именно ноль, нужен другой планировщик.
❌ Ошибка 4: делить вместо логарифмирования
Неправильно: «$2^{t/5} = 40$, значит $t/5 = 20$, потому что $40/2 = 20$».
Правильно: неизвестное сидит в показателе, и достать его оттуда можно только логарифмом:
$$\frac{t}{5} = \log_2 40 = \frac{\ln 40}{\ln 2} = \frac{3{,}6888795}{0{,}6931472} = 5{,}3219 \ \Longrightarrow\ t = 26{,}61$$Почему важно: это самая механическая из ошибок, и её легко поймать проверкой. Подставь свой ответ обратно: $2^{20} = 1\,048\,576$ — очевидно не 40. Всегда прогоняй обратную подстановку хотя бы приблизительно; в задачах на рост порядок величины сразу выдаёт ошибку.
❌ Ошибка 5: экстраполировать чистую экспоненту на длинный горизонт
Неправильно: «Число пользователей растёт на 12% в месяц, значит через 5 лет их будет $5000\cdot 1{,}12^{60} = 4{,}6$ млн» — при том, что весь рынок составляет 2 млн человек.
Правильно: экспонента описывает процесс только пока ресурс не ограничивает рост. Как только величина приближается к ёмкости $K$, нужна логистическая модель
$$N(t) = \frac{K}{1+Ae^{-kt}},\qquad A = \frac{K-N_0}{N_0}$$Практическая граница: пока $N < 0{,}1K$, экспонента ошибается меньше чем на 10%; дальше расхождение растёт стремительно.
Почему важно: это ошибка не арифметическая, а модельная — и потому самая дорогая. Экспоненциальные прогнозы «через месяц будет миллион заражённых», «через пять лет модели вырастут в тысячу раз», «выручка удвоится ещё десять раз подряд» — почти всегда завышены. Прежде чем экстраполировать, назови ресурс и оцени потолок. Если ресурс не назван — модель ещё просто не дошла до места своего слома.
❌ Ошибка 6: путать степенной закон с экспоненциальным
Неправильно: «Loss падает по scaling law, то есть экспоненциально по числу параметров».
Правильно: scaling laws — это степенной закон $L \propto N^{-\alpha}$, а не экспоненциальный $L\propto e^{-\alpha N}$. У степенного закона постоянный множитель отклика даёт постоянное отношение аргументов (удвоил $N$ — срезал 5% loss), у экспоненциального — постоянную добавку к аргументу.
Почему важно: от этого зависит вся экономика проекта. При степенном законе каждое следующее одинаковое улучшение требует умножения бюджета на постоянный коэффициент — затраты растут экспоненциально. Проверить, какой у тебя закон, можно за две минуты: построй $\ln y$ против $\ln x$ (прямая → степенной) и $\ln y$ против $x$ (прямая → экспоненциальный).
❌ Ошибка 7: не согласовать единицы времени и период
Неправильно: «$k = 0{,}05$ в сутки, прошло 12 часов, значит $e^{-0{,}05\cdot 12}$». Или: «12% годовых, капитализация ежемесячная — значит $(1+0{,}12)^{12}$».
Правильно: в первом случае 12 часов — это 0,5 суток, и надо считать $e^{-0{,}05\cdot 0{,}5}$. Во втором ставку тоже надо привести к периоду: $(1+0{,}12/12)^{12} = 1{,}01^{12}$.
Почему важно: ошибка в единицах не даёт «немного другой» ответ — она даёт ответ, отличающийся на порядки. $(1{,}12)^{12} = 3{,}896$ вместо $1{,}127$ — это разница в 3,5 раза. Возьми за правило: первым делом выписывай, в каких единицах измеряется $t$, и приводи к ним всё остальное.
❌ Ошибка 8: забыть вычесть температуру среды в законе Ньютона
Неправильно: «Кофе 90 °C остывает, через 10 минут 70 °C, значит множитель $70/90 = 0{,}778$ за 10 минут».
Правильно: экспоненциально убывает разность с температурой среды. При комнате 20 °C: $\Delta_0 = 70$, $\Delta(10) = 50$, множитель $50/70 = 0{,}714$ — совсем другое число.
Почему важно: без вычитания среды модель предсказывает остывание до абсолютного нуля, что физически невозможно. И это общий приём: если процесс стремится не к нулю, а к какому-то уровню — вычти этот уровень, и получишь чистую экспоненту. Тот же ход применяется к формулам вида $L(N) = L_\infty + (N_c/N)^\alpha$, где $L_\infty$ — неустранимый уровень ошибки.
Главное запомнить
-
Единая модель. Всё, что растёт или убывает пропорционально самому себе, описывается формулой $N(t) = N_0a^{t/T} = N_0e^{kt}$, где $N_0$ — начальное значение, $a$ — множитель за период $T$, $k$ — непрерывный темп.
-
Перевод между записями. $k = \dfrac{\ln a}{T}$ и $T = \dfrac{\ln a}{k}$. При процентной ставке $p$% за период $a = 1+\dfrac{p}{100}$, а $k = \ln\left(1+\dfrac{p}{100}\right)$ — не $p/100$!
-
Обратная задача решается логарифмом. $t = T\cdot\dfrac{\ln(N/N_0)}{\ln a}$ или $t = \dfrac{1}{k}\ln\dfrac{N}{N_0}$. Время зависит только от отношения $N/N_0$, а не от самих чисел.
-
Время удвоения: $T_2 = \dfrac{\ln 2}{k} \approx \dfrac{0{,}693}{k}$. Время полураспада — та же формула с $|k|$: $T_{1/2} = \dfrac{\ln 2}{|k|}$.
-
Правило 72: удвоение при ставке $p$% за период происходит примерно за $\dfrac{72}{p}$ периодов. Ошибка меньше 1% при $p$ от 4 до 12; для непрерывного роста точнее правило 70 (а строго — 69,3).
-
Сложный процент и капитализация. $S(t) = S_0\left(1+\dfrac{r}{m}\right)^{mt}$, эффективная годовая ставка $= \left(1+\dfrac{r}{m}\right)^m - 1$. При $m\to\infty$ получается предел $e^{r}$ — сравнивать вклады нужно по эффективной ставке, а не по номинальной.
-
Период полураспада не зависит ни от начального количества, ни от прошедшего времени. За 2 периода остаётся $1/4$, за 3 — $1/8$, за 10 — примерно $1/1000$. Полностью вещество не исчезает никогда.
-
Закон Ньютона об охлаждении: $T(t) = T_{\text{ср}} + (T_0-T_{\text{ср}})e^{-kt}$. Сначала вычти среду — дальше обычный распад. Общий приём для любого процесса с ненулевым пределом.
-
Децибелы: $L = 10\lg\dfrac{P}{P_0}$; 3 дБ ≈ вдвое, 10 дБ = в 10 раз, 20 дБ = в 100 раз. Децибелы складываются там, где разы перемножаются.
-
Экспонента всегда врёт на длинном горизонте. Реальные процессы описываются логистикой $N(t) = \dfrac{K}{1+Ae^{-kt}}$, $A = \dfrac{K-N_0}{N_0}$; половина ёмкости достигается при $t^*=\dfrac{\ln A}{k}$. Экспонента годна, пока $N < 0{,}1K$.
-
Степенной закон $\ne$ экспоненциальный. Scaling laws $L\propto N^{-\alpha}$ — степенные: постоянное отношение аргументов даёт постоянный множитель отклика. При $\alpha = 0{,}076$ удвоение $N$ срезает 5% loss, а падение loss вдвое требует роста $N$ примерно в 9000 раз.
-
Полезные константы наизусть: $\ln 2 \approx 0{,}693$; $\ln 10 \approx 2{,}303$; $\log_2 10 \approx 3{,}322$; $2^{10} = 1024\approx 10^3$; $e \approx 2{,}718$; $10\lg 2 \approx 3{,}01$.
Связь с другими темами курса
Что было до этого. Этот урок — прямое приложение трёх предыдущих больших блоков. Показательная функция и её свойства дали саму модель $a^{t/T}$: монотонность, положительность, правила действий со степенями. Логарифмы (уроки 116–122) дали инструмент обратного хода — без них уравнение $a^{t/T} = b$ вообще нерешаемо аналитически, а именно оно возникает в 90% прикладных задач. Показательные и логарифмические уравнения (123–124) дали технику: приведение к одному основанию, логарифмирование обеих частей, переход к новой переменной. Здесь всё это встретилось в задачах с реальными числами и единицами измерения.
Что дальше. Следующий урок — последовательности (126), а за ним геометрическая прогрессия (128), которая и есть дискретная версия экспоненты: $b_n = b_1q^{n-1}$ — это ровно наш $N_0a^{t/T}$ при целых значениях $t/T$. Вклад со сложным процентом буквально образует геометрическую прогрессию по годам. Дальше в курсе появится понятие предела (129) — и предел $\left(1+\frac1m\right)^m$ при $m\to\infty$ строго определит число $e$, которое мы пока брали как готовую константу. В уроке 133 придёт производная, и окажется, что экспонента — единственная функция, у которой скорость изменения пропорциональна самому значению; это объяснит, почему все процессы «пропорциональные самим себе» описываются именно ей. А в уроках 223–225 (дифференциальные уравнения) ты научишься не подставлять готовую формулу, а выводить её из условия «скорость роста пропорциональна количеству» — и получишь тот же $N_0e^{kt}$ как решение.
Где это применяется в жизни и в ML/данных:
📊 В машинном обучении: расписания learning rate (ExponentialLR, StepLR), экспоненциальное скользящее среднее в Adam/RMSProp и его эффективное окно $1/(1-\beta)$, bias correction, weight decay в AdamW, EMA-копия весов модели для инференса, экспоненциальное сглаживание метрик в логах.
📈 В data science: экспоненциальное сглаживание рядов (Holt-Winters), кривые удержания пользователей (retention), оценка half-life интереса к контенту, логистическая регрессия (та же сигмоида), S-образные кривые принятия продукта.
💰 В финансах: сложный процент, эффективная ставка, дисконтирование будущих денежных потоков, реальная доходность с поправкой на инфляцию, амортизация.
🔬 В физике и химии: радиоактивный распад и датирование, разряд конденсатора, закон Бугера — Ламберта — Бера для поглощения света, кинетика реакций первого порядка, барометрическая формула.
🏥 В медицине и биологии: период полувыведения лекарства, рост колоний, эпидемиологические модели с $R_0$, фармакокинетика дозирования.
📡 В связи: затухание в кабеле и волокне, бюджет линии, децибелы, отношение сигнал/шум.
Интересные факты
💡 Правилу 72 больше 500 лет, и придумал его бухгалтер. Лука Пачоли записал его в 1494 году в «Summa de arithmetica» — за 120 лет до изобретения логарифмов. То есть правило существовало и работало, хотя объяснить его никто не мог: для этого нужны были и $\ln 2$, и разложение $\ln(1+r)$. Пачоли просто зафиксировал приём, которым купцы пользовались на практике. Забавно, что число 72 оказалось точным именно для 8% — типичной доходности венецианской торговли того времени.
💡 Ядерные испытания создали «бомбовый пик» и подарили биологам машину времени. В 1950-х годах атмосферные ядерные испытания почти удвоили содержание $^{14}\mathrm{C}$ в атмосфере, а после Договора о запрете испытаний 1963 года концентрация начала экспоненциально падать. Этот резкий всплеск с известной формой кривой позволил датировать современные образцы с точностью до года. Шведский исследователь Йонас Фризен использовал его, чтобы измерить возраст клеток человеческого тела: оказалось, что клетки коры головного мозга ровесники самого человека, а клетки кишечника обновляются за считанные дни.
💡 Бернулли не смог посчитать своё собственное число. Задав в 1683 году вопрос про непрерывное начисление процентов, Якоб Бернулли доказал, что предел $\left(1+\frac1m\right)^m$ существует и лежит между 2 и 3, — но точное значение вычислить не сумел. Число получило имя и обозначение только через полвека, у Эйлера. Сегодня $e = 2{,}718281828\ldots$ вычислено на триллионы знаков, и первые из них легко запомнить по подсказке «2,7 — и дважды 1828, год рождения Льва Толстого».
💡 Закон Мура — не закон природы, а самосбывающееся пророчество. Гордон Мур в 1965 году построил экстраполяцию всего по пяти точкам данных и предсказал ежегодное удвоение; в 1975-м скорректировал период до двух лет. Дальше произошло удивительное: индустрия приняла его прогноз как план. Дорожные карты производителей десятилетиями строились так, чтобы попадать в кривую Мура, и закон работал во многом потому, что все в него верили. Как только физика поставила жёсткий предел (транзистор не может быть меньше нескольких атомов кремния с постоянной решётки 0,54 нм), никакая вера уже не помогла — период удвоения растянулся.
💡 Легенда о шахматной доске недооценена. $2^{64}-1 \approx 1{,}8\cdot10^{19}$ зёрен риса — это около 500 миллиардов тонн, примерно тысяча современных мировых годовых урожаев. Но самое интересное в другом: больше половины всего зерна приходится на последнюю клетку. У любой экспоненты последний шаг весит больше, чем вся история до него — свойство, из-за которого экспоненциальные процессы всегда застают врасплох.
Лайфхаки и полезные трюки
1. Считай в «числе периодов», а не в единицах времени
Прежде чем брать калькулятор, спроси: сколько периодов уложилось? Если период полураспада 8 суток, а прошло 24 — это 3 периода, значит делим на 8. Никаких логарифмов. Логарифм нужен только тогда, когда число периодов не целое. Этот вопрос сразу разбивает все задачи на устные и «настоящие».
2. Держи в голове две константы: $\log_2 10 = 3{,}32$ и $2^{10}\approx 10^3$
Из них мгновенно следует всё остальное. Рост в 10 раз — это 3,32 удвоения. В 100 раз — 6,64. В 1000 раз — 9,97, то есть практически ровно 10. Поэтому: «удваивается каждые 2 года» → в 1000 раз за 20 лет. «Полураспад 5730 лет» → до одной тысячной за 57 тысяч лет. Устно, без калькулятора.
3. Правило 72 — и знай, когда оно врёт
$T_2 \approx 72/p$ отлично работает для дискретных ставок 4–12%. Для непрерывного роста ($e^{kt}$) правильное число — 69,3, а не 72, поэтому бери правило 70. Для ставок выше 15% правило 72 систематически занижает срок — там уже считай логарифмом. И зеркально: при падении на $p$% за период величина уменьшается вдвое за те же $72/p$ периодов.
4. Раскладывай децибелы на 10 и 3
Любое число децибел разбивай на десятки (порядки) и тройки (двойки). 26 дБ $= 20 + 3 + 3$ → $100\cdot2\cdot2 = 400$ раз. 37 дБ $= 30+3+3+1$ → $1000\cdot2\cdot2\cdot1{,}26 = 5040$ раз (точно 5012). Точность порядка 1% — более чем достаточно для инженерной прикидки, и всё в уме.
5. Отличай степенной закон от экспоненциального двумя графиками
Есть точки, надо понять природу зависимости — строй два графика подряд: $\ln y$ от $\ln x$ и $\ln y$ от $x$. Где вышла прямая — тот закон и работает (log-log → степенной, наклон даёт показатель; semi-log → экспоненциальный, наклон даёт $k$). Две строки на numpy, а решение о том, можно ли экстраполировать, принимается на порядок увереннее. И помни: экстраполировать по прямой в log-log намного безопаснее, чем в semi-log — степенной закон растёт медленнее и прощает ошибки.
6. Всегда делай обратную подстановку и проверку порядка
Получил $t$ — подставь обратно и посмотри, сходится ли отношение $N/N_0$. Получил «через 20 лет население города вырастет в 400 раз» — остановись и подумай, бывает ли так. Экспоненциальные задачи коварны тем, что ошибка в одном знаке даёт ответ, отличающийся на порядки, и глазом это не ловится. Зато ловится вопросом «а это вообще физически возможно?».
7. Для процентов пользуйся приближением $\ln(1+r)\approx r$, но знай его границу
При $r < 0{,}05$ приближение даёт ошибку меньше 2,5% — можно считать в уме. При $r = 0{,}1$ ошибка уже 5%, при $r = 0{,}2$ — 10%. Похожее приближение работает и для малых множителей затухания: $(1-u)^n \approx e^{-un}$, что мгновенно даёт «weight decay с $\eta\lambda = 10^{-4}$ ужимает вес в $e$ раз за 10 000 шагов».
8. Читай ML-конфиг как задачу на распад
Увидел gamma=0.99 — сразу считай: полураспад lr равен $\ln 2/\ln(1/0{,}99) = 69$ эпох. Если обучение идёт 30 эпох, lr упадёт всего на 26% — расписание фактически не работает. Увидел beta2=0.999 — эффективное окно 1000 шагов, и если у тебя всего 500 шагов на эпоху, оптимизатор «помнит» больше одной эпохи целиком. Эти прикидки занимают секунды и экономят часы отладки.
Возьми любую задачу из этого урока — про вклад, мамонта, кофе, оптоволокно или learning rate — и посмотри на неё ещё раз. Ты решал их одной и той же формулой, меняя только буквы. В этом и есть настоящая сила математики: не в том, чтобы знать двадцать формул, а в том, чтобы увидеть, что двадцать разных задач — это одна задача в разных костюмах.
И одна мысль на будущее, самая важная из всего урока. Экспонента — это модель мира без ограничений, а мир с ограничениями всегда побеждает. Каждый раз, когда ты видишь график, уходящий вертикально вверх, задавай два вопроса: что здесь ресурс и где потолок. Умение посчитать экспоненту делает тебя грамотным. Умение вовремя сказать «а вот здесь она перестанет работать» — делает тебя аналитиком.
Дальше в курсе — последовательности и прогрессии, где та же экспонента предстанет в дискретном виде, а потом пределы, которые наконец строго объяснят, откуда взялось число $e$. Инструмент у тебя уже в руках — осталось разобрать, как он устроен изнутри. 🚀
Понял тему? Закрепи в боте! 🚀
Попрактикуйся на задачах и получи персональные рекомендации от AI
💪 Начать тренировку