🔴 Сложный ⏱️ 60 минут

Основные распределения

📋 Содержание урока

Основные распределения 🎲

Открой любую статью по машинному обучению — от классической линейной регрессии до диффузионных моделей — и ты обязательно наткнёшься на фразы вроде «предполагаем, что шум нормально распределён», «выход модели параметризует распределение Бернулли», «инициализируем веса из $\mathcal{N}(0, 2/n)$», «логарифмируем целевую переменную, потому что она логнормальна». Это не украшение текста и не дань традиции. Это указание на конкретную математическую модель, из которой дальше выводится и функция потерь, и метод обучения, и способ интерпретации результата.

В прошлых шести уроках мы строили общий аппарат: что такое случайная величина, как её описывает функция распределения $F(x)$, что такое плотность, как считать математическое ожидание $E(X)$ и дисперсию $D(X)$, зачем нужны моменты старших порядков. Всё это была теория «про любую случайную величину вообще». Теперь пришло время конкретики. Оказывается, что подавляющее большинство реальных ситуаций описывается не какими-то экзотическими законами, а десятком стандартных распределений, которые встречаются снова и снова: подбрасывание монетки, число кликов за час, время до отказа сервера, распределение зарплат, ошибка измерения прибора.

Этот урок — справочник. Для каждого распределения мы соберём единый паспорт: где оно возникает в природе, какие у него параметры, как выглядит формула вероятности или плотности, чему равны $E(X)$ и $D(X)$, какой формы график и — обязательно — где именно оно всплывает в машинном обучении. А затем, что важнее всего, мы построим карту связей: Бернулли превращается в биномиальное, биномиальное при редких событиях становится пуассоновским, а при больших $n$ — нормальным, экспоненциальное — это обратная сторона пуассоновского, а логнормальное — это просто нормальное, на которое посмотрели через экспоненту.

Смысл этой карты вот в чём. Если ты помнишь десять формул как десять несвязанных фактов, ты их забудешь через неделю. Если ты понимаешь, что все они — родственники, вырастающие друг из друга, то достаточно помнить два-три базовых закона, а остальное восстанавливается за минуту на салфетке. Именно так распределения и держат в голове практикующие датасайентисты.

🎯 Ты узнаешь:

  • Паспорт девяти ключевых распределений: параметры, формулу, $E(X)$, $D(X)$, форму графика и ML-применение
  • Почему распределение Пуассона — это «биномиальное для редких событий», и когда такая замена законна
  • Правило трёх сигм и стандартизацию $Z = \frac{X - \mu}{\sigma}$ — два главных рабочих инструмента с нормальным распределением
  • Что такое свойство отсутствия памяти у экспоненциального распределения и почему оно противоречит здравому смыслу
  • Почему величины с тяжёлым правым хвостом (цены, зарплаты, длительности сессий) логарифмируют перед подачей в модель

История: откуда это взялось?

Первым «именным» распределением стало биномиальное. Швейцарский математик Якоб Бернулли в трактате «Ars Conjectandi», изданном посмертно в 1713 году, разобрал схему независимых испытаний с двумя исходами и вывел формулу вероятности ровно $k$ успехов из $n$ попыток. Задача была абсолютно прикладная: азартные игры и страхование. Но Бернулли пошёл дальше и доказал первый вариант закона больших чисел — что частота успехов при росте $n$ стягивается к вероятности. Схему Бернулли мы разбирали в уроке 233; сейчас мы посмотрим на неё как на источник целого семейства распределений.

Через двадцать лет, в 1733 году, француз-эмигрант Абрахам де Муавр, работавший в Лондоне и зарабатывавший консультациями по азартным играм, столкнулся с чисто вычислительной проблемой: считать биномиальные коэффициенты при $n = 1000$ вручную невозможно. Он нашёл приближение — гладкую кривую вида $e^{-x^2}$, которая ложится поверх столбиков биномиального распределения. Так впервые появилась нормальная кривая, причём не как самостоятельный объект, а как вычислительный трюк. Полноценный статус ей придали Карл Фридрих Гаусс (1809, теория ошибок астрономических наблюдений) и Пьер-Симон Лаплас, который в 1810 году доказал общую версию предельной теоремы. Отсюда и двойное имя: гауссово распределение, или распределение Гаусса — Лапласа.

Распределение Пуассона появилось в 1837 году в работе Симеона Дени Пуассона «Recherches sur la probabilité des jugements» — исследовании о вероятности судебных приговоров. Долгое время оно считалось математическим курьёзом, пока в 1898 году русско-немецкий статистик Владислав Борткевич не применил его к совершенно неожиданным данным: числу прусских кавалеристов, погибших за год от удара копытом лошади. Данные по 14 корпусам за 20 лет легли на пуассоновскую кривую практически идеально. Так родилась знаменитая формулировка «закон малых чисел»: редкие события в большой популяции ведут себя предсказуемо, даже если каждое из них случайно.

Логнормальное распределение — самое молодое из нашей девятки. Идея, что произведение множества независимых случайных факторов даёт не нормальное, а логнормальное распределение, оформилась в работах Фрэнсиса Гальтона (1879) и Дональда Мак-Алистера, а систематическое изложение появилось только в 1957 году в книге Айчисона и Брауна. Сегодня именно логнормальная модель объясняет, почему зарплаты, цены на жильё, длительности пользовательских сессий и размеры файлов на диске имеют характерный «горб слева и длинный хвост справа» — и почему их так полезно логарифмировать перед подачей в градиентный бустинг.


Как читать паспорт распределения

Прежде чем нырять в конкретику, договоримся о формате. Для каждого распределения я буду давать один и тот же набор полей — это и есть «паспорт»:

  • Где возникает — какой физический или бизнесовый механизм порождает именно этот закон
  • Параметры — числа, которые полностью задают распределение внутри семейства
  • Формула — функция вероятности $P(X = k)$ для дискретных или плотность $f(x)$ для непрерывных
  • $E(X)$ и $D(X)$ — матожидание и дисперсия, посчитанные по определениям из уроков 237 и 238
  • Форма графика — как выглядит картинка и от чего зависит её вид
  • Где в ML — конкретное место в машинном обучении, а не общие слова

Обрати внимание на важную деталь. Распределение — это не одна функция, а семейство функций, занумерованное параметрами. Когда говорят «данные нормально распределены», это ещё не полное описание: нужно указать $\mu$ и $\sigma$. Задача статистики, которой мы займёмся в уроках 245–246, как раз и состоит в том, чтобы по выборке оценить параметры. А задача этого урока — понять, какое семейство вообще выбирать.

Определение: Распределением случайной величины называется правило, сопоставляющее каждому возможному значению (для дискретной величины) или каждому промежутку значений (для непрерывной) его вероятность. Семейством распределений называется множество распределений одного вида, отличающихся значениями параметров.


Распределение Бернулли: атом всей теории

Интуиция

Представь самый простой случайный эксперимент, какой вообще можно придумать: что-то либо произошло, либо не произошло. Монета упала орлом или решкой. Письмо оказалось спамом или не оказалось. Пользователь кликнул по баннеру или прошёл мимо. Пациент выздоровел или нет. Всё, никаких промежуточных вариантов.

Случайная величина, которая принимает значение $1$ при успехе и $0$ при неудаче, называется бернуллиевской. Это буквально атом теории вероятностей: почти все остальные дискретные распределения собираются из бернуллиевских величин, как молекулы из атомов. Биномиальное — это сумма $n$ штук. Геометрическое — это номер первой единицы в бесконечной цепочке. Даже распределение Пуассона, как мы увидим, — это предел суммы очень многих очень редких бернуллиевских величин.

Определение: Случайная величина $X$ имеет распределение Бернулли с параметром $p \in [0; 1]$ (обозначение $X \sim \mathrm{Bern}(p)$), если она принимает только два значения: $P(X = 1) = p$ и $P(X = 0) = 1 - p$.

Паспорт

  • Где возникает: один-единственный опыт с двумя исходами — «успех» и «неудача»
  • Параметры: $p$ — вероятность успеха, $0 \le p \le 1$. Часто пишут $q = 1 - p$
  • Формула: $P(X = k) = p^k (1-p)^{1-k}$ при $k \in \{0, 1\}$
  • $E(X) = p$
  • $D(X) = p(1-p) = pq$
  • Форма графика: два столбика — в нуле высотой $q$ и в единице высотой $p$. Больше рисовать нечего
  • Где в ML: бинарная классификация. Выход сигмоиды — это ровно параметр $p$ распределения Бернулли для конкретного объекта

Выведем моменты честно, по определению из урока 237:

$$E(X) = 0 \cdot (1-p) + 1 \cdot p = p$$$$E(X^2) = 0^2 \cdot (1-p) + 1^2 \cdot p = p$$$$D(X) = E(X^2) - \big(E(X)\big)^2 = p - p^2 = p(1-p)$$

Здесь мы воспользовались формулой $D(X) = E(X^2) - (E(X))^2$ из урока 238. Заметь красивый побочный эффект: поскольку $X$ принимает только значения $0$ и $1$, выполняется $X^2 = X$, а значит и $E(X^2) = E(X)$. Это единственное нетривиальное распределение с таким свойством.

Примеры с разбором

Пример 1 (простой): CTR баннера равен $0{,}04$. Найди $E(X)$ и $D(X)$ для одного показа

Решение:

Шаг 1. Один показ — это одно испытание Бернулли с $p = 0{,}04$, где $X = 1$ означает клик.

Шаг 2. Матожидание: $E(X) = p = 0{,}04$. Это средняя «доля клика» с одного показа — величина, которую в рекламной аналитике и называют CTR.

Шаг 3. Дисперсия: $D(X) = p(1-p) = 0{,}04 \cdot 0{,}96 = 0{,}0384$.

Шаг 4. Стандартное отклонение: $\sigma = \sqrt{0{,}0384} \approx 0{,}196$.

Ответ: $E(X) = 0{,}04$, $D(X) = 0{,}0384$, $\sigma \approx 0{,}196$

📌 Обрати внимание: $\sigma$ почти в пять раз больше самого $E(X)$. Один показ — это чистый шум, по нему ничего сказать нельзя. Именно поэтому CTR меряют на десятках тысяч показов.


Пример 2 (средний): при каком $p$ дисперсия бернуллиевской величины максимальна?

Решение:

Шаг 1. Нужно максимизировать $D(p) = p(1-p) = p - p^2$ на отрезке $[0; 1]$.

Шаг 2. Это парабола ветвями вниз. Выделим полный квадрат:

$$p - p^2 = -\left(p^2 - p\right) = -\left(p^2 - p + \tfrac{1}{4}\right) + \tfrac{1}{4} = \tfrac{1}{4} - \left(p - \tfrac{1}{2}\right)^2$$

Шаг 3. Вычитаемое $\left(p - \tfrac{1}{2}\right)^2$ неотрицательно и обращается в ноль ровно при $p = 0{,}5$. Значит, максимум достигается при $p = 0{,}5$ и равен $0{,}25$.

Проверим: при $p = 0{,}5$ получаем $0{,}5 \cdot 0{,}5 = 0{,}25$ ✅; при $p = 0{,}9$ выходит $0{,}09$ — меньше ✅

Ответ: максимум $D = 0{,}25$ при $p = 0{,}5$

📌 Смысл: самая непредсказуемая монета — честная. Чем ближе $p$ к нулю или единице, тем увереннее мы знаем исход, тем меньше разброс. В ML это отражается в том, что энтропия предсказания максимальна при $p = 0{,}5$ — модель «не знает ответа».


Пример 3 (сложный): покажи, что log-loss бинарной классификации — это минус логарифм вероятности Бернулли

Решение:

Шаг 1. Пусть модель для объекта выдала $\hat{p}$ — предсказанную вероятность класса «1», а истинная метка $y \in \{0, 1\}$. Модель фактически утверждает: «$Y \sim \mathrm{Bern}(\hat{p})$».

Шаг 2. Вероятность увидеть именно наблюдённую метку $y$ по формуле Бернулли:

$$P(Y = y) = \hat{p}^{\,y} (1 - \hat{p})^{1-y}$$

Шаг 3. Возьмём натуральный логарифм и поменяем знак (логарифм произведения по всей выборке превращается в сумму, а минус нужен, чтобы получить величину для минимизации):

$$-\ln P(Y = y) = -\big[y \ln \hat{p} + (1-y)\ln(1 - \hat{p})\big]$$

Шаг 4. Справа стоит в точности формула бинарной кросс-энтропии (log-loss), которую пишут во всех фреймворках.

Шаг 5. Проверим на числах: пусть $y = 1$, $\hat{p} = 0{,}9$. Тогда потеря равна $-\ln 0{,}9 \approx 0{,}1054$. А если модель уверенно ошиблась, $\hat{p} = 0{,}1$: потеря $-\ln 0{,}1 \approx 2{,}3026$ — в двадцать с лишним раз больше.

Ответ: log-loss $= -[y \ln \hat{p} + (1-y)\ln(1-\hat{p})]$ — это минус логарифм правдоподобия распределения Бернулли


Почему это важно

Бернулли — это точка, где теория вероятностей и машинное обучение срастаются намертво. Когда ты обучаешь логистическую регрессию или бинарный классификатор на нейросети, ты не «подгоняешь кривую»: ты для каждого объекта оцениваешь параметр $p$ его личного распределения Бернулли и максимизируешь правдоподобие всей выборки. Сигмоида на выходе нужна ровно затем, чтобы загнать произвольное число в отрезок $[0; 1]$, где живёт параметр $p$. А log-loss — это не произвольно выбранный штраф, а прямое следствие бернуллиевской модели.

Из этого следуют практические выводы. Например, почему метрика accuracy плохо работает при сильном дисбалансе классов: если $p = 0{,}01$, то дисперсия каждого отдельного предсказания $0{,}0099$ — крошечная, и модель, всегда отвечающая «ноль», получит 99% точности, не научившись ничему. Понимание распределения под метрикой сразу объясняет, почему нужны ROC-AUC, PR-AUC и калибровка вероятностей.


Биномиальное распределение: сумма атомов

Интуиция

Один опыт Бернулли — это скучно. Настоящая жизнь начинается, когда опытов много и нас интересует не отдельный исход, а общее число успехов. Отправили 200 писем — сколько откроют? Показали баннер 10 000 раз — сколько кликов? Обучили модель и прогнали её на 500 тестовых объектах — сколько раз она ошиблась?

Схему Бернулли мы подробно разбирали в уроке 233: $n$ независимых испытаний, в каждом вероятность успеха одна и та же и равна $p$. Биномиальное распределение — это распределение случайной величины «сколько успехов выпало». Формально: если $X_1, X_2, \dots, X_n$ — независимые бернуллиевские величины с одним и тем же $p$, то

$$X = X_1 + X_2 + \dots + X_n \sim \mathrm{Bin}(n, p)$$

Вот эта запись — ключ ко всему. Из неё моментально следуют и матожидание, и дисперсия, без единого суммирования ряда.

Определение: Случайная величина $X$ имеет биномиальное распределение с параметрами $n$ и $p$ (обозначение $X \sim \mathrm{Bin}(n, p)$), если она принимает значения $k = 0, 1, \dots, n$ с вероятностями $P(X = k) = C_n^k \, p^k (1-p)^{n-k}$.

Паспорт

  • Где возникает: число успехов в $n$ независимых одинаковых испытаниях с двумя исходами
  • Параметры: $n \in \mathbb{N}$ — число испытаний, $p \in [0; 1]$ — вероятность успеха
  • Формула: $P(X = k) = C_n^k \, p^k q^{n-k}$, где $C_n^k = \dfrac{n!}{k!\,(n-k)!}$, $q = 1 - p$
  • $E(X) = np$
  • $D(X) = npq = np(1-p)$
  • Форма графика: набор столбиков с одним горбом. При $p = 0{,}5$ симметричен, при $p < 0{,}5$ скошен вправо, при $p > 0{,}5$ — влево. Мода примерно в точке $\lfloor (n+1)p \rfloor$
  • Где в ML: число ошибок классификатора на тесте, число конверсий в A/B-тесте, число «выживших» нейронов при dropout

Почему формулы для $E$ и $D$ именно такие? Разберём по шагам. Матожидание аддитивно всегда — для любых величин, даже зависимых:

$$E(X) = E(X_1) + \dots + E(X_n) = \underbrace{p + p + \dots + p}_{n \text{ раз}} = np$$

Дисперсия складывается только для независимых слагаемых — и здесь независимость есть по условию схемы Бернулли:

$$D(X) = D(X_1) + \dots + D(X_n) = \underbrace{pq + pq + \dots + pq}_{n \text{ раз}} = npq$$

Обрати внимание, насколько это проще, чем считать $\sum_k k \cdot C_n^k p^k q^{n-k}$ в лоб. Разложение на сумму бернуллиевских атомов — главный технический приём для всей дискретной части урока.

Примеры с разбором

Пример 4 (простой): монету бросают 8 раз. Какова вероятность ровно 5 орлов?

Решение:

Шаг 1. Здесь $n = 8$, $p = 0{,}5$, $k = 5$.

Шаг 2. Считаем сочетания: $C_8^5 = \dfrac{8!}{5! \cdot 3!} = \dfrac{8 \cdot 7 \cdot 6}{3 \cdot 2 \cdot 1} = 56$.

Шаг 3. Подставляем в формулу:

$$P(X = 5) = 56 \cdot 0{,}5^5 \cdot 0{,}5^3 = 56 \cdot 0{,}5^8 = \frac{56}{256} = 0{,}21875$$

Проверим здравым смыслом: $E(X) = 8 \cdot 0{,}5 = 4$, и значение $k = 5$ стоит рядом с центром — вероятность около 22% выглядит правдоподобно ✅

Ответ: $P(X = 5) = \dfrac{56}{256} = 0{,}21875 \approx 21{,}9\%$


Пример 5 (средний): из 200 писем в среднем 2% — спам. Найди $E$, $D$ и вероятность, что спама не будет вовсе

Решение:

Шаг 1. Модель: $X \sim \mathrm{Bin}(200; 0{,}02)$, где $X$ — число спамных писем.

Шаг 2. Матожидание: $E(X) = np = 200 \cdot 0{,}02 = 4$ письма.

Шаг 3. Дисперсия: $D(X) = npq = 200 \cdot 0{,}02 \cdot 0{,}98 = 3{,}92$, откуда $\sigma = \sqrt{3{,}92} \approx 1{,}98$.

Шаг 4. Вероятность полного отсутствия спама — это $k = 0$:

$$P(X = 0) = C_{200}^0 \cdot 0{,}02^0 \cdot 0{,}98^{200} = 0{,}98^{200}$$

Шаг 5. Считаем через логарифм: $\ln 0{,}98 \approx -0{,}020203$, умножаем на $200$: $-4{,}0405$. Значит $0{,}98^{200} \approx e^{-4{,}0405} \approx 0{,}0176$.

Шаг 6. Тогда вероятность, что спам будет хотя бы один: $1 - 0{,}0176 = 0{,}9824$.

Ответ: $E(X) = 4$, $D(X) = 3{,}92$, $P(X = 0) \approx 0{,}0176$, то есть примерно 1,8%

📌 Забегая вперёд: заметь, что $E(X) = 4$, и $0{,}98^{200} \approx e^{-4}$. Это не совпадение — так проявляется приближение Пуассона, к которому мы скоро придём.


Пример 6 (сложный): классификатор ошибается с вероятностью $0{,}1$. На тесте из 100 объектов насчитали 18 ошибок. Насколько это необычно?

Решение:

Шаг 1. Если модель действительно имеет качество $p = 0{,}1$, то число ошибок $X \sim \mathrm{Bin}(100; 0{,}1)$.

Шаг 2. Центр: $E(X) = 100 \cdot 0{,}1 = 10$ ошибок.

Шаг 3. Разброс: $D(X) = 100 \cdot 0{,}1 \cdot 0{,}9 = 9$, значит $\sigma = 3$.

Шаг 4. Насколько далеко наблюдение $18$ от центра в единицах $\sigma$? Это и есть стандартизация, о которой подробно поговорим в разделе про нормальное распределение:

$$z = \frac{18 - 10}{3} = \frac{8}{3} \approx 2{,}67$$

Шаг 5. Отклонение почти в три сигмы. Для распределения, близкого к нормальному (а при $n = 100$ биномиальное уже очень близко), вероятность уйти вправо на $2{,}67\sigma$ и дальше — около $0{,}4\%$.

Шаг 6. Вывод: либо нам крайне не повезло с тестовой выборкой (шанс меньше одного из двухсот), либо реальная частота ошибок модели выше заявленных 10% — например, из-за сдвига распределения данных.

Ответ: $z \approx 2{,}67$, отклонение статистически значимо — гипотезу $p = 0{,}1$ стоит поставить под сомнение


Почему это важно

Биномиальное распределение — это математика любого A/B-теста. Ты показываешь вариант A десяти тысячам пользователей, вариант B — другим десяти тысячам, считаешь конверсии. Обе величины биномиальны, и весь вопрос — отличаются ли параметры $p_A$ и $p_B$ или наблюдённая разница объясняется случайностью. Формула $D = npq$ даёт масштаб этой случайности, а значит, и минимальный размер выборки, при котором тест вообще имеет смысл.

Вторая точка применения — оценка качества модели. Когда ты пишешь «accuracy = 0,93», это оценка параметра $p$ по конечной выборке, и у неё есть своя погрешность порядка $\sqrt{pq/n}$. На тесте из 100 объектов это ±2,5 процентных пункта — то есть разница между моделями «0,93» и «0,95» может быть чистым шумом. Биномиальная модель мгновенно это показывает и спасает от вредной привычки радоваться четвёртому знаку после запятой.


Геометрическое распределение: сколько ждать первого успеха

Интуиция

Меняем вопрос. Раньше мы фиксировали число попыток и спрашивали «сколько успехов». Теперь фиксируем цель — дождаться первого успеха — и спрашиваем «сколько попыток на это уйдёт».

Ситуаций море. Сколько запросов к нестабильному API придётся сделать, прежде чем один пройдёт? Сколько кандидатов надо просмотреть до первого подходящего? Сколько раз перезапустить обучение с новым random seed, прежде чем модель сойдётся? Сколько показов рекламы до первого клика?

Здесь есть тонкость в определениях, из-за которой в учебниках путаница. Есть две версии: $X$ — номер испытания, на котором случился первый успех (значения $1, 2, 3, \dots$), и $Y$ — число неудач перед первым успехом (значения $0, 1, 2, \dots$). Очевидно, $Y = X - 1$. Мы будем работать с первой версией — она интуитивнее, — но вторую тоже приведём, потому что именно её используют многие библиотеки.

Определение: Случайная величина $X$ имеет геометрическое распределение с параметром $p \in (0; 1]$ (обозначение $X \sim \mathrm{Geom}(p)$), если $P(X = k) = (1-p)^{k-1} p$ для $k = 1, 2, 3, \dots$, то есть $X$ — номер испытания, на котором в схеме Бернулли впервые наступил успех.

Паспорт

  • Где возникает: число попыток до первого успеха в серии независимых испытаний Бернулли
  • Параметры: $p$ — вероятность успеха в одном испытании
  • Формула: $P(X = k) = q^{k-1} p$, где $q = 1-p$, $k \in \{1, 2, 3, \dots\}$
  • $E(X) = \dfrac{1}{p}$
  • $D(X) = \dfrac{1-p}{p^2} = \dfrac{q}{p^2}$
  • Хвост: $P(X > k) = q^k$ — самая полезная формула, запомни её
  • Форма графика: убывающая геометрическая прогрессия. Максимум всегда в $k = 1$, дальше монотонный спад со скоростью $q$ за шаг
  • Где в ML: число попыток до успешного семплирования (rejection sampling), retry-логика в пайплайнах, модели времени до события в дискретном времени

Формула $E(X) = 1/p$ ужасно интуитивна: если успех случается в среднем в одном случае из десяти, то ждать его надо в среднем десять попыток. А вот $D(X) = q/p^2$ пугает: при $p = 0{,}1$ дисперсия равна $0{,}9/0{,}01 = 90$, то есть $\sigma \approx 9{,}5$ — почти столько же, сколько само среднее. Геометрическое распределение очень «разбросанное»: половину времени успех приходит быстро, но иногда ждать приходится втрое дольше среднего.

Формулу хвоста легко получить без всяких рядов: «$X > k$» означает буквально «первые $k$ испытаний все неудачны», а это по независимости $q \cdot q \cdot \dots \cdot q = q^k$. Всё.

Примеры с разбором

Пример 7 (простой): вероятность успешного запроса к API равна $0{,}25$. Сколько попыток в среднем нужно и каков разброс?

Решение:

Шаг 1. Модель: $X \sim \mathrm{Geom}(0{,}25)$, $q = 0{,}75$.

Шаг 2. Среднее число попыток: $E(X) = \dfrac{1}{0{,}25} = 4$.

Шаг 3. Дисперсия: $D(X) = \dfrac{0{,}75}{0{,}25^2} = \dfrac{0{,}75}{0{,}0625} = 12$.

Шаг 4. Стандартное отклонение: $\sigma = \sqrt{12} \approx 3{,}46$.

Ответ: $E(X) = 4$ попытки, $D(X) = 12$, $\sigma \approx 3{,}46$

📌 Разброс почти равен среднему. Если ты ставишь таймаут «максимум 4 попытки», ты не уложишься примерно в трети случаев: $P(X > 4) = 0{,}75^4 \approx 0{,}316$.


Пример 8 (средний): при $p = 0{,}2$ найди $P(X = 3)$ и $P(X > 5)$

Решение:

Шаг 1. $P(X = 3)$ означает: две неудачи, затем успех.

$$P(X = 3) = q^2 p = 0{,}8^2 \cdot 0{,}2 = 0{,}64 \cdot 0{,}2 = 0{,}128$$

Шаг 2. $P(X > 5)$ означает: первые пять испытаний неудачны.

$$P(X > 5) = q^5 = 0{,}8^5$$

Шаг 3. Считаем: $0{,}8^2 = 0{,}64$, $0{,}8^4 = 0{,}64^2 = 0{,}4096$, $0{,}8^5 = 0{,}4096 \cdot 0{,}8 = 0{,}32768$.

Проверим: $E(X) = 1/0{,}2 = 5$, и вероятность «прождать дольше среднего» — около 33%. Для сильно скошенного распределения это нормально: медиана заметно меньше среднего ✅

Ответ: $P(X = 3) = 0{,}128$, $P(X > 5) = 0{,}32768$


Пример 9 (сложный): докажи, что геометрическое распределение не помнит прошлого

Решение:

Шаг 1. Нужно проверить равенство $P(X > m + n \mid X > m) = P(X > n)$ для целых $m, n \ge 0$. Словами: «уже сделали $m$ безуспешных попыток; вероятность, что понадобится ещё больше $n$, такая же, как если бы мы только начинали».

Шаг 2. По определению условной вероятности (урок 230):

$$P(X > m+n \mid X > m) = \frac{P(X > m+n \ \text{и}\ X > m)}{P(X > m)}$$

Шаг 3. Событие «$X > m+n$» вложено в «$X > m$», поэтому их пересечение — это просто «$X > m+n$»:

$$= \frac{P(X > m+n)}{P(X > m)} = \frac{q^{m+n}}{q^m} = q^n$$

Шаг 4. А $P(X > n) = q^n$ — то же самое.

Шаг 5. Числовая иллюстрация: $p = 0{,}2$, уже было 10 неудач. Вероятность, что потребуется ещё больше 5 попыток, равна $0{,}8^5 = 0{,}328$ — ровно столько же, сколько в самом начале.

Ответ: равенство выполнено, геометрическое распределение обладает свойством отсутствия памяти

📌 Это дискретный двойник свойства, которое мы подробно разберём у экспоненциального распределения. Более того: геометрическое — единственное дискретное распределение с таким свойством, а экспоненциальное — единственное непрерывное.


Почему это важно

Геометрическое распределение — это математика ожидания и терпения. Оно объясняет, почему «в среднем 4 попытки» и «хватит 4 попыток» — совершенно разные утверждения, и почему любая retry-логика должна опираться не на среднее, а на квантиль хвоста $q^k$.

В ML оно появляется всякий раз, когда используется отбраковочное семплирование (rejection sampling): генерируем случайную точку, проверяем условие, не подошло — генерируем заново. Число итераций тут в точности геометрическое, и если вероятность принятия $p$ мала, ожидаемое время работы $1/p$ взрывается. Именно поэтому в диффузионных моделях и MCMC-методах так много сил уходит на то, чтобы поднять долю принимаемых семплов: каждый процент здесь линейно бьёт по времени вычислений.


Распределение Пуассона: закон редких событий

Интуиция

Есть целый класс задач, где биномиальная модель формально работает, но пользоваться ею невозможно. Сколько человек зайдёт в магазин за час? Формально: каждый из миллиона жителей города с какой-то крошечной вероятностью зайдёт — биномиальное распределение с $n = 10^6$ и $p = 10^{-5}$. Считать $C_{1000000}^{k}$ никто в здравом уме не станет. Да и сами $n$ и $p$ по отдельности неизвестны — известно только их произведение, средняя интенсивность потока.

Пуассон заметил, что в этой ситуации формула радикально упрощается. Если устремить $n \to \infty$, $p \to 0$, но так, чтобы произведение $np = \lambda$ оставалось постоянным, то биномиальные вероятности сходятся к

$$P(X = k) = \frac{\lambda^k e^{-\lambda}}{k!}$$

Здесь нет ни $n$, ни $p$ по отдельности — только один параметр $\lambda$ — среднее число событий за рассматриваемый интервал. Это и есть распределение Пуассона: модель потока редких событий.

Представь очень длинную дорогу и очень редко разбросанные по ней столбы. Ты не знаешь ни длины дороги в метрах, ни вероятности столба в конкретном метре — но знаешь, что в среднем на километр приходится 3 столба. Этого достаточно, чтобы посчитать вероятность встретить ровно 5 столбов на следующем километре.

Определение: Случайная величина $X$ имеет распределение Пуассона с параметром $\lambda > 0$ (обозначение $X \sim \mathrm{Pois}(\lambda)$), если она принимает значения $k = 0, 1, 2, \dots$ с вероятностями $P(X = k) = \dfrac{\lambda^k}{k!} e^{-\lambda}$.

Паспорт

  • Где возникает: число редких независимых событий за фиксированный интервал времени, площади или объёма
  • Параметры: $\lambda > 0$ — среднее число событий за интервал (интенсивность потока)
  • Формула: $P(X = k) = \dfrac{\lambda^k}{k!} e^{-\lambda}$, $k = 0, 1, 2, \dots$
  • $E(X) = \lambda$
  • $D(X) = \lambda$ — уникальное свойство: среднее равно дисперсии
  • Форма графика: столбики с горбом около $\lambda$. При малых $\lambda$ (меньше 1) максимум в нуле и сильный правый скос; при $\lambda \ge 10$ форма почти симметричная, похожая на нормальную
  • Где в ML: счётчики — число кликов, обращений в поддержку, покупок за период. Пуассоновская регрессия, лосс poisson_nll_loss, модели интенсивности событий

Совпадение среднего и дисперсии — фирменный признак Пуассона и одновременно тест на адекватность модели. Если ты собрал данные о числе обращений в поддержку по дням и увидел, что среднее равно 12, а выборочная дисперсия — 60, то пуассоновская модель не подходит: у тебя сверхдисперсия (overdispersion). Обычно это значит, что интенсивность $\lambda$ сама случайна — например, в будни поток один, в выходные другой. Лечится либо разбиением на группы, либо переходом к отрицательному биномиальному распределению.

Заметь, откуда берётся равенство $E = D$. У биномиального $E = np$ и $D = npq$. При $p \to 0$ множитель $q = 1-p \to 1$, поэтому $D = npq \to np = E$. Никакой магии — просто предельный переход.

Примеры с разбором

Пример 10 (простой): в службу поддержки поступает в среднем 2,5 обращения в час. Найди вероятность ровно 4 обращений за час

Решение:

Шаг 1. Модель: $X \sim \mathrm{Pois}(2{,}5)$, ищем $P(X = 4)$.

Шаг 2. Подставляем в формулу:

$$P(X = 4) = \frac{2{,}5^4}{4!} e^{-2{,}5}$$

Шаг 3. Считаем по частям: $2{,}5^2 = 6{,}25$, $2{,}5^4 = 6{,}25^2 = 39{,}0625$; $4! = 24$; $e^{-2{,}5} \approx 0{,}082085$.

Шаг 4. Собираем:

$$P(X = 4) = \frac{39{,}0625 \cdot 0{,}082085}{24} = \frac{3{,}2064}{24} \approx 0{,}1336$$

Ответ: $P(X = 4) \approx 0{,}134$, то есть около 13,4%


Пример 11 (средний): для той же службы найди вероятность, что за час придёт 5 и более обращений

Решение:

Шаг 1. Напрямую суммировать бесконечный хвост неудобно. Переходим к дополнению:

$$P(X \ge 5) = 1 - P(X \le 4) = 1 - \sum_{k=0}^{4} P(X = k)$$

Шаг 2. Считаем слагаемые, вынося общий множитель $e^{-2{,}5} \approx 0{,}082085$:

  • $P(0) = 0{,}082085$
  • $P(1) = 2{,}5 \cdot 0{,}082085 = 0{,}205213$
  • $P(2) = \dfrac{6{,}25}{2} \cdot 0{,}082085 = 0{,}256516$
  • $P(3) = \dfrac{15{,}625}{6} \cdot 0{,}082085 = 0{,}213763$
  • $P(4) = 0{,}133602$ (посчитали в примере 10)

Шаг 3. Складываем: $0{,}082085 + 0{,}205213 = 0{,}287298$; $+ 0{,}256516 = 0{,}543814$; $+ 0{,}213763 = 0{,}757577$; $+ 0{,}133602 = 0{,}891179$.

Шаг 4. Вычитаем из единицы: $P(X \ge 5) = 1 - 0{,}891179 = 0{,}108821$.

Проверим смыслом: среднее $2{,}5$, значит «5 и больше» — это заметно выше нормы, около 11% — правдоподобно ✅

Ответ: $P(X \ge 5) \approx 0{,}109$, примерно 11%


Пример 12 (сложный): из 100 писем каждое с вероятностью 0,03 попадает в спам. Сравни точный биномиальный ответ и пуассоновское приближение для $k = 2$

Решение:

Шаг 1. Точная модель: $X \sim \mathrm{Bin}(100; 0{,}03)$.

$$P(X = 2) = C_{100}^2 \cdot 0{,}03^2 \cdot 0{,}97^{98}$$

Шаг 2. Считаем множители: $C_{100}^2 = \dfrac{100 \cdot 99}{2} = 4950$; $0{,}03^2 = 0{,}0009$; их произведение $4{,}455$.

Шаг 3. Степень: $\ln 0{,}97 \approx -0{,}030459$, умножаем на $98$: $-2{,}9850$, значит $0{,}97^{98} \approx e^{-2{,}985} \approx 0{,}05046$.

Шаг 4. Итого точное значение: $4{,}455 \cdot 0{,}05046 \approx 0{,}2248$.

Шаг 5. Приближение Пуассона: $\lambda = np = 100 \cdot 0{,}03 = 3$.

$$P(X = 2) \approx \frac{3^2}{2!} e^{-3} = 4{,}5 \cdot 0{,}049787 \approx 0{,}2240$$

Шаг 6. Сравниваем: $0{,}2248$ против $0{,}2240$. Расхождение $0{,}0008$, то есть относительная ошибка около $0{,}35\%$ — при том, что вторая формула считается в уме за десять секунд.

Ответ: точное $\approx 0{,}2248$, пуассоновское $\approx 0{,}2240$, погрешность менее 0,4%

📌 Практическое правило: приближение Пуассона хорошо работает при $n \ge 50$ и $p \le 0{,}05$ (иногда пишут $np \le 10$). Чем меньше $p$, тем точнее.


Почему это важно

Пуассон — рабочая модель для всего, что считается штуками за период. Число заказов в час, число ошибок 500 в логе за минуту, число дефектов на квадратный метр ткани, число мутаций в геноме, число опечаток на страницу. В продуктовой аналитике на нём строятся алерты: если обычно приходит $\lambda = 20$ обращений в час, то $\sigma = \sqrt{20} \approx 4{,}5$, и всплеск до 40 — это отклонение более чем на четыре сигмы, повод будить дежурного.

В машинном обучении есть отдельный класс моделей — пуассоновская регрессия, где целевая переменная является счётчиком. Обычная линейная регрессия там работает плохо сразу по двум причинам: она может предсказать отрицательное число событий, и она предполагает постоянную дисперсию, тогда как у Пуассона дисперсия растёт вместе со средним. Правильное решение — моделировать $\ln \lambda$ линейно и минимизировать пуассоновское правдоподобие. Ровно эту функцию потерь дают PoissonRegressor в scikit-learn, objective='count:poisson' в XGBoost и nn.PoissonNLLLoss в PyTorch.


Дискретное равномерное распределение: когда всё равновероятно

Интуиция

Самое простое распределение из всех: конечное число исходов, и все они равновероятны. Честная игральная кость, случайный выбор карты из колоды, генератор случайного целого числа в диапазоне, случайный выбор одного объекта из датасета.

По сути это классическое определение вероятности из урока 227, переписанное на языке случайных величин: вероятность каждого исхода равна $1/n$, где $n$ — число исходов.

Определение: Случайная величина $X$ имеет дискретное равномерное распределение на множестве $\{a, a+1, \dots, b\}$ из $n = b - a + 1$ значений, если $P(X = k) = \dfrac{1}{n}$ для каждого $k$ из этого множества.

Паспорт

  • Где возникает: равновероятный выбор одного варианта из конечного набора
  • Параметры: границы $a$ и $b$ (или просто число исходов $n$)
  • Формула: $P(X = k) = \dfrac{1}{n}$, где $n = b - a + 1$
  • $E(X) = \dfrac{a+b}{2}$
  • $D(X) = \dfrac{n^2 - 1}{12}$
  • Форма графика: ровная «гребёнка» из одинаковых столбиков высотой $1/n$
  • Где в ML: случайное перемешивание датасета, выбор мини-батча, инициализация индексов, бутстрэп-выборка, случайный поиск гиперпараметров

Для стандартного случая $\{1, 2, \dots, n\}$ формулы принимают знакомый вид: $E(X) = \dfrac{n+1}{2}$, $D(X) = \dfrac{n^2-1}{12}$.

Откуда $\dfrac{n^2-1}{12}$? Выведем для $\{1, \dots, n\}$. Матожидание — среднее арифметическое, то есть $\dfrac{n+1}{2}$. Дальше нужен второй момент, для которого пригодится формула суммы квадратов:

$$E(X^2) = \frac{1}{n}\sum_{k=1}^{n} k^2 = \frac{1}{n} \cdot \frac{n(n+1)(2n+1)}{6} = \frac{(n+1)(2n+1)}{6}$$$$D(X) = \frac{(n+1)(2n+1)}{6} - \frac{(n+1)^2}{4} = \frac{(n+1)\big[2(2n+1) - 3(n+1)\big]}{12} = \frac{(n+1)(n-1)}{12} = \frac{n^2-1}{12}$$

Примеры с разбором

Пример 13 (простой): найди $E(X)$ и $D(X)$ для честной шестигранной кости

Решение:

Шаг 1. Здесь $n = 6$, значения $\{1, \dots, 6\}$.

Шаг 2. Матожидание: $E(X) = \dfrac{6+1}{2} = 3{,}5$.

Шаг 3. Дисперсия: $D(X) = \dfrac{6^2 - 1}{12} = \dfrac{35}{12} \approx 2{,}9167$.

Проверим прямым счётом: $E(X^2) = \dfrac{1+4+9+16+25+36}{6} = \dfrac{91}{6} \approx 15{,}1667$; тогда $D = 15{,}1667 - 3{,}5^2 = 15{,}1667 - 12{,}25 = 2{,}9167$ ✅

Ответ: $E(X) = 3{,}5$, $D(X) = \dfrac{35}{12} \approx 2{,}92$, $\sigma \approx 1{,}71$


Пример 14 (средний): из датасета в 1000 объектов случайно берут один индекс. Найди $E$, $D$ и вероятность попасть в первую сотню

Решение:

Шаг 1. $X$ равномерно распределена на $\{1, \dots, 1000\}$, каждый индекс с вероятностью $0{,}001$.

Шаг 2. $E(X) = \dfrac{1001}{2} = 500{,}5$.

Шаг 3. $D(X) = \dfrac{1000^2 - 1}{12} = \dfrac{999999}{12} = 83333{,}25$, откуда $\sigma \approx 288{,}7$.

Шаг 4. Попасть в первую сотню — это 100 благоприятных исходов из 1000:

$$P(1 \le X \le 100) = \frac{100}{1000} = 0{,}1$$

Ответ: $E(X) = 500{,}5$, $D(X) \approx 83333{,}25$, $P \approx 0{,}1$

📌 Полезное наблюдение: $\sigma \approx 0{,}289 \cdot n$ для равномерного распределения на $n$ значениях. Разброс огромен — это самое «неинформативное» распределение при фиксированном носителе, у него максимальная энтропия.


Почему это важно

Дискретное равномерное распределение — фундамент всей вычислительной случайности. Генератор псевдослучайных чисел выдаёт равномерные целые, из них конструируется всё остальное: перемешивание датасета перед разбиением на train/test, формирование мини-батчей в SGD, бутстрэп при оценке доверительных интервалов, random search по гиперпараметрам, выбор точки старта в k-means++.

Особенно важна связка «равномерное → любое другое». Метод обратной функции распределения, который мы разберём в разделе про равномерное непрерывное, позволяет из одного равномерного числа получить выборку из произвольного распределения. Именно поэтому равномерное — единственное, что реально умеет генерировать компьютер; всё остальное получается пересчётом.


Непрерывное равномерное распределение: ровное плато

Интуиция

Переходим к непрерывным величинам. Здесь вместо таблицы вероятностей работает плотность $f(x)$ из урока 236: вероятность попадания в промежуток — это площадь под графиком плотности над этим промежутком.

Самый простой непрерывный закон — равномерный на отрезке $[a; b]$. Плотность постоянна внутри отрезка и равна нулю снаружи. Никакое место внутри отрезка не выделено: попасть в любой подотрезок длины $\ell$ можно с вероятностью $\ell/(b-a)$, независимо от того, где именно этот подотрезок находится.

Классический бытовой пример: ты приходишь на остановку в случайный момент, автобусы ходят строго каждые 10 минут. Время ожидания равномерно распределено на $[0; 10]$. Более технический: ошибка округления числа до целого равномерна на $[-0{,}5; 0{,}5]$.

Определение: Случайная величина $X$ имеет равномерное распределение на отрезке $[a; b]$ (обозначение $X \sim U(a, b)$), если её плотность равна $f(x) = \dfrac{1}{b-a}$ при $x \in [a; b]$ и $f(x) = 0$ вне отрезка.

Паспорт

  • Где возникает: «полное незнание» внутри известных границ; время ожидания при регулярном расписании; ошибка округления; выход генератора случайных чисел
  • Параметры: границы $a < b$
  • Формула плотности: $f(x) = \dfrac{1}{b-a}$ на $[a; b]$, иначе $0$
  • Функция распределения: $F(x) = \dfrac{x-a}{b-a}$ на $[a; b]$, $0$ левее и $1$ правее
  • $E(X) = \dfrac{a+b}{2}$
  • $D(X) = \dfrac{(b-a)^2}{12}$
  • Форма графика: прямоугольник высотой $\frac{1}{b-a}$ над отрезком; функция распределения — прямая линия от 0 до 1
  • Где в ML: база для всех генераторов, Xavier-инициализация весов через $U(-c; c)$, случайный поиск гиперпараметров, dropout-маски, аугментации

Выведем моменты интегрированием (плотность постоянна, так что интегралы простые):

$$E(X) = \int_a^b x \cdot \frac{1}{b-a}\,dx = \frac{1}{b-a} \cdot \frac{x^2}{2}\Bigg|_a^b = \frac{b^2 - a^2}{2(b-a)} = \frac{(b-a)(b+a)}{2(b-a)} = \frac{a+b}{2}$$$$E(X^2) = \int_a^b x^2 \cdot \frac{1}{b-a}\,dx = \frac{b^3 - a^3}{3(b-a)} = \frac{a^2 + ab + b^2}{3}$$$$D(X) = \frac{a^2+ab+b^2}{3} - \frac{(a+b)^2}{4} = \frac{4(a^2+ab+b^2) - 3(a+b)^2}{12} = \frac{a^2 - 2ab + b^2}{12} = \frac{(b-a)^2}{12}$$

Знаменитая «двенадцать» из формулы $\frac{(b-a)^2}{12}$ — это та самая константа, которая всплывает и в дискретном случае. Полезно запомнить следствие: $\sigma = \dfrac{b-a}{\sqrt{12}} \approx 0{,}2887 (b-a)$. То есть стандартное отклонение равномерной величины составляет примерно $28{,}9\%$ от ширины отрезка.

Примеры с разбором

Пример 15 (простой): $X \sim U(2; 8)$. Найди плотность, $E$, $D$ и $P(X > 5{,}5)$

Решение:

Шаг 1. Ширина отрезка $b - a = 6$, значит плотность $f(x) = \dfrac{1}{6}$ на $[2; 8]$.

Шаг 2. $E(X) = \dfrac{2+8}{2} = 5$.

Шаг 3. $D(X) = \dfrac{6^2}{12} = 3$, значит $\sigma = \sqrt{3} \approx 1{,}73$.

Шаг 4. Вероятность — это доля длины: промежуток $(5{,}5; 8]$ имеет длину $2{,}5$.

$$P(X > 5{,}5) = \frac{2{,}5}{6} \approx 0{,}4167$$

Ответ: $f = 1/6$, $E(X) = 5$, $D(X) = 3$, $P(X > 5{,}5) \approx 0{,}417$


Пример 16 (средний): как из равномерного числа получить экспоненциальное — метод обратной функции

Решение:

Шаг 1. Компьютер умеет выдавать только $U \sim U(0; 1)$. Нужно превратить его в величину с заданной функцией распределения $F$.

Шаг 2. Идея: положим $X = F^{-1}(U)$. Проверим, что это работает:

$$P(X \le x) = P\big(F^{-1}(U) \le x\big) = P\big(U \le F(x)\big) = F(x)$$

Последнее равенство — потому что для $U \sim U(0;1)$ выполняется $P(U \le t) = t$ при $t \in [0;1]$.

Шаг 3. Применим к экспоненциальному распределению, у которого $F(x) = 1 - e^{-\lambda x}$. Решаем уравнение $u = 1 - e^{-\lambda x}$ относительно $x$:

$$e^{-\lambda x} = 1 - u \quad \Rightarrow \quad -\lambda x = \ln(1-u) \quad \Rightarrow \quad x = -\frac{\ln(1-u)}{\lambda}$$

Шаг 4. Численная проверка: пусть $\lambda = 2$ и генератор выдал $u = 0{,}5$. Тогда

$$x = -\frac{\ln 0{,}5}{2} = \frac{\ln 2}{2} \approx \frac{0{,}6931}{2} \approx 0{,}3466$$

Шаг 5. Проверим обратным ходом: $F(0{,}3466) = 1 - e^{-2 \cdot 0{,}3466} = 1 - e^{-0{,}6931} = 1 - 0{,}5 = 0{,}5$ ✅ — совпало с $u$.

Ответ: $X = -\dfrac{\ln(1-U)}{\lambda}$; при $u = 0{,}5$, $\lambda = 2$ получаем $x \approx 0{,}347$

📌 Этот приём называется inverse transform sampling. Он объясняет, почему равномерное распределение — единственное, что нужно уметь генерировать «по-настоящему»: всё остальное получается подстановкой в обратную функцию распределения.


Почему это важно

Равномерное распределение — это точка входа в мир случайности для любого кода. random(), np.random.rand(), torch.rand() — все они выдают $U(0;1)$, а дальше библиотека пересчитывает.

Второе применение — инициализация весов нейросети. Схема Ксавье (Xavier/Glorot, 2010) предлагает брать веса из $U(-c; c)$ с $c = \sqrt{\dfrac{6}{n_{\text{in}} + n_{\text{out}}}}$. Число 6 выглядит мистическим, пока не вспомнишь формулу дисперсии: для $U(-c;c)$ ширина отрезка равна $2c$, значит

$$D = \frac{(2c)^2}{12} = \frac{4c^2}{12} = \frac{c^2}{3} = \frac{1}{3} \cdot \frac{6}{n_{\text{in}}+n_{\text{out}}} = \frac{2}{n_{\text{in}}+n_{\text{out}}}$$

То есть шестёрка подобрана ровно так, чтобы дисперсия веса получилась $\frac{2}{n_{in}+n_{out}}$ — целевое значение, при котором сигнал не затухает и не взрывается при прохождении через слои. Формула равномерной дисперсии здесь работает буквально как инженерный расчёт.


Нормальное распределение: главный закон природы

Интуиция

Если бы нужно было выбрать одно-единственное распределение и забыть все остальные, выбрали бы нормальное. Причина в том, что оно возникает не из конкретного механизма, а из сложения: если величина складывается из множества мелких независимых случайных вкладов, ни один из которых не доминирует, её распределение стремится к нормальному. Неважно, как распределены слагаемые. Это утверждение — центральная предельная теорема, ей посвящён следующий урок 241; сейчас нам достаточно самого факта.

Отсюда вездесущность нормального закона. Рост человека складывается из сотен генетических и средовых факторов. Ошибка измерения прибора — из множества мелких помех. Ошибка предсказания модели — из массы неучтённых признаков. Суммарная доходность портфеля — из вкладов множества активов. Везде срабатывает один и тот же механизм суммирования.

Форма нормальной плотности — знаменитый «колокол»: симметричный горб с максимумом в точке $\mu$, плавно и очень быстро спадающий в обе стороны. Слово «очень быстро» здесь ключевое: спад идёт как $e^{-x^2}$, что несопоставимо быстрее любой степенной функции. Именно поэтому у нормального распределения практически нет далёких выбросов — и именно поэтому оно так плохо описывает финансовые кризисы и вирусные посты, где выбросы как раз есть.

Определение: Случайная величина $X$ имеет нормальное (гауссово) распределение с параметрами $\mu$ и $\sigma^2 > 0$ (обозначение $X \sim \mathcal{N}(\mu, \sigma^2)$), если её плотность равна

$$f(x) = \frac{1}{\sigma\sqrt{2\pi}}\, e^{-\frac{(x-\mu)^2}{2\sigma^2}}$$

Паспорт

  • Где возникает: сумма большого числа мелких независимых вкладов; ошибки измерений; шум; остатки регрессии
  • Параметры: $\mu \in \mathbb{R}$ — центр (он же среднее, медиана и мода), $\sigma > 0$ — масштаб разброса
  • Формула плотности: $f(x) = \dfrac{1}{\sigma\sqrt{2\pi}} e^{-\frac{(x-\mu)^2}{2\sigma^2}}$
  • $E(X) = \mu$
  • $D(X) = \sigma^2$
  • Форма графика: симметричный колокол с вершиной в $x = \mu$; точки перегиба ровно в $\mu \pm \sigma$; асимметрия $0$, эксцесс $0$ (по определению из урока 239 — нормальное является эталоном)
  • Где в ML: предположение о шуме в линейной регрессии, инициализация весов, гауссовский шум в диффузионных моделях, латентное пространство VAE, ядро RBF в SVM, гауссовские процессы

Обрати внимание на приятную особенность: параметры нормального распределения — это буквально его среднее и дисперсия, никакого пересчёта не нужно. Множитель $\frac{1}{\sigma\sqrt{2\pi}}$ существует ровно для того, чтобы площадь под кривой была равна единице.

Стандартизация: как свести любую нормаль к одной

Проблема нормального распределения в том, что первообразная функции $e^{-x^2}$ не выражается через элементарные функции. Значит, вероятности вида $P(a < X < b)$ приходится брать из таблиц или из численных библиотек. Но таблиц не может быть бесконечно много — по одной на каждую пару $(\mu, \sigma)$. Спасает стандартизация.

Определение: Стандартизацией случайной величины $X$ с $E(X) = \mu$ и $\sigma = \sqrt{D(X)}$ называется переход к величине $Z = \dfrac{X - \mu}{\sigma}$. Если $X \sim \mathcal{N}(\mu, \sigma^2)$, то $Z \sim \mathcal{N}(0, 1)$ — стандартное нормальное распределение.

Почему это работает? По свойствам матожидания и дисперсии из уроков 237–238:

$$E(Z) = E\left(\frac{X-\mu}{\sigma}\right) = \frac{E(X) - \mu}{\sigma} = \frac{\mu - \mu}{\sigma} = 0$$$$D(Z) = D\left(\frac{X-\mu}{\sigma}\right) = \frac{D(X)}{\sigma^2} = \frac{\sigma^2}{\sigma^2} = 1$$

Причём тип распределения при линейном преобразовании нормальной величины сохраняется — остаётся нормальным. Практический смысл: величина $z$ отвечает на вопрос «на сколько стандартных отклонений наблюдение отстоит от среднего». Это универсальная безразмерная линейка. Рост 190 см и IQ 130 сравнить напрямую нельзя, а их $z$-оценки — можно.

Именно стандартизацию делает StandardScaler в scikit-learn, BatchNorm внутри нейросети (с точностью до обучаемых сдвига и масштаба) и любая нормализация признаков перед градиентным спуском. Разница только в том, что там $\mu$ и $\sigma$ оцениваются по данным, а не известны точно.

Правило трёх сигм

Главный практический инструмент работы с нормальным распределением. Из симметрии колокола и скорости его спада следуют три числа, которые стоит выучить наизусть:

$$P(\mu - \sigma < X < \mu + \sigma) \approx 0{,}6827$$$$P(\mu - 2\sigma < X < \mu + 2\sigma) \approx 0{,}9545$$$$P(\mu - 3\sigma < X < \mu + 3\sigma) \approx 0{,}9973$$

Словами: примерно 68% значений лежат в одной сигме от центра, 95% — в двух, 99,7% — в трёх. За пределы трёх сигм выходит меньше трёх наблюдений из тысячи.

Полезно держать в голове и односторонние версии (половина от того, что осталось за границей):

  • за $+1\sigma$ — около $15{,}9\%$
  • за $+2\sigma$ — около $2{,}28\%$
  • за $+3\sigma$ — около $0{,}135\%$

И два квантиля, без которых не обходится ни одна статья по статистике: $z = 1{,}645$ отсекает 5% справа, $z = 1{,}96$ отсекает 2,5% справа. Отсюда и берётся знаменитый 95-процентный доверительный интервал вида $\mu \pm 1{,}96\sigma$.

⚠️ Важное предупреждение. Правило трёх сигм справедливо только для нормального распределения. Для произвольной величины работает гораздо более слабое неравенство Чебышёва: вне трёх сигм не более $1/9 \approx 11\%$ значений. Разница между 0,3% и 11% колоссальна, и именно на этой подмене построена половина ошибок в риск-менеджменте.

Примеры с разбором

Пример 17 (простой): IQ распределён как $\mathcal{N}(100, 15^2)$. Какая доля людей имеет IQ от 85 до 115?

Решение:

Шаг 1. Здесь $\mu = 100$, $\sigma = 15$.

Шаг 2. Границы: $85 = 100 - 15 = \mu - \sigma$ и $115 = 100 + 15 = \mu + \sigma$.

Шаг 3. Это ровно интервал в одну сигму, значит по правилу трёх сигм доля составляет $\approx 68{,}27\%$.

Ответ: примерно 68% людей, чуть более двух третей


Пример 18 (средний): та же шкала IQ. Какая доля людей имеет IQ выше 130? А выше 145?

Решение:

Шаг 1. Стандартизуем порог 130:

$$z = \frac{130 - 100}{15} = \frac{30}{15} = 2$$

Шаг 2. По правилу: внутри двух сигм лежит $95{,}45\%$, снаружи $4{,}55\%$, и по симметрии справа — половина:

$$P(X > 130) = \frac{1 - 0{,}9545}{2} \approx 0{,}0228$$

Шаг 3. Теперь порог 145: $z = \dfrac{145-100}{15} = 3$.

$$P(X > 145) = \frac{1 - 0{,}9973}{2} \approx 0{,}00135$$

Шаг 4. Сравним: рост порога всего на 15 единиц (одна сигма) уменьшил долю почти в 17 раз ($0{,}0228 / 0{,}00135 \approx 16{,}9$).

Ответ: выше 130 — около $2{,}3\%$; выше 145 — около $0{,}135\%$, то есть примерно один человек из 740

📌 Это ключевое свойство гауссовых хвостов: они гаснут не в разы, а на порядки. Именно поэтому «нормальный» выброс на 6 сигм считается физически невозможным (вероятность около $10^{-9}$) — и именно поэтому реальные финансовые рынки, где такие движения случаются регулярно, нормальными не описываются.


Пример 19 (сложный): ошибки модели распределены как $\mathcal{N}(0; 2^2)$. Найди порог $t$, при котором ровно 5% ошибок по модулю превосходят $t$

Решение:

Шаг 1. Нужно найти $t$ такое, что $P(|X| > t) = 0{,}05$, то есть $P(|X| \le t) = 0{,}95$.

Шаг 2. По симметрии за пределы уходит по $2{,}5\%$ с каждой стороны. Значит правая граница — квантиль уровня $0{,}975$.

Шаг 3. Для стандартного нормального этот квантиль равен $z_{0{,}975} = 1{,}96$.

Шаг 4. Обратная стандартизация: $X = \mu + z\sigma = 0 + 1{,}96 \cdot 2 = 3{,}92$.

Проверим: интервал $(-3{,}92; 3{,}92)$ — это чуть меньше двух сигм, где лежит $95{,}45\%$; мы отступили немного внутрь и получили ровно $95\%$ ✅

Ответ: $t = 3{,}92$; ошибки по модулю больше 3,92 стоит считать аномальными

📌 Это готовый рецепт детектора аномалий: посчитал $\mu$ и $\sigma$ ошибок на валидации, поставил порог $\mu \pm 1{,}96\sigma$ — и получил алерт с контролируемой долей ложных срабатываний в 5%.


Почему это важно

Нормальное распределение зашито в машинное обучение на трёх уровнях сразу.

Первый уровень — функция потерь. Классическая линейная регрессия исходит из модели $y = w^\top x + \varepsilon$, где шум $\varepsilon \sim \mathcal{N}(0, \sigma^2)$. Если выписать логарифм правдоподобия этой модели, экспонента в плотности превратится в $-\frac{(y - w^\top x)^2}{2\sigma^2}$, и максимизация правдоподобия окажется в точности минимизацией суммы квадратов ошибок. То есть MSE — не произвольная метрика, а прямое следствие гипотезы о нормальном шуме. Отсюда же следует, что MSE плохо работает при тяжёлых хвостах и выбросах: гауссова модель просто не предполагает, что такие значения бывают, и один выброс перетягивает всю прямую.

Второй уровень — инициализация весов. Схема Хе (He, 2015), стандартная для сетей с ReLU, предписывает брать веса из $\mathcal{N}\left(0, \frac{2}{n_{\text{in}}}\right)$. Логика та же, что у Ксавье: подобрать дисперсию так, чтобы дисперсия активаций сохранялась при проходе через слой. Двойка в числителе — компенсация за то, что ReLU обнуляет примерно половину входов, вдвое срезая дисперсию выхода.

Третий уровень — сами модели. Гауссовский шум добавляется и снимается в диффузионных моделях, латентное пространство вариационного автокодировщика регуляризуется к $\mathcal{N}(0, I)$, гауссовские процессы моделируют неопределённость предсказания, RBF-ядро в SVM — это буквально нормальная плотность как мера похожести объектов.


Экспоненциальное распределение: время до события

Интуиция

Вернёмся к пуассоновскому потоку — обращениям в поддержку, кликам, отказам серверов, — но зададим другой вопрос. Пуассон отвечает на вопрос «сколько событий случится за час». А теперь спросим: сколько времени пройдёт до ближайшего события? Это уже не счётчик, а непрерывная величина: 12 секунд, 3,7 минуты, 41 час.

Ответ выводится из пуассоновской формулы буквально в две строки, и этот вывод стоит проделать один раз, чтобы больше никогда не путать два распределения. Пусть события идут потоком с интенсивностью $\lambda$ событий в единицу времени, и $T$ — время до первого события. Событие «$T > t$» означает ровно одно: за промежуток длиной $t$ не случилось ни одного события. Число событий за этот промежуток распределено по Пуассону с параметром $\lambda t$, поэтому

$$P(T > t) = P(N_t = 0) = \frac{(\lambda t)^0}{0!} e^{-\lambda t} = e^{-\lambda t}$$

Отсюда функция распределения $F(t) = 1 - e^{-\lambda t}$, а плотность — её производная: $f(t) = \lambda e^{-\lambda t}$. Всё, распределение получено, и получено не постулированием формулы, а из механизма потока.

Это две проекции одного и того же процесса. Пуассон смотрит на поток «по вертикали»: фиксируем окно, считаем штуки. Экспоненциальное смотрит «по горизонтали»: фиксируем событие, меряем паузу. Если в среднем приходит 3 запроса в минуту, то средний интервал между запросами — 20 секунд, и это одно и то же утверждение, сказанное дважды.

Определение: Случайная величина $X$ имеет экспоненциальное (показательное) распределение с параметром $\lambda > 0$ (обозначение $X \sim \mathrm{Exp}(\lambda)$), если её плотность равна $f(x) = \lambda e^{-\lambda x}$ при $x \ge 0$ и $f(x) = 0$ при $x < 0$.

Паспорт

  • Где возникает: время до следующего события в пуассоновском потоке; время между соседними событиями; время до отказа устройства с постоянной интенсивностью отказов
  • Параметры: $\lambda > 0$ — интенсивность потока, то есть среднее число событий за единицу времени
  • Формула плотности: $f(x) = \lambda e^{-\lambda x}$, $x \ge 0$
  • Функция распределения: $F(x) = 1 - e^{-\lambda x}$
  • Хвост: $P(X > x) = e^{-\lambda x}$ — главная рабочая формула, всё остальное считается через неё
  • $E(X) = \dfrac{1}{\lambda}$
  • $D(X) = \dfrac{1}{\lambda^2}$, откуда $\sigma = \dfrac{1}{\lambda} = E(X)$ — среднее в точности равно стандартному отклонению
  • Медиана: $\dfrac{\ln 2}{\lambda} \approx \dfrac{0{,}693}{\lambda}$ — заметно меньше среднего, распределение скошено вправо
  • Форма графика: монотонно убывающая экспонента, максимум плотности в нуле, длинный правый хвост. Никакого горба: самые вероятные значения — самые маленькие
  • Где в ML: время до отказа и анализ выживаемости (survival analysis), интервалы между запросами при моделировании нагрузки и очередей, время до конверсии пользователя, экспоненциальные априорные распределения для положительных параметров в байесовских моделях

Пара замечаний, на которых спотыкаются на практике.

Первое — параметризация. В математике распределение задают через интенсивность $\lambda$, а в библиотеках чаще всего через масштаб $\beta = 1/\lambda$, то есть через среднее время ожидания. np.random.exponential(scale=2) даёт величину со средним 2, то есть $\lambda = 0{,}5$; scipy.stats.expon(scale=1/lam) — то же самое. Перепутать эти два входа — классический способ получить модель, ошибающуюся ровно в $\lambda^2$ раз.

Второе — соотношение среднего и медианы. Равенство $\sigma = E(X)$ означает, что коэффициент вариации у экспоненциального распределения всегда равен единице, при любом $\lambda$. Это очень «разбросанный» закон: около 63% значений меньше среднего ($1 - e^{-1} = 0{,}632$), но оставшиеся 37% растягиваются в длинный хвост. Фраза «средний отклик сервиса 200 мс» при экспоненциальной модели означает, что примерно каждый десятый запрос ждёт дольше 460 мс ($-\ln 0{,}1 / \lambda \approx 2{,}3$ средних).

Отсутствие памяти

Это главное содержательное свойство экспоненциального закона, и оно же — источник большинства ошибок в его применении. Формулируется так:

$$P(X > s + t \mid X > s) = P(X > t) \quad \text{для любых } s, t \ge 0$$

Проверяется прямым счётом. По определению условной вероятности и с учётом того, что событие «$X > s+t$» вложено в «$X > s$»:

$$P(X > s+t \mid X > s) = \frac{P(X > s+t)}{P(X > s)} = \frac{e^{-\lambda(s+t)}}{e^{-\lambda s}} = e^{-\lambda t} = P(X > t)$$

Словами: если устройство уже проработало $s$ часов, распределение оставшегося времени жизни точно такое же, как у нового устройства. Прошлое не даёт никакой информации о будущем, износа не существует, счётчик каждую секунду обнуляется.

Здравый смысл этому сопротивляется, и правильно делает. Лампочка, отработавшая 10 000 часов, объективно ближе к перегоранию, чем новая. Подшипник изнашивается. Аккумулятор деградирует. Экспоненциальная модель всего этого не описывает — она описывает отказы от случайных внешних причин, а не от старения: скачок напряжения, космическая частица, перебитый ковшом кабель, сбойный запрос. Такие события приходят пуассоновским потоком и потому дают экспоненциальное время до отказа.

Если износ важен, экспоненциальную модель заменяют на распределение Вейбулла с хвостом $P(X > x) = e^{-(x/\beta)^k}$: при $k = 1$ оно вырождается ровно в экспоненциальное, при $k > 1$ интенсивность отказов растёт со временем (старение), при $k < 1$ — падает (приработка, детские болезни). Знаменитая «ванна» надёжности — это склейка трёх участков: $k<1$, затем $k=1$, затем $k>1$.

📌 Экспоненциальное — единственное непрерывное распределение без памяти, ровно как геометрическое — единственное дискретное. Это не совпадение: они связаны предельным переходом, и мы разберём его в карте связей.

Примеры с разбором

Пример 20 (простой): к сервису приходит в среднем 3 запроса в минуту. Найди вероятность того, что следующего запроса придётся ждать дольше 40 секунд

Решение:

Шаг 1. Модель: интервал между запросами $T \sim \mathrm{Exp}(\lambda)$ с $\lambda = 3$ запроса в минуту.

Шаг 2. Приводим время к тем же единицам: $40$ секунд $= \dfrac{2}{3}$ минуты.

Шаг 3. Пользуемся формулой хвоста:

$$P(T > 2/3) = e^{-\lambda t} = e^{-3 \cdot 2/3} = e^{-2}$$

Шаг 4. Считаем: $e^{-2} \approx 0{,}1353$.

Проверим смыслом: средний интервал равен $1/\lambda = 1/3$ минуты, то есть 20 секунд. Мы спросили про паузу вдвое длиннее среднего — вероятность около 13,5% выглядит правдоподобно ✅

Ответ: $P \approx 0{,}135$, примерно 13,5%


Пример 21 (средний): среднее время безотказной работы диска — 5 лет. Найди вероятность того, что диск откажет в промежутке от 2 до 4 лет

Решение:

Шаг 1. Среднее дано, значит $\dfrac{1}{\lambda} = 5$, откуда $\lambda = 0{,}2$ отказа в год.

Шаг 2. Вероятность попадания в промежуток удобнее считать через хвосты, а не через интеграл от плотности:

$$P(2 < X < 4) = P(X > 2) - P(X > 4) = e^{-0{,}2 \cdot 2} - e^{-0{,}2 \cdot 4}$$

Шаг 3. Считаем экспоненты: $e^{-0{,}4} \approx 0{,}6703$, $e^{-0{,}8} \approx 0{,}4493$.

Шаг 4. Вычитаем: $0{,}6703 - 0{,}4493 = 0{,}2210$.

Проверим смыслом: промежуток длиной 2 года при среднем сроке 5 лет забирает примерно пятую часть вероятности — сходится ✅

Ответ: $P(2 < X < 4) \approx 0{,}221$, около 22%

📌 Обрати внимание на приём: для экспоненциального распределения любую вероятность стоит выражать через $P(X > x) = e^{-\lambda x}$. Интегрировать плотность руками здесь никогда не нужно.


Пример 22 (сложный): тот же диск уже отработал 3 года без сбоев. Найди вероятность того, что он протянет ещё минимум 5 лет, и сравни с вероятностью для нового диска

Решение:

Шаг 1. Требуется условная вероятность $P(X > 8 \mid X > 3)$ при $\lambda = 0{,}2$.

Шаг 2. По определению условной вероятности, с учётом вложенности событий:

$$P(X > 8 \mid X > 3) = \frac{P(X > 8)}{P(X > 3)} = \frac{e^{-1{,}6}}{e^{-0{,}6}} = e^{-1{,}0}$$

Шаг 3. Численно: $e^{-1} \approx 0{,}3679$.

Шаг 4. Для нового диска вероятность проработать 5 лет равна $P(X > 5) = e^{-0{,}2 \cdot 5} = e^{-1} \approx 0{,}3679$ — ровно то же число.

Шаг 5. Интерпретация: три года эксплуатации не изменили прогноз ни на сотую долю. Модель считает трёхлетний диск неотличимым от нового.

Ответ: обе вероятности равны $e^{-1} \approx 0{,}368$; экспоненциальная модель не помнит наработку

⚠️ Практический вывод из этого примера обратный тому, который напрашивается. Он не в том, что диски не изнашиваются, а в том, что экспоненциальная модель по построению неспособна поймать износ. Если данные показывают, что доля отказов растёт со сроком службы, экспоненциальное распределение здесь просто неприменимо — нужен Вейбулл или непараметрический подход вроде оценки Каплана — Мейера.


Почему это важно

Экспоненциальное распределение — базовый кирпич всего, что связано со временем до события, а это в машинном обучении отдельная большая область: анализ выживаемости (survival analysis). Её отличает то, что часть наблюдений цензурирована: клиент ещё не ушёл, деталь ещё не сломалась, пациент ещё жив на момент окончания исследования. Обычная регрессия такие строки либо выбрасывает (и получает смещённую оценку), либо считает их за «событие произошло сейчас» (и получает смещённую оценку в другую сторону). Модели выживаемости работают с ними правильно — именно потому, что умеют считать вклад вида $P(X > t) = e^{-\lambda t}$, то есть вклад по хвосту, а не по плотности.

Центральное понятие здесь — интенсивность отказов (hazard rate) $h(t) = \dfrac{f(t)}{1 - F(t)}$: мгновенный риск события при условии, что до момента $t$ оно ещё не случилось. Для экспоненциального распределения

$$h(t) = \frac{\lambda e^{-\lambda t}}{e^{-\lambda t}} = \lambda = \text{const}$$

Постоянная интенсивность — это и есть отсутствие памяти, записанное на языке рисков. Модель пропорциональных рисков Кокса, стандартный инструмент в задачах оттока клиентов и предиктивного обслуживания оборудования, строится ровно как «базовая интенсивность, умноженная на $e^{w^\top x}$» — экспоненциальный случай там служит опорной точкой.

Вторая большая область — моделирование нагрузки и очередей. Классическая система массового обслуживания $M/M/1$ (экспоненциальные интервалы прихода, экспоненциальное время обслуживания) — это первая модель, на которой считают, при какой загрузке очередь начнёт расти неограниченно. Отсюда же берутся генераторы трафика в нагрузочном тестировании: чтобы честно сымитировать поток пользователей, паузы между запросами берут экспоненциальными, а не одинаковыми, иначе тест не воспроизводит всплески.

И третье, менее очевидное: экспоненциальное распределение — распределение с максимальной энтропией среди всех неотрицательных величин с заданным средним. То есть если про положительную величину известно только её среднее, самое честное предположение о её законе — экспоненциальное. Ровно по этой причине его берут как априорное распределение для положительных параметров (интенсивностей, дисперсий, коэффициентов регуляризации) в байесовских моделях: минимум навязанных предположений при заданном масштабе.


Логнормальное распределение: когда логарифм нормален

Интуиция

Нормальное распределение возникает из сложения: много мелких независимых вкладов складываются — получается колокол. Но огромная часть величин вокруг нас устроена иначе. Они не складываются, они перемножаются.

Зарплата растёт не на «плюс сколько-то тысяч в год», а на «плюс сколько-то процентов». Цена акции меняется в разах, а не в рублях. Размер файла на диске зависит от разрешения, умноженного на глубину цвета, умноженного на коэффициент сжатия. Время ответа сервиса — это время запроса к базе, умноженное на количество повторов, умноженное на замедление от конкуренции за ресурсы. Число просмотров поста — это охват первой волны, умноженный на коэффициент вирусности в каждом следующем шаге.

И вот здесь происходит главный трюк урока. Возьмём произведение множества независимых положительных факторов:

$$X = A_1 \cdot A_2 \cdot \ldots \cdot A_n$$

и прологарифмируем:

$$\ln X = \ln A_1 + \ln A_2 + \ldots + \ln A_n$$

Произведение превратилось в сумму. А к сумме множества независимых слагаемых применима центральная предельная теорема, значит $\ln X$ стремится к нормальному распределению. Сама же величина $X = e^{\ln X}$ — это экспонента от нормальной величины. Её и называют логнормальной.

Отсюда сразу вытекает форма графика. Экспонента растягивает большие значения и сжимает маленькие, поэтому симметричный колокол в логарифмической шкале превращается в резко асимметричную кривую в обычной: подъём от нуля, горб слева, длинный тяжёлый хвост вправо. Именно так выглядит гистограмма зарплат, цен на квартиры, длительностей пользовательских сессий, размеров файлов и времён отклика — все они начинаются от нуля, скапливаются около типичного значения и имеют редкие, но очень большие выбросы справа.

Определение: Положительная случайная величина $X$ имеет логнормальное распределение с параметрами $\mu$ и $\sigma^2$ (обозначение $X \sim \mathrm{LogN}(\mu, \sigma^2)$), если $\ln X \sim \mathcal{N}(\mu, \sigma^2)$. Эквивалентно: $X = e^{Y}$, где $Y \sim \mathcal{N}(\mu, \sigma^2)$.

Паспорт

  • Где возникает: произведение большого числа независимых положительных факторов; величины, меняющиеся в процентах, а не в абсолютных единицах
  • Параметры: $\mu \in \mathbb{R}$ и $\sigma > 0$ — среднее и стандартное отклонение логарифма величины, а не самой величины
  • Формула плотности: $f(x) = \dfrac{1}{x \sigma \sqrt{2\pi}} \, e^{-\frac{(\ln x - \mu)^2}{2\sigma^2}}$ при $x > 0$
  • $E(X) = e^{\mu + \sigma^2/2}$
  • $D(X) = \left(e^{\sigma^2} - 1\right) e^{2\mu + \sigma^2}$
  • Медиана: $e^{\mu}$
  • Мода: $e^{\mu - \sigma^2}$
  • Форма графика: нулевая плотность в нуле, крутой подъём, горб слева от среднего, длинный правый хвост. Строгая цепочка: мода $<$ медиана $<$ среднее
  • Где в ML: логарифмирование целевой переменной (цены, доходы, длительности), метрика RMSLE, логарифмические сетки для подбора learning rate и коэффициентов регуляризации, модели времени отклика и латентности

Ключевая ловушка — параметры. Запись $\mathrm{LogN}(4; 0{,}5^2)$ не означает, что среднее равно 4. Она означает, что среднее логарифма равно 4, а само среднее величины равно $e^{4 + 0{,}125} \approx 61{,}9$. Разрыв между $e^{\mu}$ (медианой) и $e^{\mu + \sigma^2/2}$ (средним) растёт с $\sigma$ экспоненциально, и при $\sigma = 1$ среднее уже в $e^{0{,}5} \approx 1{,}65$ раза больше медианы.

Отсюда же следует важнейшее практическое наблюдение: у логнормальных данных среднее — плохая характеристика типичного значения. Средняя зарплата по компании, средний чек, среднее время ответа — все эти числа систематически завышены хвостом и не описывают ни одного реального наблюдения. Типичное значение здесь — медиана $e^{\mu}$, и именно поэтому в мониторинге сервисов смотрят на p50, p95 и p99, а не на среднее.

Примеры с разбором

Пример 23 (простой): $\ln X \sim \mathcal{N}(3; 0{,}5^2)$. Найди медиану, среднее и моду величины $X$

Решение:

Шаг 1. Выписываем параметры: $\mu = 3$, $\sigma = 0{,}5$, значит $\sigma^2 = 0{,}25$.

Шаг 2. Медиана. Логарифм симметричен относительно $\mu = 3$, а экспонента монотонна и потому сохраняет порядок, значит середина по вероятности переходит в середину:

$$\mathrm{Med}(X) = e^{\mu} = e^{3} \approx 20{,}09$$

Шаг 3. Среднее:

$$E(X) = e^{\mu + \sigma^2/2} = e^{3 + 0{,}125} = e^{3{,}125} \approx 22{,}76$$

Шаг 4. Мода:

$$\mathrm{Mo}(X) = e^{\mu - \sigma^2} = e^{2{,}75} \approx 15{,}64$$

Шаг 5. Проверяем порядок: $15{,}64 < 20{,}09 < 22{,}76$ — мода, медиана, среднее, как и должно быть у распределения со скосом вправо ✅

Ответ: медиана $\approx 20{,}1$; среднее $\approx 22{,}8$; мода $\approx 15{,}6$


Пример 24 (средний): зарплаты в отрасли логнормальны, медиана 80 тыс. рублей, среднее 100 тыс. Найди параметры $\mu, \sigma$ и долю сотрудников с зарплатой выше 200 тыс.

Решение:

Шаг 1. Медиана даёт $\mu$ напрямую: $e^{\mu} = 80$, откуда $\mu = \ln 80 \approx 4{,}382$.

Шаг 2. Отношение среднего к медиане убирает $\mu$ и оставляет только $\sigma$:

$$\frac{E(X)}{\mathrm{Med}(X)} = \frac{e^{\mu + \sigma^2/2}}{e^{\mu}} = e^{\sigma^2/2} = \frac{100}{80} = 1{,}25$$

Шаг 3. Логарифмируем и выражаем $\sigma$:

$$\frac{\sigma^2}{2} = \ln 1{,}25 \approx 0{,}2231 \ \Rightarrow \ \sigma^2 \approx 0{,}4463 \ \Rightarrow \ \sigma \approx 0{,}668$$

Шаг 4. Переходим к вопросу про 200 тыс. Условие $X > 200$ равносильно $\ln X > \ln 200$, а $\ln X$ — обычная нормальная величина. Стандартизуем:

$$z = \frac{\ln 200 - \mu}{\sigma} = \frac{\ln(200/80)}{0{,}668} = \frac{\ln 2{,}5}{0{,}668} = \frac{0{,}9163}{0{,}668} \approx 1{,}372$$

Шаг 5. По таблице стандартного нормального распределения $P(Z > 1{,}372) \approx 0{,}085$.

Проверим смыслом: порог в 2,5 раза выше медианы отсекает примерно 8,5% — для распределения доходов с длинным хвостом это правдоподобная цифра ✅

Ответ: $\mu \approx 4{,}382$, $\sigma \approx 0{,}668$; выше 200 тыс. зарабатывают около 8,5% сотрудников

📌 Обрати внимание на технику: любая вероятность для логнормальной величины сводится к нормальной подстановкой $z = \dfrac{\ln x - \mu}{\sigma}$. Отдельных таблиц для логнормального распределения не существует и не нужно.


Пример 25 (сложный): модель обучена на логарифме цены, для сегмента она предсказывает $\hat{y} = 4{,}382$ при стандартном отклонении остатков $0{,}668$. Бизнесу нужна суммарная выручка по 1000 объектам сегмента. Посчитай её через наивное обратное преобразование и через корректное

Решение:

Шаг 1. Наивный путь: взять экспоненту от предсказания.

$$\hat{X}_{\text{наив}} = e^{4{,}382} \approx 80 \ \text{тыс.}$$

Суммарно: $1000 \cdot 80 = 80$ млн рублей.

Шаг 2. Разберёмся, что именно мы посчитали. Модель на логарифмах минимизирует квадратичную ошибку и потому предсказывает среднее логарифма, то есть $\mu$. Экспонента от $\mu$ — это $e^{\mu}$, а это медиана исходной величины, не её среднее.

Шаг 3. Среднее исходной величины требует поправки:

$$E(X) = e^{\mu + \sigma^2/2} = e^{4{,}382 + 0{,}4463/2} = e^{4{,}382} \cdot e^{0{,}2231} \approx 80 \cdot 1{,}25 = 100 \ \text{тыс.}$$

Шаг 4. Корректная суммарная выручка: $1000 \cdot 100 = 100$ млн рублей.

Шаг 5. Величина ошибки: наивный подход занижает прогноз на 20 млн, то есть на 20%, причём систематически — не в одну сторону на одних объектах и в другую на других, а всегда вниз. И чем больше остаточная дисперсия модели, тем сильнее занижение: при $\sigma = 1$ множитель поправки уже $e^{0{,}5} \approx 1{,}65$.

Ответ: наивно 80 млн, корректно 100 млн; поправка на обратное преобразование равна $e^{\sigma^2/2} = 1{,}25$

⚠️ Это одна из самых дорогих ошибок в прикладном ML, потому что она молчаливая: метрики на логарифмической шкале выглядят прекрасно, а бюджет, посчитанный по прогнозу, не сходится с фактом на десятки процентов. Если остатки не строго логнормальны, вместо аналитической поправки применяют оценку Дуана (smearing estimator): усредняют $e^{\text{остаток}}$ по обучающей выборке и умножают прогноз на этот множитель.


Почему это важно

Логнормальность — главная причина, по которой в машинном обучении так часто логарифмируют целевую переменную. Смысл этого преобразования тройной.

Первое — оно чинит функцию потерь. MSE на исходной шкале штрафует ошибку в абсолютных единицах: промах на 500 тыс. при цене 20 млн и промах на 500 тыс. при цене 1 млн для неё одинаково плохи, хотя во втором случае модель ошиблась в разы. После логарифмирования разность логарифмов равна логарифму отношения, $\ln a - \ln b = \ln(a/b)$, и MSE начинает штрафовать относительную ошибку. Именно эту идею формализует метрика RMSLE, стандартная для соревнований с ценами и спросом.

Второе — оно убирает диктатуру хвоста. У логнормальной величины несколько самых больших объектов могут давать вклад в сумму квадратов больший, чем все остальные вместе. Модель, обученная без логарифма, тратит всю ёмкость на подгонку этих нескольких точек и заметно хуже работает на основной массе данных. Логарифм сжимает хвост и возвращает вес середине распределения.

Третье — оно приводит остатки к нормальному виду, а это ровно то предположение, из которого выводятся и MSE, и доверительные интервалы, и правило трёх сигм для детекции аномалий. Проверить логнормальность просто: построй гистограмму $\ln x$ и посмотри, стал ли график похож на колокол.

Отдельная история — подбор гиперпараметров. Learning rate почти всегда ищут по логарифмической сетке: $10^{-5}, 10^{-4}, 10^{-3}, 10^{-2}$, а не $0{,}01,\ 0{,}02,\ 0{,}03$. Причина ровно та же, что и у логнормальности данных: для скорости обучения содержательна не разность значений, а их отношение. Разница между $0{,}0001$ и $0{,}0002$ — это двукратное изменение динамики обучения, а разница между $0{,}01$ и $0{,}0101$ не меняет ничего, хотя абсолютные шаги отличаются в сто раз в пользу второй пары. Равномерная сетка по шкале значений потратила бы почти все попытки на бессмысленно близкие точки в верхнем диапазоне. Равномерная сетка по логарифму распределяет попытки равномерно по порядкам величины. Ровно поэтому в Optuna есть suggest_float(..., log=True), а в scikit-learn — loguniform: они семплируют параметр так, чтобы его логарифм был равномерным, что и есть «логнормальный взгляд» на гиперпараметр.

Та же логика работает для коэффициента регуляризации, размера батча, температуры софтмакса и любой другой положительной величины, у которой нет естественного нуля и есть естественный масштаб.


Карта связей между распределениями

Мы разобрали девять распределений. Держать в голове девять независимых наборов формул тяжело и не нужно: они образуют одно семейство, где каждое следующее получается из предыдущего конкретным предельным переходом или преобразованием. Ниже — вся карта целиком.

Ствол: от одного испытания к колоколу

Бернулли $\to$ биномиальное. Условие перехода: складываем $n$ независимых одинаковых испытаний.

$$X_1 + X_2 + \ldots + X_n \sim \mathrm{Bin}(n, p), \quad \text{где } X_i \sim \mathrm{Bern}(p)$$

Отсюда мгновенно восстанавливаются формулы: $E = np$ и $D = npq$ — это просто $n$ раз по $p$ и $n$ раз по $pq$, по свойству аддитивности из уроков 237–238.

Биномиальное $\to$ Пуассон. Условие перехода: $n \to \infty$, $p \to 0$, произведение $np = \lambda$ фиксировано. Много испытаний, каждое почти безнадёжное, среднее число успехов конечно.

$$\mathrm{Bin}(n, p) \ \xrightarrow[\ np = \lambda\ ]{\ n \to \infty,\ p \to 0\ } \ \mathrm{Pois}(\lambda)$$

Рабочий критерий применимости: $n \ge 50$ и $p \le 0{,}05$. Проверка формулами: $E = np \to \lambda$, $D = npq \to np = \lambda$, потому что $q \to 1$ — так и получается фирменное равенство $E = D$ у Пуассона.

Биномиальное $\to$ нормальное (теорема Муавра — Лапласа). Условие перехода противоположное: $n \to \infty$ при фиксированном $p$, не стремящемся к нулю.

$$\mathrm{Bin}(n, p) \ \xrightarrow[\ n \to \infty,\ p = \mathrm{const}\ ]{} \ \mathcal{N}(np,\ npq)$$

Рабочий критерий: $npq \ge 10$ (в некоторых источниках $np \ge 10$ и $nq \ge 10$). При переходе к непрерывной шкале нужна поправка на непрерывность: $P(X = k)$ считают как $P(k - 0{,}5 < X < k + 0{,}5)$.

Две стрелки из одной вершины — это не противоречие, а два разных режима. Куда идти, решает число успехов: если $\lambda = np$ остаётся маленьким, работает Пуассон; если и $np$, и $nq$ велики, работает нормальное. Между ними есть зона, где годятся оба (например, $\mathrm{Pois}(\lambda)$ при $\lambda \ge 20$ сам уже почти нормален).

Пуассон $\to$ нормальное. Условие: $\lambda \to \infty$. Пуассоновская величина с большим $\lambda$ — это сумма многих независимых пуассоновских с маленькими $\lambda$ (пуассоновские величины складываются, складывая параметры), а к сумме применима ЦПТ.

$$\mathrm{Pois}(\lambda) \ \xrightarrow[\ \lambda \ge 20\ ]{} \ \mathcal{N}(\lambda, \lambda)$$

Ветка ожидания: от попыток ко времени

Бернулли $\to$ геометрическое. Условие: ждём первого успеха и считаем номер попытки, а не число успехов. $E = 1/p$, хвост $P(X > k) = q^k$.

Геометрическое $\to$ экспоненциальное. Условие: дискретное время превращается в непрерывное. Формально: разобьём ось времени на интервалы длины $\Delta$, в каждом успех наступает с вероятностью $p = \lambda \Delta$, и устремим $\Delta \to 0$.

$$P(T > t) = (1 - \lambda\Delta)^{t/\Delta} \ \xrightarrow[\ \Delta \to 0\ ]{} \ e^{-\lambda t}$$

Это в точности хвост экспоненциального распределения. Соответствие видно и в формулах: $E_{\text{геом}} = 1/p$ переходит в $E_{\text{эксп}} = 1/\lambda$, а свойство отсутствия памяти сохраняется при переходе — дискретный вариант превращается в непрерывный.

Пуассон $\leftrightarrow$ экспоненциальное. Это не предельный переход, а двусторонняя связь: два взгляда на один и тот же поток событий.

  • считаем события в фиксированном окне $\to$ Пуассон с параметром $\lambda t$
  • меряем паузу между событиями $\to$ экспоненциальное с параметром $\lambda$

Мостик между ними: $P(T > t) = P(N_t = 0) = e^{-\lambda t}$.

Экспоненциальное $\to$ гамма (Эрланга). Условие: складываем $k$ независимых экспоненциальных с одинаковым $\lambda$ — получаем время до $k$-го события потока.

$$T_1 + T_2 + \ldots + T_k \sim \Gamma(k, \lambda), \quad E = \frac{k}{\lambda}, \quad D = \frac{k}{\lambda^2}$$

Здесь та же логика, что у пары «Бернулли — биномиальное», только в непрерывном мире. И дальше по цепочке: при $k \to \infty$ гамма-распределение по ЦПТ становится нормальным, а форма из «убывающей экспоненты» ($k=1$) через «горб с правым хвостом» ($k$ порядка 5–10) выпрямляется в симметричный колокол.

Геометрическое $\to$ отрицательное биномиальное. Условие: ждём не первого успеха, а $r$-го. Дискретный аналог перехода «экспоненциальное $\to$ гамма» — симметрия карты видна и здесь.

Ветка преобразований

Нормальное $\to$ логнормальное. Условие: применяем экспоненту.

$$Y \sim \mathcal{N}(\mu, \sigma^2) \ \Longrightarrow \ X = e^{Y} \sim \mathrm{LogN}(\mu, \sigma^2)$$

Обратная стрелка — логарифм: $\ln X \sim \mathcal{N}(\mu, \sigma^2)$. Это единственная пара на карте, где переход обратим точно, без всяких предельных условий. Содержательный смысл: суммы независимых факторов дают нормальное распределение, произведения — логнормальное.

Равномерное $\to$ любое непрерывное. Условие: метод обратной функции, $X = F^{-1}(U)$ при $U \sim U(0;1)$. Мы разбирали его в примере 16: для экспоненциального получается $X = -\dfrac{\ln(1-U)}{\lambda}$. Именно поэтому генератору случайных чисел достаточно уметь выдавать равномерные числа — все остальные распределения строятся из них.

Нормальное $\to$ хи-квадрат. Условие: суммируем квадраты $k$ независимых стандартных нормальных величин. Это распределение понадобится в уроках по проверке гипотез; здесь достаточно знать, что оно тоже вырастает из нормального.

Сводка стрелок

  • $\mathrm{Bern}(p) \xrightarrow{\ \text{сумма } n\ } \mathrm{Bin}(n,p)$
  • $\mathrm{Bin}(n,p) \xrightarrow{\ n\to\infty,\ np=\lambda\ } \mathrm{Pois}(\lambda)$
  • $\mathrm{Bin}(n,p) \xrightarrow{\ npq \ge 10\ } \mathcal{N}(np, npq)$
  • $\mathrm{Pois}(\lambda) \xrightarrow{\ \lambda \to \infty\ } \mathcal{N}(\lambda, \lambda)$
  • $\mathrm{Bern}(p) \xrightarrow{\ \text{номер 1-го успеха}\ } \mathrm{Geom}(p)$
  • $\mathrm{Geom}(p) \xrightarrow{\ \Delta \to 0,\ p = \lambda\Delta\ } \mathrm{Exp}(\lambda)$
  • $\mathrm{Pois}(\lambda) \longleftrightarrow \mathrm{Exp}(\lambda)$ — счёт событий против пауз между ними
  • $\mathrm{Exp}(\lambda) \xrightarrow{\ \text{сумма } k\ } \Gamma(k, \lambda) \xrightarrow{\ k \to \infty\ } \mathcal{N}$
  • $\mathcal{N}(\mu,\sigma^2) \xrightarrow{\ \exp\ } \mathrm{LogN}(\mu,\sigma^2)$, обратно — $\ln$
  • $U(0;1) \xrightarrow{\ X = F^{-1}(U)\ } \text{любое непрерывное}$

Примеры с разбором

Пример 26 (простой): по карте восстанови $E$ и $D$ биномиального распределения, зная только параметры Бернулли

Решение:

Шаг 1. Для одного испытания Бернулли: $E(X_i) = p$, $D(X_i) = pq$.

Шаг 2. Биномиальная величина — сумма $n$ независимых таких испытаний.

Шаг 3. Матожидание суммы равно сумме матожиданий всегда, независимость для этого не нужна: $E = n \cdot p = np$.

Шаг 4. Дисперсия суммы равна сумме дисперсий именно потому, что испытания независимы: $D = n \cdot pq = npq$.

Ответ: $E = np$, $D = npq$ — обе формулы восстановлены из одной строчки Бернулли

📌 В этом весь практический смысл карты: запоминать нужно $p$ и $pq$, всё остальное достраивается за десять секунд.


Пример 27 (средний): $X \sim \mathrm{Bin}(1000;\ 0{,}002)$. Посчитай $P(X = 0)$ точно, через Пуассона и через нормальное приближение. Определи, какая стрелка карты здесь рабочая

Решение:

Шаг 1. Точное значение:

$$P(X = 0) = 0{,}998^{1000} = e^{1000 \ln 0{,}998} = e^{-2{,}002} \approx 0{,}1351$$

Шаг 2. Пуассоновское приближение: $\lambda = np = 1000 \cdot 0{,}002 = 2$.

$$P(X = 0) \approx e^{-2} \approx 0{,}1353$$

Относительная погрешность около $0{,}2\%$.

Шаг 3. Нормальное приближение: $\mu = np = 2$, $D = npq = 1000 \cdot 0{,}002 \cdot 0{,}998 = 1{,}996$, $\sigma \approx 1{,}413$. С поправкой на непрерывность:

$$P(X = 0) \approx P(-0{,}5 < X < 0{,}5) = \Phi\left(\frac{0{,}5 - 2}{1{,}413}\right) - \Phi\left(\frac{-0{,}5 - 2}{1{,}413}\right)$$

Шаг 4. Считаем аргументы: $z_1 = -1{,}061$, $z_2 = -1{,}769$. По таблице: $\Phi(-1{,}061) \approx 0{,}1444$, $\Phi(-1{,}769) \approx 0{,}0384$, разность $\approx 0{,}1060$.

Шаг 5. Сравниваем: $0{,}1351$ точно, $0{,}1353$ по Пуассону, $0{,}1060$ по нормальному. Нормальное ошиблось на 22%.

Шаг 6. Проверяем критерии карты: $p = 0{,}002 \le 0{,}05$ и $n = 1000 \ge 50$ — пуассоновская стрелка законна. А $npq = 1{,}996 < 10$ — нормальная стрелка неприменима, что и подтвердилось численно. Больше того, нормальная модель приписывает ненулевую вероятность отрицательному числу успехов, чего у счётчика быть не может.

Ответ: точно $0{,}1351$; Пуассон $0{,}1353$ (годится); нормальное $0{,}1060$ (не годится, $npq < 10$)


Пример 28 (сложный): запросы приходят потоком с $\lambda = 3$ в минуту. Найди вероятность того, что 10-го запроса придётся ждать дольше 5 минут — двумя путями по разным веткам карты

Решение:

Шаг 1. Первый путь — через ветку «экспоненциальное $\to$ гамма». Время до 10-го события есть сумма 10 независимых экспоненциальных интервалов:

$$T = T_1 + \ldots + T_{10} \sim \Gamma(10;\ 3), \quad E(T) = \frac{10}{3} \approx 3{,}33, \quad D(T) = \frac{10}{9}, \quad \sigma \approx 1{,}054$$

Шаг 2. Приблизим гамму нормальным распределением по ЦПТ (стрелка $k \to \infty$):

$$P(T > 5) \approx P\left(Z > \frac{5 - 3{,}33}{1{,}054}\right) = P(Z > 1{,}58) \approx 0{,}057$$

Шаг 3. Второй путь — через двойственность «экспоненциальное $\leftrightarrow$ Пуассон». Событие «10-й запрос ещё не пришёл к моменту 5 минут» равносильно событию «за 5 минут пришло не более 9 запросов»:

$$P(T > 5) = P(N_5 \le 9), \quad N_5 \sim \mathrm{Pois}(\lambda t) = \mathrm{Pois}(15)$$

Шаг 4. Суммируем пуассоновские вероятности от 0 до 9 при $\lambda = 15$:

$$P(N_5 \le 9) = \sum_{k=0}^{9} \frac{15^k}{k!} e^{-15} \approx 0{,}0699$$

Шаг 5. Сравниваем: $0{,}057$ против $0{,}0699$. Второй ответ точный, первый — приближённый и занижает результат примерно на 18%. Причина в том, что при $k = 10$ гамма-распределение ещё заметно скошено вправо, и симметричная нормальная модель недооценивает правый хвост. Стрелка «гамма $\to$ нормальное» становится надёжной при $k$ порядка нескольких десятков.

Ответ: точное значение $\approx 0{,}070$; нормальное приближение даёт $\approx 0{,}057$ и в данном случае слишком грубое

📌 Разбор показывает, зачем карта нужна на практике: одна и та же задача решается по двум разным веткам, и сверка ответов сразу показывает, какое приближение здесь допустимо, а какое — нет.


Почему это важно

Карта связей превращает справочник в систему. Если помнить только два базовых объекта — испытание Бернулли и нормальный закон, — плюс десяток стрелок с условиями перехода, вся таблица распределений восстанавливается на салфетке. Это не мнемонический фокус: каждая стрелка — содержательное утверждение о механизме, порождающем данные.

Практическая ценность карты в том, что она работает в обратную сторону. Обычно у тебя есть данные и нет модели. Тогда вопрос ставится так: какой механизм породил эти числа?

  • величина считает штуки за период, среднее примерно равно дисперсии $\to$ Пуассон
  • считает штуки, но дисперсия сильно больше среднего $\to$ Пуассон не подходит, ищи неоднородность или бери отрицательное биномиальное
  • измеряет время до события, и события приходят от внешних случайных причин $\to$ экспоненциальное
  • измеряет время до события, но риск растёт с возрастом $\to$ Вейбулл, не экспоненциальное
  • положительная величина, гистограмма скошена вправо, а гистограмма логарифма похожа на колокол $\to$ логнормальное
  • величина складывается из множества мелких сопоставимых вкладов $\to$ нормальное

Второй практический слой — вычислительный. Стрелки карты работают как способ посчитать то, что в лоб не считается: биномиальный коэффициент при $n = 10^6$ не берётся, а пуассоновское или нормальное приближение даёт ответ за секунду с погрешностью в доли процента. Ровно эти замены зашиты внутрь статистических библиотек, и понимание условий перехода — единственный способ заметить, когда библиотека применила приближение за пределами его области годности.

И третий слой — диагностический. Расхождение между тем, что предсказывает модель распределения, и тем, что показывают данные, почти всегда означает, что нарушено условие какой-то стрелки: испытания оказались зависимыми, интенсивность потока непостоянной, вклады неодинаковыми по масштабу. Понимание карты превращает такое расхождение из загадки в конкретный список гипотез для проверки.


Практика: 30 заданий

Базовые (задания 1-10)

Задание 1: Пользователь подписывается на рассылку с вероятностью $0{,}3$. Опишем один визит бернуллиевской величиной $X$. Найди $E(X)$, $D(X)$ и $\sigma$.


Задание 2: Известно, что дисперсия бернуллиевской величины равна $0{,}16$. Найди все возможные значения $p$.


Задание 3: $X \sim \mathrm{Bin}(10; 0{,}3)$. Найди $P(X = 2)$.


Задание 4: Модель ошибается на каждом объекте с вероятностью $0{,}06$. Тестовая выборка — $500$ объектов. Найди среднее число ошибок, дисперсию и $\sigma$.


Задание 5: Вероятность, что случайно сгенерированный пароль пройдёт проверку сложности, равна $0{,}05$. Сколько попыток в среднем понадобится и какова вероятность, что после $10$ попыток подходящего пароля так и не будет?


Задание 6: В логи сервиса попадает в среднем $3$ ошибки уровня ERROR в минуту. Найди вероятность, что за минуту не будет ни одной ошибки, и вероятность, что их будет не более одной.


Задание 7: Из датасета в $20$ записей случайно и равновероятно выбирают номер строки. Найди $E(X)$, $D(X)$ и $\sigma$.


Задание 8: $X \sim U(0; 5)$. Найди плотность, $E(X)$, $D(X)$ и $P(X < 1{,}5)$.


Задание 9: Время отклика сервиса распределено как $\mathcal{N}(50; 8^2)$ мс. Какая доля запросов укладывается в интервал от $42$ до $58$ мс? На сколько сигм отстоит запрос длительностью $66$ мс?


Задание 10: Рост взрослых мужчин в популяции описывается моделью $\mathcal{N}(176; 6{,}5^2)$ см. Какой рост отсекает верхние $5\%$?


Средние (задания 11-20)

Задание 11: В пайплайне $50$ независимых шагов, каждый падает с вероятностью $0{,}02$. Найди вероятность хотя бы одного падения точно (биномиально) и приближённо (по Пуассону), сравни.


Задание 12: Запрос к нестабильному сервису проходит с вероятностью $0{,}2$. Сколько ретраев надо заложить, чтобы успех случился с вероятностью не менее $0{,}95$?


Задание 13: В службу поддержки поступает $4$ обращения в час. Найди вероятность, что за час придёт хотя бы два обращения.


Задание 14: Автобусы ходят строго каждые $12$ минут, ты приходишь на остановку в случайный момент. Найди $P(X > 8)$ и $P(X > 8 \mid X > 4)$. Обладает ли равномерное распределение свойством отсутствия памяти?


Задание 15: Латентность API распределена как $\mathcal{N}(200; 25^2)$ мс. Найди SLA-порог, в который укладывается $95\%$ запросов, и порог для $97{,}5\%$.


Задание 16: Честную монету бросают $400$ раз. Оцени вероятность того, что число орлов попадёт в интервал от $190$ до $210$, и вероятность получить больше $230$ орлов.


Задание 17: Бросают две честные кости и складывают очки. Найди $E(S)$ и $D(S)$, не выписывая распределение суммы.


Задание 18: Генератор выдаёт $U \sim U(0;1)$. Построй из него величину, равномерную на $[-3; 7]$, проверь её $E$ и $D$ и посчитай результат для $u = 0{,}62$.


Задание 19: Классификатор выдал на трёх объектах вероятности $0{,}9$, $0{,}2$ и $0{,}4$, а истинные метки — $1$, $0$ и $1$. Посчитай средний log-loss.


Задание 20: Обычная нагрузка на сервис — $20$ запросов в минуту. Дежурного будим, если число запросов за минуту уходит выше $\mu + 3\sigma$. Найди порог и оцени, как часто будет ложная тревога.


Продвинутые (задания 21-30)

Задание 21: Слой из $512$ нейронов, dropout с вероятностью выключения $0{,}5$. Найди распределение числа активных нейронов, его $E$, $\sigma$, трёхсигмовый коридор. Что изменится для слоя из $8$ нейронов?


Задание 22: Доля положительного класса в датасете — $2\%$. Батч $256$ объектов набирается случайно. Как часто батч не содержит ни одного положительного примера? Какой минимальный размер батча гарантирует «хотя бы один положительный» с вероятностью $0{,}99$?


Задание 23: Полносвязный слой $256 \to 256$ инициализируется по Ксавье через $U(-c; c)$. Найди $c$, дисперсию и $\sigma$ веса. Можно ли к такому весу применять правило трёх сигм?


Задание 24: Тот же слой инициализируют по схеме Хе: $w \sim \mathcal{N}\!\left(0, \frac{2}{n_{\text{in}}}\right)$ при $n_{\text{in}} = 1024$. Найди $\sigma$, оцени долю весов по модулю больше $0{,}0884$ и больше $0{,}1326$, сравни с Ксавье для слоя $1024 \to 1024$.


Задание 25: A/B-тест: по $10\,000$ пользователей в каждой группе, конверсий $1000$ и $1120$. Можно ли считать разницу значимой?


Задание 26: Отбраковочное семплирование принимает точку с вероятностью $0{,}12$, одна итерация стоит $4$ мс. Найди среднее число итераций, $\sigma$, вероятность превысить $30$ итераций и время генерации $100\,000$ семплов. Что даст рост доли принятия до $0{,}30$?


Задание 27: Число обращений за день моделируют Пуассоном. По данным: в половине дней интенсивность $\lambda = 5$, в другой половине $\lambda = 15$. Найди $E$ и $D$ суммарного распределения и объясни, почему одна пуассоновская модель тут не работает.


Задание 28: Ошибки модели на валидации распределены как $\mathcal{N}(0; 2{,}5^2)$, в сутки скорится $50\,000$ объектов. Сколько алертов в день даст порог $1{,}96\sigma$, $3\sigma$ и $4\sigma$? Что произойдёт, если ошибки на самом деле не нормальны?


Задание 29: Признак равномерно распределён на $[0;1]$ и пропущен через StandardScaler. Найди распределение результата, проверь $E$ и $D$, посчитай $P(|Z| > 1)$ и сравни с нормальным. Сработает ли на этом признаке детектор выбросов «$|z| > 3$»?


Задание 30: Покажи, что при гауссовом шуме минимизация MSE — это максимизация правдоподобия. Затем на остатках $0{,}4;\ -1{,}2;\ 0{,}7;\ -0{,}3;\ 1{,}5$ оцени $\sigma$ и посчитай логарифм правдоподобия. Что случится, если добавить шестое наблюдение с остатком $10$?


Частые ошибки

Ошибка 1: путать биномиальное распределение с геометрическим

Неправильно: «Вероятность успешного запроса $0{,}25$. Сколько запросов нужно до первого успеха? Ну, $n \cdot p$…» — человек хватается за формулу биномиального матожидания и получает бессмыслицу, потому что $n$ здесь вообще не задано.

Правильно: различие в том, что зафиксировано, а что случайно.

  • В биномиальном фиксировано число испытаний $n$, случайно число успехов: $E = np$
  • В геометрическом фиксирована цель (первый успех), случайно число испытаний: $E = 1/p$

Для $p = 0{,}25$ ответ $E(X) = 1/0{,}25 = 4$ запроса.

Почему важно: это разные вопросы к одному и тому же эксперименту, и путаница между ними — самая частая на всём материале урока. Спасательный вопрос: «что я тут считаю — сколько успехов или сколько попыток?»


Ошибка 2: подставлять $\sigma^2$ туда, где нужна $\sigma$ (и наоборот)

Неправильно: «$X \sim \mathcal{N}(100; 25)$, значит три сигмы — это от $25$ до $175$».

Правильно: в записи $\mathcal{N}(\mu, \sigma^2)$ вторым параметром стоит дисперсия. Здесь $\sigma^2 = 25$, значит $\sigma = 5$, и трёхсигмовый коридор — это $[85; 115]$, а не $[25; 175]$.

Почему важно: ошибка растягивает интервал в пять раз, и на ней ломается любая оценка «нормально это или аномалия». Та же ловушка у Пуассона: $D(X) = \lambda$, поэтому $\sigma = \sqrt{\lambda}$, а не $\lambda$. При $\lambda = 100$ разница между $\sigma = 10$ и «$\sigma = 100$» — это разница между алертом на $130$ и алертом на $400$. Заведи привычку явно писать, что именно у тебя в руках: «$\sigma^2 = 25$, следовательно $\sigma = 5$».


Ошибка 3: применять правило трёх сигм к ненормальному распределению

Неправильно: «У признака $\mu = 40$, $\sigma = 12$, значит $99{,}7\%$ значений лежат в $[4; 76]$».

Правильно: правило $68$–$95$–$99{,}7$ выведено из формы гауссова колокола и верно только для нормального распределения. Для произвольной величины работает лишь неравенство Чебышёва: вне трёх сигм не более $1/9 \approx 11\%$ значений. А бывает и противоположная крайность: у равномерного распределения вне $1{,}74\sigma$ нет вообще ничего (задание 29).

Почему важно: разброс между «$0{,}3\%$» и «до $11\%$» — это в тридцать с лишним раз, и именно на этой подмене строятся мониторинги, которые заваливают дежурного ложными алертами. Перед применением правила посмотри на гистограмму: колокол там или нет.


Ошибка 4: складывать дисперсии зависимых величин

Неправильно: «Модель ошиблась на $130$ кадрах из $900$ при ожидаемых $90$. Считаем: $D = npq = 900 \cdot 0{,}1 \cdot 0{,}9 = 81$, $\sigma = 9$, отклонение $(130-90)/9 \approx 4{,}4\sigma$ — модель сломалась».

Правильно: формула $D(X_1 + \dots + X_n) = D(X_1) + \dots + D(X_n)$ требует независимости слагаемых. Соседние кадры одного видео сильно зависимы, ошибки идут сериями, поэтому эффективное число независимых наблюдений в разы меньше $900$. Оценивать надо по независимым видео, а не по кадрам.

Почему важно: матожидание аддитивно всегда, а дисперсия — нет, и именно на этой асимметрии ломаются оценки. Нарушение независимости всегда занижает расчётную $\sigma$, а значит раздувает $z$-оценки и порождает уверенные, но ложные выводы: «значимый результат A/B-теста», «деградация модели», «аномалия в проде».


Ошибка 5: путать две версии геометрического распределения

Неправильно: «Взял из библиотеки геометрическое с $p = 0{,}2$, среднее должно быть $5$, а получилось $4$. Библиотека сломана».

Правильно: есть две конвенции.

  • $X$ — номер испытания с первым успехом, значения $1, 2, 3, \dots$, $E(X) = \dfrac1p = 5$
  • $Y$ — число неудач до первого успеха, значения $0, 1, 2, \dots$, $E(Y) = \dfrac{q}{p} = \dfrac{0{,}8}{0{,}2} = 4$

Связь простая: $Y = X - 1$, и средние отличаются ровно на единицу. Дисперсия при этом у обеих одинакова: $q/p^2$ (сдвиг на константу дисперсию не меняет).

Почему важно: scipy.stats.geom использует первую конвенцию, numpy.random.geometric — тоже, а вот torch.distributions.Geometric считает число неудач, то есть вторую. Расхождение в единицу кажется мелочью, но при $p$ близком к единице это ошибка в разы: при $p = 0{,}9$ будет $1{,}11$ против $0{,}11$.


Ошибка 6: брать Пуассона для счётчика, не проверив $D = E$

Неправильно: «Число заказов в день — это счётчик, значит Пуассон. Среднее $50$, ставлю алерт на $\mu + 3\sqrt{\mu} = 50 + 21{,}2 = 71$».

Правильно: сначала считаем выборочную дисперсию. Если по историческим данным среднее $50$, а дисперсия $400$, то индекс дисперсии $D/E = 8$ — никакого Пуассона тут нет. Настоящая $\sigma = 20$, и трёхсигмовый порог должен быть $50 + 60 = 110$, а не $71$.

Почему важно: равенство $E = D$ — не украшение паспорта, а проверяемое условие применимости. Сверхдисперсия у реальных счётчиков возникает почти всегда, потому что интенсивность сама плавает: будни против выходных, сезонность, маркетинговые кампании (задание 27). Порог, посчитанный по заниженной $\sigma$, срабатывает не в $0{,}3\%$ случаев, а в десятках процентов — и алерт быстро отправляется в игнор.


Ошибка 7: не пересчитывать $\lambda$ под нужный интервал

Неправильно: «Приходит $2{,}5$ обращения в час. Найти вероятность ровно $5$ обращений за три часа: $P = \dfrac{2{,}5^5}{5!}e^{-2{,}5} \approx 0{,}0668$».

Правильно: параметр $\lambda$ — это среднее число событий за тот интервал, о котором спрашивают. За три часа среднее равно $2{,}5 \cdot 3 = 7{,}5$, и считать надо

$$P(X = 5) = \frac{7{,}5^5}{5!}e^{-7{,}5} = \frac{23730{,}47}{120} \cdot 0{,}00055308 \approx 0{,}1094$$

Почему важно: ошибка занижает ответ почти вдвое и при этом абсолютно незаметна — формула выглядит правильно, размерность нигде не «звенит». Правило: первым делом выпиши, за какой интервал спрашивают, и приведи $\lambda$ к нему. То же касается и обратного направления: за $12$ минут $\lambda = 2{,}5 \cdot 0{,}2 = 0{,}5$.


Главное запомнить

📝 Ключевые понятия

Распределение Бернулли: один опыт с двумя исходами, $P(X=1) = p$; $E(X) = p$, $D(X) = pq$. Атом, из которого собираются биномиальное, геометрическое и (в пределе) пуассоновское. В ML — выход сигмоиды и вся бинарная классификация: log-loss $= -[y\ln\hat p + (1-y)\ln(1-\hat p)]$ есть минус логарифм бернуллиевской вероятности.

Биномиальное распределение: число успехов в $n$ независимых испытаниях, $P(X = k) = C_n^k p^k q^{n-k}$; $E(X) = np$, $D(X) = npq$. Формулы получаются мгновенно из разложения в сумму $n$ бернуллиевских атомов — матожидание аддитивно всегда, дисперсия только при независимости.

Геометрическое распределение: номер испытания с первым успехом, $P(X = k) = q^{k-1}p$; $E(X) = \dfrac1p$, $D(X) = \dfrac{q}{p^2}$. Главная рабочая формула — хвост $P(X > k) = q^k$. Единственное дискретное распределение без памяти: $P(X > m+n \mid X > m) = P(X > n)$.

Распределение Пуассона: поток редких событий за интервал, $P(X = k) = \dfrac{\lambda^k}{k!}e^{-\lambda}$; $E(X) = D(X) = \lambda$, поэтому $\sigma = \sqrt{\lambda}$. Совпадение среднего и дисперсии — одновременно и признак, и тест применимости: $D/E \ne 1$ означает сверхдисперсию и запрет на эту модель.

Приближение Пуассона: при $n \ge 50$ и $p \le 0{,}05$ биномиальное заменяется пуассоновским с $\lambda = np$; погрешность порядка долей процента. Отсюда же удобная формула «хотя бы одно»: $P(X \ge 1) \approx 1 - e^{-\lambda}$.

Дискретное равномерное: $n$ равновероятных значений, $P = 1/n$; $E(X) = \dfrac{a+b}{2}$, $D(X) = \dfrac{n^2-1}{12}$, откуда $\sigma \approx 0{,}289 n$. Фундамент всей вычислительной случайности: перемешивание датасета, мини-батчи, бутстрэп, random search.

Непрерывное равномерное: $f(x) = \dfrac{1}{b-a}$ на отрезке, $F(x) = \dfrac{x-a}{b-a}$; $E(X) = \dfrac{a+b}{2}$, $D(X) = \dfrac{(b-a)^2}{12}$, $\sigma \approx 0{,}289(b-a)$. Из этой дисперсии буквально выводится константа $6$ в инициализации Ксавье $U(-c;c)$, $c = \sqrt{6/(n_{\text{in}} + n_{\text{out}})}$.

Метод обратной функции: если $U \sim U(0;1)$, то $X = F^{-1}(U)$ имеет функцию распределения $F$. Поэтому генератору достаточно уметь выдавать равномерные числа — всё остальное получается подстановкой (для экспоненциального: $X = -\ln(1-U)/\lambda$).

Нормальное распределение: $f(x) = \dfrac{1}{\sigma\sqrt{2\pi}}e^{-\frac{(x-\mu)^2}{2\sigma^2}}$, $E(X) = \mu$, $D(X) = \sigma^2$. Возникает из сложения множества мелких независимых вкладов, а не из конкретного механизма. Хвосты гаснут как $e^{-z^2/2}$ — на порядки, а не в разы.

Стандартизация и правило трёх сигм: $Z = \dfrac{X-\mu}{\sigma}$ даёт $E(Z) = 0$, $D(Z) = 1$ и универсальную безразмерную линейку. Для нормального: $68{,}27\%$ в одной сигме, $95{,}45\%$ в двух, $99{,}73\%$ в трёх; односторонние квантили $1{,}645$ (5%) и $1{,}96$ (2,5%). Для ненормального работает только Чебышёв: вне $3\sigma$ не более $11\%$. Стандартизация меняет масштаб, но не форму распределения.


Связь с другими темами курса

Что нужно было знать до этого урока. Весь урок стоит на аппарате предыдущих шести. Из урока 234 — само понятие случайной величины и различие дискретных и непрерывных; без него нельзя было бы даже сформулировать, чем паспорт Бернулли отличается от паспорта нормального. Из урока 235 — функция распределения $F(x)$, которая понадобилась в равномерном случае и стала основой метода обратной функции. Из урока 236 — плотность и то, что вероятность непрерывной величины есть площадь под плотностью; именно так мы считали $P(X > 5{,}5)$ для $U(2;8)$. Из уроков 237–238 — определения $E(X)$ и $D(X)$, формула $D(X) = E(X^2) - (E(X))^2$ и правила поведения при линейном преобразовании: без них не вывелись бы ни $D = pq$, ни $D = npq$, ни стандартизация. Из урока 239 (моменты случайных величин) — асимметрия и эксцесс, с помощью которых мы говорили, что нормальное распределение служит эталоном формы, а биномиальное при $p \ne 0{,}5$ скошено. И, наконец, схема Бернулли из урока 233 и условная вероятность из урока 230, на которой построено доказательство отсутствия памяти.

Что изучить дальше. Следующий урок 241 — центральная предельная теорема — объясняет то, что в этом уроке принято на веру: почему нормальное распределение возникает буквально везде и почему биномиальное при большом $n$ становится похоже на колокол. Это прямое продолжение, и без него картина неполна. Дальше урок 242 (закон больших чисел) покажет, почему выборочное среднее сходится к $E(X)$ — то есть почему оценка параметра по данным вообще имеет смысл. Уроки 245–246 (оценка параметров, доверительные интервалы) превратят паспорта в рабочий инструмент: там ты будешь по выборке восстанавливать $p$, $\lambda$, $\mu$, $\sigma$ и строить вокруг них интервалы — а формулы $\sqrt{pq/n}$ и $1{,}96\sigma$ из этого урока станут их скелетом. Урок 247 (проверка гипотез) формализует то, что мы делали на глазок в заданиях 16 и 25.

Где это нужно в жизни

💻 В программировании. Генератор псевдослучайных чисел выдаёт равномерные значения, из них методом обратной функции строятся все остальные распределения. Retry-логика и таймауты считаются по геометрическому хвосту $q^k$, а не по среднему $1/p$. Нагрузочное тестирование и оценка ёмкости очередей опираются на пуассоновскую модель потока запросов. SLA и перцентили латентности $p95$/$p99$ — это квантили, и понимание формы распределения решает, можно ли считать их через $\mu + z\sigma$ или нужен эмпирический квантиль.

🤖 В ML/AI. Бернулли задаёт log-loss и сигмоиду. Биномиальное — доверительные интервалы для accuracy, размер выборки A/B-теста, dropout, бутстрэп. Пуассоновское — регрессия на счётчиках (PoissonRegressor, objective='count:poisson', nn.PoissonNLLLoss). Равномерное — Xavier-инициализация, аугментации, random search, формирование мини-батчей. Нормальное — MSE как следствие гауссова шума, He-инициализация, BatchNorm как стандартизация, гауссовский шум в диффузионных моделях, латентное пространство VAE, RBF-ядро, гауссовские процессы.

📊 В Data Science. Выбор распределения — это первое решение при постановке любой задачи: счётчик, доля, время до события или непрерывная величина. От него зависит и функция потерь, и метрика, и способ строить интервал. Индекс дисперсии $D/E$ мгновенно отбраковывает пуассоновскую модель для реальных бизнес-счётчиков. Логарифмирование целевой переменной перед бустингом делается ровно потому, что зарплаты, чеки и длительности сессий имеют скошенное вправо распределение, а не колокол.

🔬 В науке. Теория ошибок измерений целиком построена на нормальном распределении — оттуда оно и пришло, из астрономических наблюдений Гаусса. Радиоактивный распад, число мутаций в геноме, число фотонов на детекторе — классические пуассоновские процессы. Контроль качества на производстве, контрольные карты Шухарта с границами $\pm 3\sigma$, приёмочные планы выборочного контроля — прямое применение биномиальной и нормальной моделей. В эпидемиологии и клинических испытаниях доля выздоровевших — биномиальная величина, и весь расчёт размера исследования идёт через $\sqrt{pq/n}$.


Интересные факты

💡 Прусские кавалеристы и лошадиные копыта — самая знаменитая проверка распределения Пуассона провелась на данных, которые никто не собирал ради статистики. Владислав Борткевич в 1898 году взял отчёты по $10$ прусским армейским корпусам за $20$ лет: $200$ наблюдений, $122$ смерти от удара копытом, то есть $\lambda = 0{,}61$. Модель предсказывала $108{,}7$ года без единой смерти — в данных оказалось $109$. Для одной смерти: предсказано $66{,}3$, наблюдалось $65$. Совпадение почти неприличное, и именно оно превратило формулу Пуассона из курьёза в рабочий инструмент.

💡 Немецкие ракеты доказали, что Лондон бомбили случайно. Во время войны лондонцы были уверены, что «Фау-1» падают кучно и что немцы прицельно бьют по конкретным районам — люди даже переезжали из «опасных» кварталов. В 1946 году актуарий Р. Д. Кларк разбил юг Лондона на $576$ квадратов по четверти квадратного километра и посчитал попадания: $537$ ракет, $\lambda = 0{,}9323$. Пуассон предсказал $226{,}7$ пустых квадратов — оказалось $229$. Кластеры были, но ровно такие, какие даёт чистая случайность. Это, кстати, общее свойство: люди систематически недооценивают, насколько «комковато» выглядит настоящая случайность.

💡 Первая физическая модель нормального распределения была деревянной. Фрэнсис Гальтон в 1873 году построил «доску Гальтона» (quincunx): наклонная доска с рядами штырьков, по которой скатываются шарики, на каждом штырьке случайно уходя влево или вправо. Внизу они собираются в ячейки — и всегда образуют колокол. Это буквально биномиальное распределение, собранное вручную, и одновременно физическая демонстрация центральной предельной теоремы за сорок лет до того, как её строго доказали Ляпунов и Линдеберг.

💡 Название «нормальное» — историческая случайность, и она дорого обошлась. Термин независимо ввели Пирс, Гальтон и Лексис примерно в 1873–1877 годах, и он мгновенно создал впечатление, что все прочие распределения — «ненормальные», то есть неправильные. Анри Пуанкаре ехидно замечал: «Все верят в нормальный закон: экспериментаторы — потому что считают его математической теоремой, математики — потому что считают его экспериментальным фактом». Расплата пришла в финансах: модели, предполагавшие нормальность доходностей, объявляли кризис 2008 года событием на $25\sigma$ — то есть таким, которое не должно случаться за время жизни Вселенной. Оно случилось несколько дней подряд.

💡 Знаменитые «шесть сигм» на самом деле четыре с половиной. Методология Six Sigma, придуманная в Motorola в 1986 году, обещает $3{,}4$ дефекта на миллион. Но у чистого нормального распределения за $6\sigma$ уходит примерно $2 \cdot 10^{-9}$ — то есть два дефекта на миллиард, в тысячу с лишним раз меньше. Разгадка в том, что инженеры Motorola заложили эмпирическую поправку: реальный производственный процесс дрейфует, и центр распределения гуляет примерно на $1{,}5\sigma$. Считая от смещённого центра, получаем ровно $4{,}5\sigma$ и те самые $3{,}4$ дефекта на миллион. Редкий случай, когда в общепринятый стандарт зашита честная поправка на несовершенство модели.


Лайфхаки и полезные трюки

1. Сначала определи механизм, потом бери формулу

Не пытайся вспомнить формулу — вспомни, что порождает данные. Дерево решений короткое:

  • один опыт с двумя исходами → Бернулли
  • фиксированное $n$ опытов, считаем успехи → биномиальное
  • ждём первого успеха, считаем попытки → геометрическое
  • считаем редкие события за интервал → Пуассон
  • все исходы равновероятны → равномерное
  • величина складывается из множества мелких вкладов → нормальное

Пример: «Сколько из $300$ пользователей купят подписку?» — фиксировано $n = 300$, считаем успехи, значит биномиальное. «Сколько писем разослать, чтобы получить первый ответ?» — та же схема, но ждём первого успеха, значит геометрическое. Механизм различается одним словом в условии, а формулы — принципиально.


2. Проверяй $D/E$ прежде, чем брать Пуассона

Индекс дисперсии — самый дешёвый тест адекватности модели, какой существует. Посчитай по историческим данным выборочное среднее и выборочную дисперсию и подели одно на другое. Значение около единицы — Пуассон подходит. Заметно больше единицы — сверхдисперсия, ищи скрытую группировку.

Пример: число заказов по дням, среднее $50$, дисперсия $400$, индекс $8$. Разделяем на будни и выходные — внутри будней среднее $35$, дисперсия $38$ (индекс $1{,}09$), внутри выходных $85$ и $92$ (индекс $1{,}08$). Оба потока прекрасно пуассоновские, просто их нельзя было мешать. Две модели вместо одной — и алерты перестают врать.


3. «Хотя бы один» всегда через противоположное событие

Как только в условии появляются слова «хотя бы один», «хотя бы раз», «не будет ни одного» — не суммируй хвост, а переходи к дополнению. Для биномиального это $1 - q^n$, для Пуассона $1 - e^{-\lambda}$, для геометрического $1 - q^k$.

Пример: «Сколько прогонов нужно, чтобы хотя бы раз словить редкий баг с вероятностью $0{,}003$?» Хотим гарантию $95\%$: $1 - 0{,}997^n \ge 0{,}95$, то есть $n \ge \dfrac{\ln 0{,}05}{\ln 0{,}997} \approx 997$. Опорная точка на будущее: $n \approx 3/p$ даёт около $95\%$, $n \approx 1/p$ — около $63\%$.


4. Большие степени считай через логарифм

Выражения вида $0{,}98^{200}$ в уме не берутся, а в коде переполняются или теряют точность. Приём один и тот же: $a^n = e^{n\ln a}$. Плюс держи в голове приближение $\ln(1-x) \approx -x$ при малых $x$ — оно мгновенно объясняет, почему $q^n \approx e^{-np}$ и откуда вообще берётся Пуассон.

Пример: $0{,}98^{200}$. Точно: $200 \cdot \ln 0{,}98 = 200 \cdot (-0{,}0202027) = -4{,}0405$, значит $e^{-4{,}0405} \approx 0{,}0176$. В уме: $\ln 0{,}98 \approx -0{,}02$, произведение $-4$, ответ $e^{-4} \approx 0{,}018$. Разница в третьем знаке, а времени ушло пять секунд.


5. Держи под рукой шпаргалку сигм

Пять чисел закрывают девяносто процентов практических вопросов по нормальному распределению:

  • $\pm 1\sigma$ — $68{,}27\%$ внутри, по $15{,}9\%$ с каждой стороны
  • $\pm 2\sigma$ — $95{,}45\%$ внутри, по $2{,}28\%$ снаружи
  • $\pm 3\sigma$ — $99{,}73\%$ внутри, по $0{,}135\%$ снаружи
  • $z = 1{,}645$ отсекает $5\%$ справа
  • $z = 1{,}96$ отсекает $2{,}5\%$ справа (отсюда интервал $\mu \pm 1{,}96\sigma$)

Пример: «Задержка $\mathcal{N}(200; 25^2)$, сколько запросов медленнее $275$ мс?» Считаем $z = (275-200)/25 = 3$, смотрим в шпаргалку: $0{,}135\%$. При миллионе запросов в сутки это $1350$ штук — уже не «пренебрежимо мало», а вполне ощутимая группа недовольных пользователей.


6. Проверяй ответ прикидкой по $E$ и $\sigma$ до того, как поверишь калькулятору

Прежде чем принять полученное число, посчитай матожидание и стандартное отклонение и посмотри, где относительно них стоит интересующее значение. Отклонение в полсигмы — событие рядовое, вероятность порядка десятков процентов. Две сигмы — редковато, около $5\%$ в обе стороны. Четыре сигмы — либо арифметическая ошибка, либо неверная модель.

Пример: посчитал, что при $\mathrm{Bin}(500; 0{,}06)$ вероятность получить $45$ ошибок равна $0{,}3$. Прикидка: $E = 30$, $\sigma \approx 5{,}31$, значение $45$ отстоит на $(45-30)/5{,}31 \approx 2{,}8\sigma$. Вероятность попасть ровно в такую точку хвоста никак не может быть $30\%$ — где-то потерян множитель. Десять секунд прикидки экономят полчаса поиска ошибки.


💡 Совет: не заучивай девять паспортов подряд — это самый быстрый способ всё перепутать. Выучи наизусть ровно три вещи: бернуллиевский атом ($E = p$, $D = pq$), правило сложения атомов (матожидание складывается всегда, дисперсия — только при независимости) и шпаргалку сигм. Всё остальное из этого выводится за минуту прямо на листке. Биномиальное — сумма $n$ атомов. Пуассон — предел биномиального при $p \to 0$. Геометрическое — первый успех в цепочке атомов, а вся его практика держится на одной формуле хвоста $q^k$. Понимание механизма живёт годами, заученная таблица — до первого экзамена.

И заведи привычку, которая отличает инженера от студента: перед каждым расчётом вслух проговаривать модель. «Один объект = одно испытание, успех = ошибка модели, $p = 0{,}06$, испытаний $500$, независимы ли они — да, объекты из разных сессий». Три предложения. Именно на этом шаге ловятся зависимые кадры видео, сверхдисперсия в счётчиках и подмена биномиального геометрическим — то есть ровно те ошибки, которые потом стоят недель работы.

В следующем уроке — центральная предельная теорема — мы наконец ответим на вопрос, который висел над всем этим уроком: почему нормальное распределение вылезает буквально отовсюду? Почему сумма двух костей уже горбатая, четырёхсот подбрасываний монеты — практически идеальный колокол, а ошибки измерений совершенно разных приборов ложатся на одну и ту же кривую? Ответ окажется красивее, чем ты ждёшь: форма слагаемых не имеет значения вообще. Складывай что угодно — и на выходе получишь гауссиану. Именно эта теорема превращает набор разрозненных паспортов в единую систему. Поехали 🚀

Понял тему? Закрепи в боте! 🚀

Попрактикуйся на задачах и получи персональные рекомендации от AI

💪 Начать тренировку
💬 Есть вопрос? Спроси бота!