🔴 Сложный ⏱️ 60 минут

Центральная предельная теорема

📋 Содержание урока

Центральная предельная теорема 🔔

Ты обучил классификатор, прогнал его на отложенной выборке из 500 объектов и получил accuracy 0,912. Коллега обучил свою модель, прогнал на той же выборке и получил 0,924. Он торжествует: его модель лучше на 1,2 процентных пункта. А ты смотришь на эти цифры и понимаешь, что не знаешь главного — это реальная разница или просто повезло с тем, какие 500 объектов попали в тест?

Ответить на такой вопрос без единой формулы невозможно. Но стоит достать один инструмент — и ответ занимает три строки. Стандартная ошибка accuracy на выборке из 500 объектов при уровне около 0,92 равна примерно $\sqrt{0{,}92 \cdot 0{,}08 / 500} \approx 0{,}012$. То есть разброс самой метрики от выборки к выборке — как раз порядка 1,2 процентных пункта. Разница коллеги укладывается ровно в одну стандартную ошибку, то есть это шум, а не победа. Инструмент, который позволил это сказать, называется центральная предельная теорема — ЦПТ.

ЦПТ — это, пожалуй, самое удивительное утверждение во всей теории вероятностей. Она говорит: возьми какие угодно независимые одинаково распределённые случайные величины — лишь бы у них была конечная дисперсия. Не важно, дискретные они или непрерывные, симметричные или перекошенные, ограниченные или уходящие в бесконечность. Сложи их. И при большом числе слагаемых распределение суммы, если её правильно отцентрировать и отмасштабировать, будет всё ближе и ближе к одной-единственной кривой — стандартному нормальному распределению. Форма исходных величин полностью стирается. Остаются только два числа: математическое ожидание и дисперсия.

Именно поэтому нормальное распределение из урока 240 встречается везде — от роста людей до шума в градиентах нейросети. Не потому что природа его любит, а потому что почти всё, что мы измеряем, есть сумма множества мелких независимых вкладов. В этом уроке мы разберём точную формулировку ЦПТ, увидим на числах, как быстро колокол вырастает из кубика и монетки, узнаем, при каких условиях теорема ломается (спойлер: распределение Коши убивает её начисто), и вытащим из неё практический инструментарий дата-сайентиста: стандартную ошибку метрики, размер выборки для A/B-теста, объяснение шума в SGD и формулы инициализации Xavier и He.

🎯 Ты узнаешь:

  • Точную формулировку ЦПТ для нормированной суммы $\frac{\sum X_i - n\mu}{\sigma\sqrt n}$ и что именно в ней «стремится»
  • Почему стандартное отклонение выборочного среднего равно $\sigma/\sqrt n$ и почему это самая полезная формула в прикладной статистике
  • Чем ЦПТ отличается от закона больших чисел: один говорит куда сходится среднее, другая — как оно колеблется вокруг предела
  • Как выглядит сходимость на числах: суммы кубиков, равномерных величин и бросков Бернулли в таблицах
  • Когда ЦПТ не работает — распределение Коши, зависимые слагаемые, малое $n$ при сильной асимметрии — и что делать вместо неё
  • Откуда в ML берутся доверительные интервалы для accuracy, расчёт размера A/B-теста и коэффициенты $\sqrt{2/n_{\text{in}}}$ в инициализации He

История: откуда это взялось?

Всё началось с азартных игр и очень скучной арифметики. В 1733 году французский математик Абрахам де Муавр, живший в Лондоне и зарабатывавший консультациями для игроков и страховщиков, столкнулся с вычислительным кошмаром. Чтобы найти вероятность выпадения от 45 до 55 орлов в 100 бросках монеты, нужно было сложить одиннадцать биномиальных коэффициентов, каждый из которых — гигантское число вроде $C_{100}^{50} \approx 1{,}0089 \cdot 10^{29}$. В эпоху расчётов пером это было невыполнимо.

Де Муавр нашёл обходной путь. В работе «Approximatio ad Summam Terminorum Binomii $(a+b)^n$ in Seriem expansi», разосланной друзьям в виде частного памфлета в ноябре 1733 года, он показал: биномиальные вероятности при большом $n$ ложатся на гладкую кривую вида $e^{-x^2}$, и сумму можно заменить площадью под этой кривой. Это была первая в истории формулировка того, что сегодня называют теоремой Муавра–Лапласа — частным случаем ЦПТ для схемы Бернулли. Любопытно, что де Муавр не понял всей общности своего открытия: для него это был вычислительный трюк для монетки, а не универсальный закон природы.

Обобщил идею Пьер-Симон Лаплас. В «Аналитической теории вероятностей» (1812) он распространил приближение на произвольное $p$, а не только на $p = 1/2$, и — что важнее — начал догадываться, что колоколообразная кривая появляется при суммировании чего угодно, а не только исходов монетки. Практическая мотивация была астрономическая в буквальном смысле: наблюдатели измеряли положения планет, каждое измерение содержало ошибку, и вопрос «как ведёт себя среднее из ста измерений» стоил очень дорого. Параллельно Карл Фридрих Гаусс в 1809 году, работая над орбитой Цереры, вывел ту же кривую из принципа наименьших квадратов — отсюда «распределение Гаусса».

Строгое доказательство в общем виде появилось только через сто лет, и заметная часть работы была сделана в России. Пафнутий Чебышёв в 1887 году предложил метод моментов и сформулировал теорему, Андрей Марков залатал дыры в доказательстве, а Александр Ляпунов в 1901 году дал первое по-настоящему строгое доказательство при условии, которое сегодня носит его имя, — и вдобавок ввёл метод характеристических функций, ставший стандартным инструментом. Само название «центральная предельная теорема» придумал Джордж Пойа в 1920 году: слово «центральная» у него означало не «про центр распределения», а «центральная по значимости для теории вероятностей». Окончательную точку поставил Яарл Линдеберг (1922), нашедший условие, которое оказалось не только достаточным, но, как показал Вильям Феллер в 1935 году, и необходимым. Сегодня та же теорема, что помогала считать шансы в лондонских кофейнях, определяет, сколько пользователей нужно набрать в A/B-тест, прежде чем катить новую модель ранжирования в прод.


Что мы уже умеем: сумма, её центр и её разброс

Прежде чем формулировать теорему, давай соберём фундамент из предыдущих уроков — без него ЦПТ выглядит магией, а с ним становится почти неизбежной.

Пусть $X_1, X_2, \dots, X_n$ — независимые одинаково распределённые случайные величины (в литературе пишут «н.о.р.», по-английски i.i.d.). У каждой одно и то же математическое ожидание $\mathbb{E}X_i = \mu$ (урок 237) и одна и та же дисперсия $\mathbb{D}X_i = \sigma^2$ (урок 238). Обозначим сумму:

$$S_n = X_1 + X_2 + \dots + X_n$$

Из линейности математического ожидания — а она работает всегда, независимость не нужна:

$$\mathbb{E}S_n = n\mu$$

Из свойства дисперсии суммы независимых величин — а вот здесь независимость критична:

$$\mathbb{D}S_n = n\sigma^2, \qquad \text{откуда} \qquad \sigma(S_n) = \sigma\sqrt n$$

Обрати внимание на асимметрию: центр суммы растёт линейно по $n$, а разброс — только как корень из $n$. Это первое и главное наблюдение всего урока. Если сложить 100 бросков кубика, центр уедет в $350$, а разброс составит всего $\sqrt{100} \cdot 1{,}708 \approx 17{,}1$ — то есть меньше 5% от центра. При 10 000 бросков центр $35\,000$, разброс $\approx 171$ — уже 0,5%. Сумма становится всё более предсказуемой в относительном смысле, хотя её абсолютный разброс растёт.

Выборочное среднее $\overline{X}_n = S_n / n$ ведёт себя зеркально:

$$\mathbb{E}\overline{X}_n = \mu, \qquad \mathbb{D}\overline{X}_n = \frac{\sigma^2}{n}, \qquad \sigma(\overline{X}_n) = \frac{\sigma}{\sqrt n}$$

Величина $\sigma/\sqrt n$ называется стандартной ошибкой среднего (standard error, SE) — запомни её, она будет встречаться в этом уроке раз двадцать.

Определение: Стандартной ошибкой оценки называется стандартное отклонение самой оценки как случайной величины — то есть мера того, насколько сильно оценка «прыгает» от выборки к выборке. Для выборочного среднего $n$ независимых одинаково распределённых величин с дисперсией $\sigma^2$ стандартная ошибка равна $\mathrm{SE} = \sigma/\sqrt n$.

Здесь важно не спутать два разных числа. $\sigma$ — разброс одного объекта: насколько отличаются друг от друга отдельные пользователи, отдельные измерения, отдельные объекты датасета. $\sigma/\sqrt n$ — разброс среднего по выборке: насколько отличались бы твои сводные цифры, если бы ты набрал другую выборку такого же размера. Увеличение выборки не делает людей похожими друг на друга ($\sigma$ не меняется), но делает похожими друг на друга твои отчёты (SE падает).

Но всё это — только два числа: центр и разброс. Они ничего не говорят о форме распределения суммы. Может, оно остаётся таким же кривым, как исходное? Может, у него появляются два горба? Вот на этот вопрос и отвечает ЦПТ, и ответ у неё поразительно категоричный.

Почему это важно. Формула $\sigma/\sqrt n$ — это скелет; ЦПТ надевает на него мясо. Знать только SE недостаточно: чтобы сказать «истинное значение лежит в интервале $\pm 2\,\mathrm{SE}$ с вероятностью 95%», нужно знать, что распределение оценки нормальное. Число 1,96 в формуле доверительного интервала берётся из таблицы нормального распределения — и попадает туда исключительно благодаря ЦПТ.


Формулировка ЦПТ: нормированная сумма

Интуиция: как поймать убегающую цель

Представь, что ты фотографируешь воздушный шар, который поднимается вверх и одновременно раздувается. Если стоять на месте, через минуту шар улетит из кадра — снимка не получится. Чтобы разглядеть форму шара, нужно делать две вещи одновременно: ехать за ним вверх с той же скоростью (иначе он уйдёт из кадра) и отъезжать назад по мере раздувания (иначе он не влезет в кадр).

С суммой $S_n$ ровно та же беда. Её центр $n\mu$ уезжает в бесконечность, её разброс $\sigma\sqrt n$ тоже растёт. Если просто смотреть на $S_n$ при $n \to \infty$, никакого предельного распределения не увидишь — оно расползается по всей прямой и «испаряется». Поэтому мы делаем два движения камеры:

1. Центрируем — вычитаем ожидание: $S_n - n\mu$. Теперь картинка стоит на месте, центр всегда в нуле.

2. Нормируем — делим на стандартное отклонение $\sigma\sqrt n$. Теперь картинка не расползается: разброс всегда равен единице.

Получившаяся величина

$$Z_n = \frac{S_n - n\mu}{\sigma\sqrt n}$$

называется нормированной (стандартизованной) суммой. У неё при любом $n$ ровно два зафиксированных параметра: $\mathbb{E}Z_n = 0$ и $\mathbb{D}Z_n = 1$. Проверим это прямым счётом — это одна строка:

$$\mathbb{E}Z_n = \frac{\mathbb{E}S_n - n\mu}{\sigma\sqrt n} = \frac{n\mu - n\mu}{\sigma\sqrt n} = 0$$$$\mathbb{D}Z_n = \frac{\mathbb{D}(S_n - n\mu)}{(\sigma\sqrt n)^2} = \frac{\mathbb{D}S_n}{\sigma^2 n} = \frac{n\sigma^2}{\sigma^2 n} = 1$$

Центр и разброс мы зафиксировали руками. Всё, что осталось свободным, — это форма. И вот утверждение ЦПТ: форма перестаёт зависеть от того, что мы складывали.

Определение (центральная предельная теорема, вариант Линдеберга–Леви): Пусть $X_1, X_2, \dots$ — последовательность независимых одинаково распределённых случайных величин с конечным математическим ожиданием $\mathbb{E}X_i = \mu$ и конечной ненулевой дисперсией $\mathbb{D}X_i = \sigma^2 \in (0; +\infty)$. Тогда для нормированной суммы

$$Z_n = \frac{X_1 + \dots + X_n - n\mu}{\sigma\sqrt n}$$

при $n \to \infty$ выполняется

$$P(Z_n \le x) \longrightarrow \Phi(x) = \frac{1}{\sqrt{2\pi}}\int_{-\infty}^{x} e^{-t^2/2}\,dt$$

для каждого вещественного $x$. Коротко пишут $Z_n \xrightarrow{d} N(0;1)$ и говорят: нормированная сумма сходится по распределению к стандартному нормальному закону.

Разберём формулировку по деталям — в ней каждое слово рабочее.

«Сходится по распределению» — это не то же самое, что «$Z_n$ становится равным какой-то нормальной величине». Сама величина $Z_n$ никуда не сходится: если сумма — это сумма кубиков, то $Z_n$ навсегда останется дискретной, она принимает конечное число значений и никогда не станет непрерывной. Сходится не величина, а функция распределения: график $P(Z_n \le x)$ всё точнее ложится на график $\Phi(x)$. Дискретная лесенка остаётся лесенкой, но её ступеньки становятся всё мельче и всё ближе к гладкой кривой.

«Для каждого $x$» — сходимость поточечная. На практике это даже сильнее: поскольку предельная функция $\Phi$ непрерывна, сходимость автоматически равномерная по $x$ (теорема Пойа). Это значит, что максимальное расхождение между лесенкой и кривой по всей прямой стремится к нулю — очень удобное свойство, именно оно позволяет оценивать точность одним числом.

«Конечная дисперсия» — единственное существенное условие, и оно не декоративное. Если $\sigma^2 = \infty$, теорема ломается — мы разберём это на распределении Коши в отдельном разделе.

«$\sigma^2 \ne 0$» — вырожденный случай исключён. Если $\sigma = 0$, то все $X_i$ равны константе $\mu$, сумма всегда ровно $n\mu$, и делить на $\sigma\sqrt n = 0$ нельзя.

Чего в формулировке НЕТ — и это самое ценное. Нет ни слова о том, какое распределение у $X_i$. Дискретное, непрерывное, смешанное, симметричное, скошенное, с одним горбом или с шестью — не важно. Нужны только два конечных момента. Это редчайший случай в математике, когда результат настолько универсален.

Эквивалентные записи

Одну и ту же теорему пишут четырьмя способами, и все четыре встретятся тебе в статьях и учебниках. Полезно уметь мгновенно переходить между ними.

Через сумму:

$$\frac{S_n - n\mu}{\sigma\sqrt n} \xrightarrow{d} N(0;1) \qquad \Longleftrightarrow \qquad S_n \approx N(n\mu;\ n\sigma^2)$$

Через среднее — разделим числитель и знаменатель на $n$:

$$\frac{S_n - n\mu}{\sigma\sqrt n} = \frac{S_n/n - \mu}{\sigma\sqrt n / n} = \frac{\overline{X}_n - \mu}{\sigma/\sqrt n}$$$$\frac{\overline{X}_n - \mu}{\sigma/\sqrt n} \xrightarrow{d} N(0;1) \qquad \Longleftrightarrow \qquad \overline{X}_n \approx N\!\left(\mu;\ \frac{\sigma^2}{n}\right)$$

Через отклонение среднего, умноженное на корень:

$$\sqrt n\,(\overline{X}_n - \mu) \xrightarrow{d} N(0;\sigma^2)$$

Через вероятность попадания в интервал — рабочая форма для расчётов:

$$P(a \le S_n \le b) \approx \Phi\!\left(\frac{b - n\mu}{\sigma\sqrt n}\right) - \Phi\!\left(\frac{a - n\mu}{\sigma\sqrt n}\right)$$

Третья запись, $\sqrt n\,(\overline{X}_n - \mu) \xrightarrow{d} N(0;\sigma^2)$, — самая частая в теоретических статьях по ML и статистике. Читать её надо так: отклонение среднего от истинного значения имеет порядок $1/\sqrt n$, и если это отклонение увеличить ровно в $\sqrt n$ раз, получится стабильная картинка с фиксированным разбросом $\sigma$. Множитель $\sqrt n$ — это «микроскоп» нужной кратности: слабее — увидишь точку, сильнее — картинка расползётся.

Примеры с разбором

Пример 1 (простой): сумма 100 бросков кубика

Кубик бросают 100 раз, $S_{100}$ — сумма выпавших очков. Найди приближённое распределение $S_{100}$ и вероятность $P(S_{100} > 380)$.

Решение:

Шаг 1. Характеристики одного броска. Значения $1,\dots,6$ равновероятны:

$$\mu = \frac{1+2+3+4+5+6}{6} = 3{,}5$$$$\mathbb{E}X^2 = \frac{1+4+9+16+25+36}{6} = \frac{91}{6}$$$$\sigma^2 = \frac{91}{6} - 3{,}5^2 = \frac{91}{6} - \frac{49}{4} = \frac{182 - 147}{12} = \frac{35}{12} \approx 2{,}9167$$$$\sigma = \sqrt{35/12} \approx 1{,}7078$$

Шаг 2. Параметры суммы:

$$\mathbb{E}S_{100} = 100 \cdot 3{,}5 = 350, \qquad \mathbb{D}S_{100} = 100 \cdot \frac{35}{12} \approx 291{,}67, \qquad \sigma(S_{100}) \approx 17{,}078$$

Шаг 3. По ЦПТ $S_{100} \approx N(350;\ 291{,}67)$.

Шаг 4. Нормируем границу. С учётом того, что сумма целочисленная, берём поправку на непрерывность (о ней подробно ниже) — граница $380{,}5$:

$$z = \frac{380{,}5 - 350}{17{,}078} = \frac{30{,}5}{17{,}078} \approx 1{,}786$$

Шаг 5. $P(S_{100} > 380) \approx 1 - \Phi(1{,}786) \approx 1 - 0{,}9629 = 0{,}0371$.

Проверим наш ответ: точное значение, посчитанное прямой свёрткой распределений (это 100-кратная свёртка, вручную не сделать, но компьютер справляется мгновенно), равно $0{,}03706$. Приближение дало $0{,}0371$ — совпадение до четвёртого знака.

Ответ: $S_{100} \approx N(350;\ 291{,}67)$, $P(S_{100} > 380) \approx 0{,}037$.


Пример 2 (средний): среднее время ответа сервиса

Время ответа микросервиса — случайная величина с $\mu = 120$ мс и $\sigma = 90$ мс. Распределение сильно скошено вправо (типичная картина для латентности: медиана низкая, хвост длинный). Мы усредняем время по $n = 900$ запросам. В каком интервале окажется среднее с вероятностью 95%?

Решение:

Шаг 1. Форма исходного распределения нас не волнует — ЦПТ её игнорирует. Нужны только $\mu$ и $\sigma$, а они даны. Проверим применимость: дисперсия конечна ($\sigma = 90$ мс — конкретное число), запросы независимы (примем это), $n = 900$ велико. ЦПТ работает.

Шаг 2. Стандартная ошибка среднего:

$$\mathrm{SE} = \frac{\sigma}{\sqrt n} = \frac{90}{\sqrt{900}} = \frac{90}{30} = 3 \text{ мс}$$

Шаг 3. По ЦПТ $\overline{X}_{900} \approx N(120;\ 3^2)$.

Шаг 4. 95%-й интервал для нормальной величины — это $\mu \pm 1{,}96\sigma$:

$$120 \pm 1{,}96 \cdot 3 = 120 \pm 5{,}88$$

Ответ: с вероятностью примерно 95% среднее время ответа по 900 запросам окажется в интервале $(114{,}1;\ 125{,}9)$ мс.

📌 Обрати внимание на масштаб эффекта: отдельный запрос гуляет с разбросом 90 мс, а среднее по 900 запросам — с разбросом 3 мс. Усреднение сжало неопределённость в 30 раз. И это ровно $\sqrt{900} = 30$.


Пример 3 (сложный): сколько объектов нужно в тестовой выборке

Ты замеряешь accuracy модели. Истинная точность где-то около 0,90. Сколько объектов должно быть в тестовой выборке, чтобы 95%-й доверительный интервал был не шире $\pm 1$ процентного пункта?

Решение:

Шаг 1. Смоделируем измерение. Для каждого объекта $i$ введём индикатор $X_i$: единица, если модель угадала, ноль иначе. Это величина Бернулли с параметром $p \approx 0{,}90$. Измеренная accuracy — это в точности выборочное среднее:

$$\widehat{p} = \overline{X}_n = \frac{1}{n}\sum_{i=1}^{n} X_i$$

Шаг 2. Параметры одного индикатора (урок 240): $\mu = p$, $\sigma^2 = p(1-p) = 0{,}9 \cdot 0{,}1 = 0{,}09$, $\sigma = 0{,}3$.

Шаг 3. По ЦПТ:

$$\widehat p \approx N\!\left(p;\ \frac{p(1-p)}{n}\right), \qquad \mathrm{SE} = \sqrt{\frac{0{,}09}{n}} = \frac{0{,}3}{\sqrt n}$$

Шаг 4. Полуширина 95%-го интервала равна $1{,}96 \cdot \mathrm{SE}$. Требуем:

$$1{,}96 \cdot \frac{0{,}3}{\sqrt n} \le 0{,}01$$$$\sqrt n \ge \frac{1{,}96 \cdot 0{,}3}{0{,}01} = 58{,}8$$$$n \ge 58{,}8^2 = 3457{,}4$$

Шаг 5. Округляем вверх до целого: $n = 3458$.

Проверим наш ответ: при $n = 3458$ получаем $\mathrm{SE} = 0{,}3/\sqrt{3458} = 0{,}3/58{,}80 = 0{,}005102$, полуширина $1{,}96 \cdot 0{,}005102 = 0{,}01000$. Ровно на границе. ✅

Ответ: нужно минимум 3458 объектов в тестовой выборке.

📌 Практический вывод, который стоит запомнить навсегда: чтобы сузить доверительный интервал вдвое, выборку нужно увеличить вчетверо. Точность стоит квадратично дорого. Именно поэтому переход от 1000 к 2000 объектов заметно улучшает оценку, а от 100 000 к 200 000 — почти нет: интервал и так узкий, а собирать данные пришлось бы вдвое дольше.

Почему это важно. ЦПТ превращает два скучных числа ($\mu$ и $\sigma$) в полноценное распределение. Без неё, зная только математическое ожидание и дисперсию, ты можешь применить лишь неравенство Чебышёва — а оно даёт чудовищно грубые оценки: «отклонение больше $2\sigma$ имеет вероятность не более 25%». ЦПТ уточняет: не 25%, а 4,55%. Разница в пять с лишним раз, и именно она отделяет практически бесполезную оценку от рабочего инструмента.


ЦПТ и закон больших чисел: две теоремы про одно среднее

Эти две теоремы постоянно путают, а между ними — принципиальная разница. Разберём её сразу, потому что без неё половина смысла ЦПТ теряется. Подробно закон больших чисел мы разберём в следующем уроке (242), здесь нам нужна только его суть и точка расхождения.

Интуиция: куда и как

Представь толпу людей, которая расходится по домам после концерта. Про эту толпу можно задать два разных вопроса.

Первый: куда все идут? Ответ — к метро. Это закон больших чисел: он говорит, к какой точке всё стягивается.

Второй: как именно они там толпятся — насколько широко растекается поток вокруг направления к метро, симметрично или нет, какая доля отклонится на сто метров вправо? Это ЦПТ: она описывает форму облака вокруг предела.

Теперь на языке формул. Закон больших чисел говорит:

$$\overline{X}_n \xrightarrow{P} \mu \qquad \text{при } n \to \infty$$

то есть выборочное среднее сходится по вероятности к истинному математическому ожиданию. Для любого сколь угодно малого $\varepsilon > 0$ вероятность $P(|\overline{X}_n - \mu| > \varepsilon)$ стремится к нулю. Это утверждение о пределе: разброс схлопывается в точку.

Но ЗБЧ ничего не говорит о том, с какой скоростью он схлопывается и какой формы облако по дороге. Ноль есть ноль — ЗБЧ доволен и не уточняет. Причём если посмотреть на $\overline{X}_n - \mu$ при большом $n$, увидишь просто точку в нуле: вся структура «сплющилась» и стала невидимой.

ЦПТ берёт этот схлопнувшийся ноль и растягивает его обратно под микроскопом кратности $\sqrt n$:

$$\sqrt n\,(\overline{X}_n - \mu) \xrightarrow{d} N(0;\sigma^2)$$

Умножая на $\sqrt n$, мы точно компенсируем схлопывание — и вместо точки видим устойчивую колоколообразную картинку. Если бы мы умножили на $n$ (микроскоп сильнее нужного), картинка бы разлетелась в бесконечность. Если бы на $n^{1/4}$ (слабее нужного), всё равно осталась бы точка. Ровно $\sqrt n$ — единственная правильная кратность, и это тоже содержательное утверждение ЦПТ.

Сравнение: ЗБЧ отвечает на вопрос «куда сходится среднее?» — ответ: к $\mu$. ЦПТ отвечает на вопрос «как именно оно колеблется вокруг $\mu$ по дороге?» — ответ: отклонение имеет порядок $\sigma/\sqrt n$ и приближённо нормальную форму. ЗБЧ — теорема о пределе, ЦПТ — теорема о скорости и форме приближения к этому пределу.

Полезная мнемоника: ЗБЧ — это «есть куда», ЦПТ — это «вот как быстро и вот какой формы». Из ЦПТ, кстати, ЗБЧ следует как побочный вывод: если $\overline{X}_n - \mu$ имеет порядок $\sigma/\sqrt n \to 0$, то среднее обязано сходиться к $\mu$. Обратное неверно — ЗБЧ выполняется и в ситуациях, где ЦПТ не работает (например, при бесконечной дисперсии, но конечном математическом ожидании).

Пример 4 (средний): почему без ЦПТ нельзя строить интервалы

Пусть $\mu$ неизвестно, $\sigma = 20$, мы усреднили $n = 400$ наблюдений и получили $\overline{X} = 53{,}2$. Что мы можем сказать о $\mu$, опираясь только на ЗБЧ, и что — опираясь на ЦПТ?

Решение:

Шаг 1. Только ЗБЧ. Он говорит: при росте $n$ среднее приближается к $\mu$. Для конкретного $n = 400$ он не даёт никакой количественной оценки — только обещание в пределе. Единственное, что можно выжать без ЦПТ, — неравенство Чебышёва:

$$P(|\overline{X} - \mu| \ge k \cdot \mathrm{SE}) \le \frac{1}{k^2}$$

Шаг 2. Считаем стандартную ошибку: $\mathrm{SE} = 20/\sqrt{400} = 20/20 = 1$.

Шаг 3. Чтобы гарантировать вероятность ошибки не выше 5%, по Чебышёву нужно $1/k^2 \le 0{,}05$, то есть $k \ge \sqrt{20} \approx 4{,}47$. Интервал: $53{,}2 \pm 4{,}47$, то есть $(48{,}7;\ 57{,}7)$ — ширина 8,9.

Шаг 4. С ЦПТ. Распределение $\overline{X}$ приближённо нормально, значит нужное $k$ берётся из таблицы нормального закона: $k = 1{,}96$. Интервал: $53{,}2 \pm 1{,}96$, то есть $(51{,}24;\ 55{,}16)$ — ширина 3,92.

Ответ: ЗБЧ + Чебышёв дают интервал шириной 8,9; ЦПТ даёт интервал шириной 3,92 — в 2,28 раза уже при том же объёме данных.

📌 Читай это так: ЦПТ «бесплатно» экономит тебе примерно в 5 раз больше данных. Чтобы получить чебышёвским методом такую же ширину, как у ЦПТ, пришлось бы взять $n$ в $(4{,}47/1{,}96)^2 \approx 5{,}2$ раза больше — то есть 2080 наблюдений вместо 400.


Численная демонстрация: как рождается колокол

Пора посмотреть на теорему глазами. Всё, что ниже, посчитано точной свёрткой распределений (никакого моделирования Монте-Карло, только арифметика с дробями), так что цифрам можно верить до последнего знака.

Опыт 1: суммы бросков кубика

Один бросок кубика — это идеально плоское распределение: все шесть значений по $1/6$. Ни малейшего намёка на колокол. Смотрим, что происходит при сложении.

$n = 1$ — полная равномерность:

Сумма 1 2 3 4 5 6
$P$ 0,1667 0,1667 0,1667 0,1667 0,1667 0,1667

$n = 2$ — уже треугольник, за один шаг:

Сумма 2 3 4 5 6 7 8 9 10 11 12
$P$ 0,0278 0,0556 0,0833 0,1111 0,1389 0,1667 0,1389 0,1111 0,0833 0,0556 0,0278

$n = 3$ — треугольник уже сглажен в колокол, у него появились «плечи»:

Сумма 3 4 5 6 7 8 9 10 11 12 ...
$P$ точно 0,0046 0,0139 0,0278 0,0463 0,0694 0,0972 0,1157 0,1250 0,1250 0,1157 симметрично
Норм. прибл. 0,0056 0,0123 0,0242 0,0427 0,0671 0,0942 0,1182 0,1323 0,1323 0,1182

Уже при трёх кубиках нормальное приближение попадает с ошибкой в пару процентов в центральной зоне. При $n = 5$:

Сумма 12 13 14 15 16 17 18 19 20
$P$ точно 0,0392 0,0540 0,0694 0,0837 0,0945 0,1003 0,1003 0,0945 0,0837
Норм. прибл. 0,0371 0,0522 0,0686 0,0842 0,0965 0,1033 0,1033 0,0965 0,0842
Ошибка −5,3% −3,3% −1,2% +0,6% +2,1% +3,0% +3,0% +2,1% +0,6%

А теперь измерим сходимость одним числом. Возьмём максимальное расхождение функций распределения (расстояние Колмогорова) между точным распределением нормированной суммы и стандартным нормальным:

$n$ кубиков 1 2 3 5 10 20 30
Макс. расхождение 0,0542 0,0164 0,0098 0,0054 0,0026 0,0013 0,0009

Смотри, какая красивая картина. Уже при $n = 2$ расхождение падает до 1,6%, при $n = 5$ — до полпроцента, при $n = 30$ — меньше одной десятой процента. И заметь: числа убывают примерно пропорционально $1/\sqrt n$ (от $n=10$ к $n=30$ — втрое больше $n$, расхождение упало примерно в $\sqrt 3 \approx 1{,}73$ раза: $0{,}0026 \to 0{,}0009$, это в 2,9 раза; чуть быстрее теоретической оценки, потому что распределение кубика симметрично — а симметрия ускоряет сходимость).

Опыт 2: суммы равномерных величин

Теперь непрерывный случай. Пусть $X_i \sim U(0;1)$ — равномерное на отрезке от 0 до 1, у него $\mu = 1/2$ и $\sigma^2 = 1/12$. Плотность — прямоугольник, никакого колокола. Сложим $n$ штук и стандартизуем; полученную плотность сравним с плотностью $\varphi(z) = \frac{1}{\sqrt{2\pi}}e^{-z^2/2}$.

$z$ 0 0,5 1,0 1,5 2,0 2,5
$n = 1$ 0,2887 0,2887 0,2887 0,2887 0 0
$n = 2$ 0,4082 0,3249 0,2416 0,1582 0,0749 0
$n = 3$ 0,3750 0,3438 0,2500 0,1406 0,0625 0,0156
$n = 4$ 0,3849 0,3437 0,2480 0,1394 0,0581 0,0166
$n = 6$ 0,3889 0,3472 0,2459 0,1358 0,0567 0,0167
$n = 12$ 0,3939 0,3497 0,2440 0,1326 0,0552 0,0172
$\varphi(z)$ 0,3989 0,3521 0,2420 0,1295 0,0540 0,0175

Прочитаем таблицу. При $n=1$ плотность — плоская крышка, обрывающаяся в ноль (правый хвост физически отсутствует: сумма одной равномерной не может уйти дальше $\sqrt 3 \approx 1{,}73$ стандартных отклонений). При $n=2$ — треугольник Симпсона, уже с наклоном. При $n=3$ ошибка в центре около 6%, при $n=4$ — 3,5%, при $n=12$ — 1,3%.

Сходимость в центре отличная почти сразу. А вот в хвостах она принципиально медленнее: сумма $n$ равномерных не выходит за $\pm\sqrt{3n}$ стандартных отклонений (при $n=12$ это $\pm 6$), тогда как у настоящего нормального хвост бесконечен. Это общее правило: ЦПТ хороша в центре и осторожна на далёких хвостах. Считать по нормальному приближению вероятности порядка $10^{-6}$ — плохая идея.

📌 Кстати, строка $n = 12$ — не случайная. Сумма двенадцати равномерных величин минус 6 (её $\mu = 6$, $\sigma^2 = 12/12 = 1$, так что нормировать не нужно вовсе) десятилетиями использовалась как быстрый генератор нормальных чисел в компьютерах: двенадцать сложений вместо логарифмов и синусов. Метод и сегодня встречается в старом коде под именем «сумма 12 равномерных».

Опыт 3: суммы Бернулли — где симметрия важна

Самый поучительный опыт. Величина Бернулли принимает только 0 и 1 — дальше от колокола некуда. Но здесь есть параметр $p$, и он управляет скоростью сходимости.

Симметричный случай $p = 0{,}5$ (честная монета). Сравним точную биномиальную вероятность и нормальное приближение с поправкой на непрерывность.

При $n = 10$ ($\mu = 5$, $\sigma \approx 1{,}5811$):

$k$ 2 3 4 5 6 7 8
Точно 0,0439 0,1172 0,2051 0,2461 0,2051 0,1172 0,0439
Прибл. 0,0435 0,1145 0,2045 0,2482 0,2045 0,1145 0,0435
Ошибка −1,0% −2,3% −0,3% +0,8% −0,3% −2,3% −1,0%

Десять бросков монеты — и точность уже около процента. При $n = 30$ ошибка в центральной зоне падает до 0,2–0,8%.

Скошенный случай $p = 0{,}1$ — та же арифметика, совсем другой результат:

$n$ 5 10 30 100 300 1000
Макс. расхождение 0,0905 0,0496 0,0309 0,0175 0,0102 0,0056
Асимметрия $\gamma_1$ 1,193 0,843 0,487 0,267 0,154 0,084

Сравни с кубиком: там при $n=10$ расхождение было 0,0026, здесь при $n=10$ — 0,0496, в девятнадцать раз хуже. И при $n = 1000$ скошенная монетка ещё не догнала точность, которую кубик показывал уже при $n = 3$.

Причина в асимметрии. Для суммы $n$ независимых одинаково распределённых величин коэффициент асимметрии равен $\gamma_1(S_n) = \gamma_1(X)/\sqrt n$: он гасится, но только как корень. У кубика $\gamma_1(X) = 0$ — асимметрии нет с самого начала, и гасить нечего. У Бернулли с $p = 0{,}1$ имеем

$$\gamma_1(X) = \frac{1 - 2p}{\sqrt{p(1-p)}} = \frac{0{,}8}{0{,}3} \approx 2{,}67$$

и на её подавление уходят сотни наблюдений.

Практическое правило (правило «десяти успехов»): нормальное приближение биномиального распределения считают приемлемым, если $np \ge 10$ и $n(1-p) \ge 10$. Более мягкая (и более рискованная) версия требует $np \ge 5$ и $n(1-p) \ge 5$. Оба условия проверяют одно и то же: чтобы колокол «поместился» между границами $0$ и $n$, не упираясь в них.

Проверим правило на цифрах выше. При $n = 30$, $p = 0{,}1$: $np = 3 < 10$ — правило запрещает, и действительно ошибка 3% плюс промахи в отдельных точках до 17%. При $n = 100$, $p = 0{,}1$: $np = 10$ — ровно на границе, ошибка 1,75%, терпимо. При $n = 300$: $np = 30$ — с запасом, ошибка 1%. Правило работает.

Почему это важно. Три опыта дают тебе интуицию, которую невозможно получить из формулы: скорость сходимости определяется не $n$ самим по себе, а произведением «$n$ на симметричность исходного распределения». Для симметричных величин достаточно $n \approx 5{-}10$. Для умеренно скошенных — $n \approx 30$ (отсюда легендарное «правило тридцати» из учебников). Для сильно скошенных — сотни и тысячи. Прежде чем применять ЦПТ к своим данным, посмотри на гистограмму: если она похожа на распределение доходов или длительностей сессий с длинным правым хвостом, тридцати наблюдений точно не хватит.


Теорема Муавра–Лапласа и поправка на непрерывность

Частный случай, с которого всё началось

Схема Бернулли (урок 233) — это ровно та ситуация, где ЦПТ применяется чаще всего: $n$ независимых испытаний, в каждом успех с вероятностью $p$, считаем общее число успехов $K_n$. Но $K_n$ — это и есть сумма индикаторов:

$$K_n = X_1 + \dots + X_n, \qquad X_i = \begin{cases} 1, & \text{успех} \\ 0, & \text{неудача} \end{cases}$$

Для индикатора $\mu = p$ и $\sigma^2 = p(1-p)$ (проверь: $\mathbb{E}X = 0\cdot(1-p) + 1\cdot p = p$; $\mathbb{E}X^2 = p$, значит $\sigma^2 = p - p^2 = p(1-p)$). Подставляем в ЦПТ и получаем историческую теорему.

Определение (интегральная теорема Муавра–Лапласа): Пусть $K_n$ — число успехов в $n$ испытаниях Бернулли с вероятностью успеха $p \in (0;1)$. Тогда

$$\frac{K_n - np}{\sqrt{np(1-p)}} \xrightarrow{d} N(0;1),$$

то есть для любых $a < b$

$$P(a \le K_n \le b) \approx \Phi\!\left(\frac{b - np}{\sqrt{np(1-p)}}\right) - \Phi\!\left(\frac{a - np}{\sqrt{np(1-p)}}\right).$$

Есть и локальная версия — для вероятности ровно $k$ успехов:

$$P(K_n = k) \approx \frac{1}{\sqrt{np(1-p)}}\,\varphi\!\left(\frac{k - np}{\sqrt{np(1-p)}}\right), \qquad \varphi(z) = \frac{1}{\sqrt{2\pi}}e^{-z^2/2}$$

Логика локальной формулы простая: вероятность точки заменяется на площадь полоски единичной ширины под кривой плотности, а площадь тонкой полоски ≈ высота × ширина = $f(k) \cdot 1$.

Поправка на непрерывность

Вот тонкость, которая отделяет аккуратный расчёт от небрежного. Мы приближаем дискретную величину (число успехов — целое) непрерывной (нормальной). У дискретной величины вероятность сосредоточена в точках $0, 1, 2, \dots$; у непрерывной — размазана по прямой. При переводе одного в другое надо решить: какой кусок прямой «принадлежит» целому числу $k$?

Ответ естественный: отрезок $[k - 0{,}5;\ k + 0{,}5]$. Каждое целое забирает себе полосу шириной 1, центрированную в нём. Отсюда правило.

Определение (поправка на непрерывность): При замене дискретного целочисленного распределения непрерывным каждую границу сдвигают на $0{,}5$ наружу от включаемого множества значений:

  • $P(K \le k) \approx \Phi\!\left(\dfrac{k + 0{,}5 - \mu}{\sigma}\right)$
  • $P(K < k) = P(K \le k-1) \approx \Phi\!\left(\dfrac{k - 0{,}5 - \mu}{\sigma}\right)$
  • $P(K \ge k) \approx 1 - \Phi\!\left(\dfrac{k - 0{,}5 - \mu}{\sigma}\right)$
  • $P(K > k) \approx 1 - \Phi\!\left(\dfrac{k + 0{,}5 - \mu}{\sigma}\right)$
  • $P(a \le K \le b) \approx \Phi\!\left(\dfrac{b + 0{,}5 - \mu}{\sigma}\right) - \Phi\!\left(\dfrac{a - 0{,}5 - \mu}{\sigma}\right)$
  • $P(K = k) \approx \Phi\!\left(\dfrac{k + 0{,}5 - \mu}{\sigma}\right) - \Phi\!\left(\dfrac{k - 0{,}5 - \mu}{\sigma}\right)$

Мнемоника: границы всегда раздвигаются, если значение включено ($\le$, $\ge$, $=$), и сжимаются, если исключено ($<$, $>$). Проверяй себя вопросом: «попадает ли целое число $k$ внутрь моего отрезка?»

Примеры с разбором

Пример 5 (простой): монета, 100 бросков

Найди $P(45 \le K \le 55)$ для честной монеты, брошенной 100 раз, — та самая задача де Муавра.

Решение:

Шаг 1. Параметры: $np = 100 \cdot 0{,}5 = 50$; $\sigma = \sqrt{100 \cdot 0{,}5 \cdot 0{,}5} = \sqrt{25} = 5$.

Шаг 2. Проверяем применимость: $np = 50 \ge 10$, $n(1-p) = 50 \ge 10$ ✅.

Шаг 3. Границы с поправкой: обе включены, значит раздвигаем — от $44{,}5$ до $55{,}5$.

Шаг 4. Нормируем:

$$z_1 = \frac{44{,}5 - 50}{5} = -1{,}1, \qquad z_2 = \frac{55{,}5 - 50}{5} = 1{,}1$$

Шаг 5. $P \approx \Phi(1{,}1) - \Phi(-1{,}1) = 2\Phi(1{,}1) - 1 = 2 \cdot 0{,}86433 - 1 = 0{,}72866$.

Проверим наш ответ: точная сумма одиннадцати биномиальных слагаемых равна $0{,}728747$. Расхождение — восемь стотысячных! А без поправки на непрерывность получилось бы $2\Phi(1) - 1 = 0{,}6827$ — ошибка в 4,6 процентных пункта, в пятьсот раз больше.

Ответ: $P(45 \le K \le 55) \approx 0{,}7287$.


Пример 6 (средний): вероятность ровно 126 очков на 36 кубиках

Бросают 36 кубиков. Найди $P(S = 126)$.

Решение:

Шаг 1. $\mu = 36 \cdot 3{,}5 = 126$ (задан ровно центр), $\sigma^2 = 36 \cdot \frac{35}{12} = 105$, $\sigma = \sqrt{105} \approx 10{,}247$.

Шаг 2. Точка — используем формулу для $P(K=k)$ через две границы:

$$P(S = 126) \approx \Phi\!\left(\frac{126{,}5 - 126}{10{,}247}\right) - \Phi\!\left(\frac{125{,}5 - 126}{10{,}247}\right) = \Phi(0{,}0488) - \Phi(-0{,}0488)$$

Шаг 3. $= 2\Phi(0{,}0488) - 1 = 2 \cdot 0{,}51946 - 1 = 0{,}03892$.

Проверим наш ответ: точное значение (свёртка 36 распределений) равно $0{,}038761$. Ошибка $+0{,}4\%$. ✅

Ответ: $P(S = 126) \approx 0{,}0389$.

📌 Сравни: локальная формула через плотность дала бы $\frac{1}{10{,}247}\varphi(0) = \frac{0{,}39894}{10{,}247} = 0{,}03893$ — практически то же самое. Для узкой полоски высота × ширина и точная площадь почти совпадают. Разница между двумя подходами становится заметной только далеко в хвостах, где плотность быстро меняется.


Пример 7 (сложный): контроль качества разметки

Асессоры размечают датасет. Доля ошибочных меток в среднем $p = 0{,}03$. Ты берёшь на перепроверку $n = 1000$ объектов. Найди вероятность того, что ошибочных меток окажется больше 40. И скажи, надёжен ли ответ.

Решение:

Шаг 1. Параметры: $\mu = 1000 \cdot 0{,}03 = 30$; $\sigma^2 = 1000 \cdot 0{,}03 \cdot 0{,}97 = 29{,}1$; $\sigma = \sqrt{29{,}1} \approx 5{,}394$.

Шаг 2. Проверяем условие: $np = 30 \ge 10$ ✅, $n(1-p) = 970 \ge 10$ ✅. Формально можно. Но асимметрия исходной величины велика: $\gamma_1(X) = \frac{1 - 0{,}06}{\sqrt{0{,}0291}} = \frac{0{,}94}{0{,}1706} \approx 5{,}51$, значит у суммы $\gamma_1(S) = 5{,}51/\sqrt{1000} \approx 0{,}174$ — заметный правый перекос остаётся. Держим это в уме.

Шаг 3. Строгое «больше 40» — значит $K \ge 41$, граница сжимается к $40{,}5$:

$$z = \frac{40{,}5 - 30}{5{,}394} = \frac{10{,}5}{5{,}394} \approx 1{,}9466$$

Шаг 4. $P(K > 40) \approx 1 - \Phi(1{,}9466) \approx 1 - 0{,}9742 = 0{,}0258$.

Шаг 5. Оценка надёжности. Мы залезли почти на $2\sigma$ вправо — в зону, где ЦПТ уже не идеальна, а остаточная асимметрия $+0{,}174$ означает, что реальный правый хвост тяжелее нормального. То есть истинная вероятность должна быть чуть больше нашей оценки. Точное биномиальное вычисление даёт $0{,}03022$ — и действительно, приближение занизило ответ примерно на 15% относительной величины.

Ответ: $P \approx 0{,}026$ по нормальному приближению; точное значение $0{,}0302$; для хвостовых вероятностей при скошенном исходном распределении лучше считать точно или брать пуассоновское приближение.

📌 Универсальное правило: в центре доверяй ЦПТ, в хвостах проверяй. Относительная ошибка приближения растёт по мере удаления от центра — там, где сама вероятность маленькая, промах в полтора раза — обычное дело.

Почему это важно. Поправка на непрерывность стоит одну строчку кода и часто даёт улучшение точности на порядок — особенно при небольших $n$ и узких интервалах. В задаче про монету она уменьшила ошибку в 500 раз. Забыть про неё — самая частая ошибка в расчётах по схеме Бернулли, и чем меньше интервал, тем страшнее последствия: для $P(K = k)$ без поправки ты получишь ноль (площадь под кривой над точкой равна нулю), то есть полную бессмыслицу.


Практика: 30 заданий

Базовые (задания 1-10)

Задание 1: Случайные величины $X_1, \dots, X_{25}$ независимы и одинаково распределены, $\mathbb{E}X_i = 4$, $\sigma = 3$. Найди $\mathbb{E}S_{25}$, $\mathbb{D}S_{25}$, $\sigma(S_{25})$ и стандартную ошибку выборочного среднего.


Задание 2: Разброс одного измерения $\sigma = 12$. Сколько измерений нужно усреднить, чтобы стандартная ошибка среднего не превышала $0{,}5$?


Задание 3: Кубик бросают 300 раз. Каким приближённым распределением описывается сумма выпавших очков?


Задание 4: Сумма $S_{64}$ составлена из 64 независимых величин с $\mu = 10$ и $\sigma = 2$. Нормируй значение $S_{64} = 660$, то есть найди соответствующее $z$.


Задание 5: Время ответа сервиса имеет $\sigma = 40$ мс. Мы усредняем по $n = 100$ запросам. С какой вероятностью среднее отклонится от истинного $\mu$ меньше чем на 8 мс?


Задание 6: Модель с истинной точностью $p = 0{,}8$ проверяется на тесте из 400 объектов. Найди стандартную ошибку измеренной accuracy и полуширину 95%-го доверительного интервала.


Задание 7: Ты оцениваешь величину методом Монте-Карло. Во сколько раз нужно увеличить число прогонов, чтобы стандартная ошибка упала втрое?


Задание 8: У исходной величины коэффициент асимметрии $\gamma_1(X) = 1{,}5$. Чему равна асимметрия суммы 100 таких независимых величин? Хватит ли $n = 100$ для нормального приближения?


Задание 9: Можно ли применить нормальное приближение к числу успехов при $n = 200$, $p = 0{,}04$? Что делать, если нельзя?


Задание 10: Честная монета брошена 100 раз. Найди $P(K \le 60)$ по нормальному приближению с поправкой на непрерывность.


Средние (задания 11-20)

Задание 11: Монету бросают 400 раз. Найди вероятность того, что число орлов окажется в пределах от 190 до 210 включительно.


Задание 12: Складывают 50 независимых величин, равномерно распределённых на $[0;1]$. Найди $P(S_{50} > 27)$.


Задание 13: Латентность сервиса имеет $\sigma = 50$ мс. Сколько запросов нужно замерить, чтобы 95%-й доверительный интервал для средней латентности был не шире $\pm 2$ мс?


Задание 14: Оцени вероятность отклонения среднего более чем на $3\,\mathrm{SE}$ двумя способами: по неравенству Чебышёва и по ЦПТ. Во сколько раз они различаются?


Задание 15: Градиент лосса по одному объекту имеет по каждой компоненте стандартное отклонение $\sigma = 0{,}6$. Какой шум у усреднённого градиента при batch size 256? Во сколько раз нужно увеличить батч, чтобы шум упал вдвое?


Задание 16: В сервисе 10 000 запросов, каждый падает с вероятностью $0{,}002$ независимо. Оцени $P(K \ge 30)$ по нормальному приближению и объясни, в какую сторону оно ошибается.


Задание 17: На тесте из 1000 объектов модель показала accuracy $0{,}87$. Построй 95%-й доверительный интервал. Можно ли утверждать, что истинная точность выше $0{,}85$?


Задание 18: Кубик бросают 100 раз. Найди такое целое $c$, что вероятность превысить его суммой очков составляет около 1%.


Задание 19: Время до отказа узла распределено экспоненциально со средним 50 часов (у экспоненциального распределения $\sigma = \mu$). Наблюдали 200 независимых отказов. Найди $P(\overline X > 55)$ и оцени, врёт ли приближение.


Задание 20: Две группы пользователей по 100 человек. В контроле среднее время на сайте $\overline X = 48$ мин, в тесте $\overline Y = 53$ мин. Известно, что в обеих группах $\sigma = 15$ мин. Значима ли разница в 5 минут?


Продвинутые (задания 21-30)

Задание 21: Выведи коэффициент инициализации He. Нейрон линейного слоя считает $z = \sum_{i=1}^{n_{\text{in}}} w_i x_i$, веса независимы, $\mathbb{E}w_i = 0$, $\mathbb{D}w_i = \sigma_w^2$, входы независимы от весов. Покажи, почему $z$ приближённо нормально, и найди $\sigma_w$, при котором дисперсия сигнала не меняется от слоя к слою в сети с ReLU. Посчитай для $n_{\text{in}} = 512$.


Задание 22: Выведи «правило линейного масштабирования» learning rate. Шаг SGD равен $\Delta\theta = -\eta\, g_B$, где $g_B$ — усреднённый градиент по батчу размера $B$, а разброс градиента по одному объекту равен $\sigma$. Покажи, что для сохранения суммарного шума за эпоху нужно $\eta \propto B$. Какой $\eta$ взять при $B = 1024$, если при $B = 256$ работал $\eta = 0{,}1$?


Задание 23: Базовая конверсия в сервисе $4\%$. Нужно уметь ловить прирост от 4,0% до 4,4% (то есть $\Delta = 0{,}4$ п.п.) при уровне значимости $5\%$ и мощности $80\%$. Сколько пользователей нужно в каждую группу?


Задание 24: Величины $X_i$ имеют распределение Коши с плотностью $f(x) = \dfrac{1}{\pi(1+x^2)}$. Известно, что среднее $\overline X_n$ таких величин снова имеет ровно то же распределение Коши при любом $n$. Посчитай $P(|\overline X_n| > 2)$ для $n = 1$, $n = 100$ и $n = 10^6$. Объясни, почему ЦПТ здесь бессильна, и что это значит для ML.


Задание 25: Лосс на одном объекте имеет $\mu = 0{,}35$, $\sigma = 0{,}5$ и сильную правую асимметрию $\gamma_1 = 3$ (редкие «тяжёлые» примеры дают огромный лосс). Батч $B = 64$. Найди вероятность того, что средний лосс батча превысит $0{,}45$, и оцени, насколько ответу можно верить.


Задание 26: Accuracy модели от запуска к запуску (разные random seed) гуляет со стандартным отклонением $\sigma = 0{,}004$. Ты хочешь доказать, что новая архитектура лучше старой на $0{,}003$ (0,3 п.п.). Сколько сидов нужно прогнать для каждой модели?


Задание 27: В слое 2048 нейронов, dropout выключает каждый независимо с вероятностью $0{,}5$. Найди вероятность того, что активных нейронов окажется не более 990. Насколько сильно вообще гуляет число активных нейронов?


Задание 28: Ты оцениваешь accuracy детектора по 900 кадрам, взятым из 90 видео (по 10 кадров с каждого). Наблюдённая accuracy $0{,}90$. Внутри одного видео кадры скоррелированы, коэффициент корреляции ошибок $\rho = 0{,}5$. Посчитай наивный доверительный интервал и правильный.


Задание 29: Число $\pi$ оценивают методом Монте-Карло: бросают точки в квадрат $[-1;1]^2$ и считают долю попавших в вписанный круг. Оценка $\widehat\pi = 4\widehat p$. Сколько точек нужно, чтобы 95%-й интервал для $\pi$ был не шире $\pm 0{,}001$?


Задание 30: Слой с $n_{\text{in}} = 4096$ входами, веса инициализированы по He: $\sigma_w = \sqrt{2/4096} \approx 0{,}0221$. Веса квантуют в int8 по каналу: диапазон $\pm 4\sigma_w$ разбивается на 255 уровней. Входы имеют среднеквадратичное значение 1. Оцени, какую ошибку квантование вносит в выход нейрона, и какую долю от полезного сигнала она составляет.


Частые ошибки

Ошибка 1: путать разброс объекта $\sigma$ и разброс среднего $\sigma/\sqrt n$

Неправильно: «Средняя зарплата в выборке из 10 000 человек равна 95 тысяч, стандартное отклонение 40 тысяч, значит доверительный интервал для средней зарплаты — от 15 до 175 тысяч».

Правильно: 40 тысяч — это разброс между людьми, он никуда не денется, сколько людей ни опрашивай. Интервал для среднего строится по стандартной ошибке:

$$\mathrm{SE} = \frac{40\,000}{\sqrt{10\,000}} = 400 \text{ рублей}$$

Интервал: $95\,000 \pm 1{,}96 \cdot 400 = (94\,216;\ 95\,784)$.

Почему важно: ошибка в 200 раз по ширине интервала. Это, пожалуй, самая частая путаница в прикладной статистике вообще. Мнемоника: $\sigma$ отвечает на вопрос «насколько разные объекты?», $\sigma/\sqrt n$ — на вопрос «насколько разными были бы мои отчёты, набери я другую выборку?». Это два разных вопроса, и большие данные помогают только со вторым.


Ошибка 2: применять ЦПТ к зависимым наблюдениям

Неправильно: «У нас 50 000 кликов от 800 пользователей, значит $n = 50\,000$ и $\mathrm{SE} = \sigma/\sqrt{50\,000}$».

Правильно: клики одного пользователя зависимы — один активный человек может дать сотню кликов, и все они «про него», а не про популяцию. Считать надо по независимым единицам: агрегируй метрику внутри пользователя, а потом усредняй 800 пользовательских чисел. Стандартная ошибка вырастет примерно в $\sqrt{50\,000/800} = 7{,}9$ раза.

Почему важно: дисперсия суммы равна $n\sigma^2$ только для независимых слагаемых; при положительной корреляции появляются ковариационные члены, и настоящая дисперсия больше. Все доверительные интервалы, посчитанные без учёта этого, оказываются обманчиво узкими — и ты «находишь» эффекты, которых нет. Правило: единица анализа = единица независимости.


Ошибка 3: забывать поправку на непрерывность для целочисленных величин

Неправильно: «$n = 100$, $p = 0{,}5$, $P(K = 50) \approx$ площадь под нормальной кривой в точке 50 $= 0$».

Правильно: дискретному значению соответствует полоса $[49{,}5;\ 50{,}5]$:

$$P(K = 50) \approx \Phi\!\left(\frac{50{,}5 - 50}{5}\right) - \Phi\!\left(\frac{49{,}5 - 50}{5}\right) = 2\Phi(0{,}1) - 1 = 0{,}0797$$

(точное биномиальное значение $0{,}0796$).

Почему важно: без поправки в точечном случае получается буквально ноль — полная бессмыслица, а на узких интервалах ошибка легко достигает нескольких процентных пунктов. И зеркальная ошибка: применять поправку к непрерывной величине. Если складываешь времена отклика или равномерные величины, никаких $\pm 0{,}5$ добавлять не надо — они появляются только там, где значения целые.


Ошибка 4: считать, что «$n \ge 30$» всегда достаточно

Неправильно: «У нас 40 наблюдений, значит по правилу тридцати ЦПТ работает, строим нормальный доверительный интервал».

Правильно: правило тридцати выведено для умеренно симметричных распределений. Если исходная величина сильно скошена — доход, длительность сессии, размер заказа, лосс на объекте, — сорока наблюдений может не хватить катастрофически. Проверяй асимметрию: остаточный перекос среднего равен $\gamma_1(X)/\sqrt n$, и он должен быть примерно $\le 0{,}2$. При $\gamma_1(X) = 3$ это требует $n \ge 225$, при $\gamma_1(X) = 6$ — уже $n \ge 900$.

Почему важно: в уроке мы видели это на числах: для симметричного кубика приближение точное уже при $n = 3$, а для Бернулли с $p = 0{,}1$ даже при $n = 1000$ расхождение больше, чем у кубика при $n = 3$. «Тридцать» — это не закон природы, а грубая эвристика для приличных распределений.


Ошибка 5: доверять ЦПТ в далёких хвостах

Неправильно: «Нормальное приближение даёт $P = 3\cdot10^{-7}$, значит такое событие практически невозможно, инцидент был не случайностью, а багом».

Правильно: ЦПТ приближает центр распределения, а относительная точность в хвостах падает. Если исходная величина скошена или ограничена, реальная вероятность может отличаться в разы и на порядки. Для хвостовых вероятностей нужны либо точные вычисления, либо специальные инструменты (приближение Пуассона для редких событий, неравенства Чернова, теория больших уклонений).

Почему важно: мы видели это в примере 7 урока: на $2\sigma$ вправо нормальное приближение уже занизило вероятность на 15% относительной величины. На $4\sigma$ промах может быть в разы. Решения вида «увольняем/откатываем, потому что вероятность $10^{-7}$» слишком дороги, чтобы строить их на приближении, которое в этой зоне не гарантирует ничего.


Ошибка 6: складывать стандартные ошибки вместо дисперсий

Неправильно: «SE первой группы $1{,}5$, второй $1{,}5$, значит SE разности $= 3$».

Правильно: складываются дисперсии независимых величин, а не стандартные отклонения:

$$\mathrm{SE}_{\text{разн}} = \sqrt{1{,}5^2 + 1{,}5^2} = \sqrt{4{,}5} \approx 2{,}12$$

Почему важно: ошибка в $\sqrt 2 \approx 1{,}41$ раза — и она всегда в консервативную сторону, то есть ты будешь пропускать реальные эффекты. Полезная памятка: при сложении $k$ одинаковых независимых источников шума общий разброс растёт как $\sqrt k$, а не как $k$. Тот же корень, что и в $\sigma/\sqrt n$ — это одна и та же математика.


Ошибка 7: применять ЦПТ там, где дисперсия бесконечна

Неправильно: «Отношение двух метрик усредним по 10 000 запусков, по ЦПТ среднее будет нормальным».

Правильно: если знаменатель может оказаться близко к нулю, у отношения тяжёлые хвосты вплоть до коши-подобных, и дисперсия бесконечна. Тогда усреднение не сужает разброс вообще: как мы посчитали в задании 24, для распределения Коши $P(|\overline X_n| > 2) \approx 0{,}295$ и при $n = 1$, и при $n = 10^6$.

Почему важно: нарушение единственного существенного условия ЦПТ ломает её полностью, а не «немножко». В реальном ML это встречается в метриках-отношениях, в шуме градиента у трансформеров, в доходах на пользователя. Лечится не увеличением выборки, а сменой оценки: медиана, усечённое среднее, логарифм величины, клиппинг.


Главное запомнить

📝 Ключевые понятия

Центральная предельная теорема: для независимых одинаково распределённых $X_i$ с $\mathbb{E}X_i = \mu$ и конечной $\mathbb{D}X_i = \sigma^2 \in (0;\infty)$ нормированная сумма сходится по распределению к стандартному нормальному:

$$Z_n = \frac{X_1 + \dots + X_n - n\mu}{\sigma\sqrt n} \xrightarrow{d} N(0;1)$$

Форма исходного распределения не имеет значения — нужны только два конечных момента.

Центр и разброс суммы: $\mathbb{E}S_n = n\mu$ растёт линейно, а $\sigma(S_n) = \sigma\sqrt n$ — только как корень. Отсюда вся практическая польза: относительная неопределённость суммы падает как $1/\sqrt n$.

Стандартная ошибка среднего: $\mathrm{SE} = \sigma/\sqrt n$ — разброс не объектов, а самой оценки от выборки к выборке. Главная формула прикладной статистики: доверительные интервалы, размер A/B-теста, шум минибатчевого градиента — всё отсюда.

Четыре эквивалентные записи ЦПТ: $S_n \approx N(n\mu;\,n\sigma^2)$; $\overline X_n \approx N(\mu;\,\sigma^2/n)$; $\sqrt n(\overline X_n - \mu) \xrightarrow{d} N(0;\sigma^2)$; $P(a \le S_n \le b) \approx \Phi\!\big(\frac{b-n\mu}{\sigma\sqrt n}\big) - \Phi\!\big(\frac{a-n\mu}{\sigma\sqrt n}\big)$. Все четыре про одно и то же, множитель $\sqrt n$ — «микроскоп» правильной кратности.

ЦПТ против ЗБЧ: закон больших чисел отвечает «куда сходится среднее» — к $\mu$. ЦПТ отвечает «как быстро и какой формы облако вокруг предела» — порядок $\sigma/\sqrt n$, форма нормальная. ЗБЧ даёт предел, ЦПТ — скорость и форму.

Правило квадратичной цены точности: сузить доверительный интервал в $k$ раз — значит увеличить выборку в $k^2$ раз. Вдвое точнее = вчетверо дороже. Это ограничение фундаментальное и обойти его нельзя, можно только уменьшить $\sigma$.

Скорость сходимости определяется асимметрией: $\gamma_1(S_n) = \gamma_1(X)/\sqrt n$. Для симметричных величин хватает $n \approx 5{-}10$, для умеренно скошенных — $n \approx 30$, для сильно скошенных — сотни и тысячи. Ориентир: остаточная асимметрия должна быть $\lesssim 0{,}2$.

Теорема Муавра–Лапласа — частный случай ЦПТ для схемы Бернулли: $\frac{K_n - np}{\sqrt{np(1-p)}} \xrightarrow{d} N(0;1)$ при условии $np \ge 10$ и $n(1-p) \ge 10$. Отсюда формула $\mathrm{SE} = \sqrt{p(1-p)/n}$ для accuracy, конверсии и любой доли.

Поправка на непрерывность: при переходе от целочисленной величины к нормальной каждую границу сдвигают на $0{,}5$ — наружу для включённых значений ($\le, \ge, =$), внутрь для исключённых ($<, >$). Даёт улучшение точности на порядок и больше; для непрерывных величин не применяется.

Когда ЦПТ не работает: бесконечная дисперсия (распределение Коши, отношения величин, степенные хвосты), зависимые слагаемые (кадры одного видео, клики одного пользователя, соседние запросы), малое $n$ при сильной асимметрии, а также далёкие хвосты — там приближение теряет относительную точность даже при большом $n$.


Связь с другими темами курса

Что нужно было знать до этого урока. ЦПТ стоит ровно на том фундаменте, который мы строили последние восемь уроков. Из урока 237 нужна линейность математического ожидания: она даёт $\mathbb{E}S_n = n\mu$ и работает даже для зависимых величин. Из урока 238 — дисперсия суммы независимых величин $\mathbb{D}S_n = n\sigma^2$, закон $\sigma/\sqrt n$ и стандартизация $Z = (X-\mu)/\sigma$: нормированная сумма из ЦПТ — это в точности стандартизованная $S_n$. Оттуда же неравенство Чебышёва, с которым мы сравнивали ЦПТ и увидели разницу в 40 раз. Из урока 239 — коэффициент асимметрии $\gamma_1$, который управляет скоростью сходимости, и распределение Коши как пример величины без моментов. Из урока 240 — нормальное распределение $N(\mu;\sigma^2)$, функция $\Phi(x)$, правила сигм и биномиальное распределение, которое ЦПТ и приближает в теореме Муавра–Лапласа. Наконец, из урока 233 — сама схема Бернулли: там мы пользовались теоремами Муавра–Лапласа как готовым рецептом, а теперь увидели, откуда они берутся.

Что изучить дальше. Следующий урок 242 — закон больших чисел. Мы уже наметили границу между ним и ЦПТ: ЗБЧ говорит, что среднее сходится к $\mu$, ЦПТ — с какой скоростью и какой формы облако. В 242 мы разберём ЗБЧ строго, увидим слабую и усиленную версии, теорему Бернулли для частот и поймём, почему обучение моделей на конечной выборке вообще имеет смысл. Дальше по курсу ЦПТ становится рабочим инструментом: доверительные интервалы и проверка гипотез — это ЦПТ плюс арифметика; бутстрэп — способ получить распределение оценки, когда аналитическую формулу для $\sigma$ выписать невозможно; t-распределение появится там, где $\sigma$ приходится оценивать по той же выборке и малому $n$ уже не хватает нормального приближения. А многомерная версия ЦПТ лежит под всей теорией асимптотической нормальности оценок максимального правдоподобия — то есть под доверительными интервалами для коэффициентов почти любой модели.

Где это нужно в жизни.

💻 В программировании. Оценка производительности: среднее время выполнения по $n$ прогонам имеет разброс $\sigma/\sqrt n$, и без этого бенчмарки превращаются в гадание — «стало на 3% быстрее» при разбросе 5% не значит ничего. Нагрузочное тестирование и планирование мощностей: суммарная нагрузка от многих независимых пользователей нормальна, значит запас по мощности считается в сигмах. Мониторинг: контрольные границы $\pm 3\sigma$ для метрик сервиса, оценка числа ошибок в логах, расчёт SLA. Хеш-таблицы и балансировщики: заполненность корзин — сумма независимых попаданий, и ЦПТ говорит, какой перекос считать нормальным, а какой — признаком плохой хеш-функции.

🤖 В ML/AI. Доверительные интервалы для accuracy, precision, recall и любой метрики-доли. Расчёт размера тестовой выборки и A/B-теста. Инициализация Xavier и He — прямое следствие того, что предактивация есть сумма многих слагаемых и потому нормальна. Шум минибатчевого градиента $\sigma/\sqrt B$ и правило линейного масштабирования learning rate. Батч-нормализация, которая стандартизует именно потому, что распределение активаций близко к нормальному. Dropout как схема Бернулли на широком слое. Ошибка квантования весов, которая суммируется по входам и оказывается нормальной. Ансамблирование: усреднение $k$ независимых моделей снижает дисперсию предсказания в $\sqrt k$ раз — это буквально ЦПТ, применённая к предсказаниям.

📊 В Data Science. Всё, что связано с выборками: опросы, оценка долей, стандартные ошибки в отчётах, бутстрэп-интервалы для любой статистики, сравнение сегментов, поправка на дизайн-эффект при кластерных выборках. Прогнозирование агрегатов: выручка за месяц — сумма многих независимых покупок, значит она нормальна, и интервал прогноза считается за одну строку. Обнаружение аномалий: «сколько сигм» — это язык, который работает только благодаря ЦПТ.

🔬 В науке. Теория ошибок измерений: погрешность прибора складывается из множества мелких независимых источников, поэтому она нормальна — именно так Гаусс пришёл к своей кривой, работая с астрономическими наблюдениями. Метод наименьших квадратов и все его доверительные интервалы. В физике: броуновское движение — сумма огромного числа независимых толчков молекул, отсюда нормальное распределение смещения и $\sqrt t$ в диффузии. В биологии: количественные признаки (рост, вес, урожайность) — суммарный эффект многих генов и факторов среды, поэтому колоколообразны. В медицине: клинические испытания, размер группы, значимость эффекта препарата.


Интересные факты

💡 ЦПТ появилась как способ не считать факториалы вручную — де Муавр в 1733 году искал не «главный закон природы», а обходной путь вокруг $C_{100}^{50} \approx 1{,}0089\cdot10^{29}$. Он разослал открытие друзьям частным памфлетом на латыни и не стал публиковать в журнале. Универсальность своего результата он так и не осознал: для него это остался трюк для монетки. Сто лет спустя ту же кривую независимо переоткрыл Гаусс, вычисляя орбиту астероида Цереры, — и с тех пор она носит его имя, а не имя де Муавра.

💡 Слово «центральная» означает не то, что все думают. Джордж Пойа, придумавший термин в 1920 году, имел в виду «центральная по важности для теории вероятностей», а вовсе не «про центр распределения». То есть правильно читать название как «главная предельная теорема». Ирония в том, что по-английски Central Limit Theorem можно разобрать и как «теорема о центральном пределе», и путаница живёт уже сто лет.

💡 Генератор нормальных чисел из двенадцати равномерных. Десятилетиями в вычислительных библиотеках стоял приём: сложить 12 случайных чисел из $[0;1]$ и вычесть 6. У такой суммы $\mu = 6$ и $\sigma^2 = 12/12 = 1$, то есть результат сразу стандартизован — нормировать не надо вовсе. Двенадцать сложений вместо логарифмов и синусов метода Бокса–Мюллера. Метод честно даёт нормальность в центре, но обрывается на $\pm 6\sigma$ — за этой границей у него ровно ноль вероятности, тогда как у настоящего нормального хвост бесконечен. Для симуляции редких событий такой генератор давал систематически заниженные риски.

💡 Финансовый кризис 2008 года частично вырос из злоупотребления ЦПТ. Модели оценки рисков ипотечных облигаций предполагали, что потери по портфелю — сумма многих независимых дефолтов, а значит нормальны. Оба допущения оказались неверными: дефолты сильно коррелируют (все заёмщики живут в одной экономике), а распределение потерь имеет тяжёлый хвост. Вероятности, посчитанные как «десять сигм, раз в миллиард лет», реализовались за пару месяцев. Это, возможно, самый дорогой в истории урок на тему «проверяй независимость и конечность дисперсии».

💡 Гальтонова доска — физическая модель ЦПТ, которую можно потрогать. Фрэнсис Гальтон в 1873 году построил доску с рядами штырьков: шарик падает сверху и на каждом штырьке случайно отклоняется влево или вправо. Итоговое смещение — сумма независимых отклонений, и шарики закономерно укладываются в колокол внизу. Гальтон использовал её как наглядный аргумент в спорах о наследственности; сегодня такие доски стоят в научных музеях по всему миру, и каждая из них — работающая иллюстрация теоремы Муавра–Лапласа.


Лайфхаки и полезные трюки

1. Первый вопрос всегда: «что здесь складывается?»

ЦПТ применима ровно тогда, когда интересующая тебя величина — сумма или среднее многих независимых слагаемых. Прежде чем искать формулы, найди слагаемые и убедись, что их много и они независимы. Если слагаемых не видно — ЦПТ, скорее всего, не при чём.

Пример: accuracy = среднее индикаторов «угадал/не угадал» → сумма есть, ЦПТ работает. Максимум лосса по батчу → это не сумма, а максимум, и у него совсем другая предельная теория (теория экстремальных значений, распределения Гумбеля и Фреше).

2. Прикидка «сколько сигм» за десять секунд.

Прежде чем открывать таблицу нормального распределения, посчитай, на сколько стандартных ошибок отстоит наблюдённое значение от ожидаемого. Дальше работают три числа, которые стоит помнить наизусть: $1\sigma \to 32\%$, $2\sigma \to 4{,}6\%$, $3\sigma \to 0{,}27\%$ (это двусторонние вероятности отклонения).

Пример: метрика упала с 0,74 до 0,72 при $\mathrm{SE} = 0{,}015$. Отклонение $0{,}02/0{,}015 = 1{,}33\sigma$ — то есть примерно 18% шансов получить такое или большее падение чисто случайно. Никакого инцидента нет, идём дальше.

3. Правило «вчетверо за вдвое».

Точность стоит квадратично: чтобы улучшить её вдвое, нужно вчетверо больше данных. Держи это в голове при планировании любого измерения — оно мгновенно отвечает на вопрос «а если добавим ещё немного данных?».

Пример: тест на 1000 объектов даёт интервал $\pm 2$ п.п. Хочешь $\pm 0{,}5$ п.п. — это в 4 раза уже, значит нужно в 16 раз больше объектов: 16 000. Если разметка стоит 20 рублей за объект, вопрос «а стоит ли» получает конкретный ценник в 320 тысяч.

4. Для доли — сразу $\sqrt{p(1-p)/n}$, и худший случай при $p = 0{,}5$.

Для accuracy, конверсии, CTR и любой другой доли стандартная ошибка считается без всякой выборочной дисперсии — прямо из $p$. А максимум $p(1-p) = 0{,}25$ достигается при $p = 0{,}5$, поэтому консервативная оценка сверху всегда $\mathrm{SE} \le 0{,}5/\sqrt n$.

Пример: «сколько нужно объектов, чтобы интервал был не шире $\pm 3$ п.п. при любом $p$?» Берём худший случай: $1{,}96 \cdot 0{,}5/\sqrt n \le 0{,}03 \Rightarrow \sqrt n \ge 32{,}67 \Rightarrow n \ge 1068$. Это и есть знаменитая «выборка в тысячу человек с погрешностью 3%», которую ты видел в каждом социологическом опросе.

5. Считай асимметрию, а не полагайся на правило тридцати.

Возьми выборочный коэффициент асимметрии своих данных, раздели на $\sqrt n$ и посмотри на результат. Если получилось меньше $0{,}2$ — нормальному приближению можно верить в центральной зоне. Если больше — либо увеличивай $n$, либо переходи к бутстрэпу.

Пример: данные о длительности сессий, $\gamma_1 = 4{,}5$, выборка $n = 200$. Остаточная асимметрия $4{,}5/\sqrt{200} = 0{,}32$ — многовато. Нужное $n$ находим из $4{,}5/\sqrt n \le 0{,}2$: $\sqrt n \ge 22{,}5$, то есть $n \ge 507$. Либо логарифмируй величину — логарифм длительностей обычно почти симметричен, и тогда двухсот наблюдений хватит с запасом.

6. Когда формулы для $\sigma$ нет — бери бутстрэп.

ЦПТ даёт готовую формулу только для средних и долей. Для медианы, для 95-го перцентиля латентности, для AUC, для отношения двух метрик аналитической формулы либо нет, либо она страшная. Рецепт: пересемплируй выборку с возвращением $B$ раз (обычно $B = 1000$), посчитай статистику на каждой копии и возьми перцентили полученного распределения — это и есть доверительный интервал.

Пример: нужен интервал для медианной латентности по 5000 замерам. Делаешь 1000 бутстрэп-выборок по 5000 элементов, считаешь 1000 медиан, берёшь их 2,5-й и 97,5-й перцентили. Десять строк кода вместо вывода асимптотики.

7. Единица анализа = единица независимости.

Перед любым расчётом стандартной ошибки спроси: что здесь по-настоящему независимо? Кадры одного видео — нет. Клики одного пользователя — нет. Запросы из одной минуты — скорее всего нет. Агрегируй метрику до уровня независимых единиц и считай $n$ по ним.

Пример: 50 000 предсказаний по 200 пациентам. Правильное $n$ — не 50 000, а 200. Стандартная ошибка вырастет в $\sqrt{250} \approx 15{,}8$ раза, и половина «значимых» находок из отчёта растворится. Лучше узнать это до публикации, чем после.

8. Проверяй хвосты симуляцией, а не верой.

Если ответ зависит от вероятности редкого события, не доверяй нормальному приближению — прогони симуляцию. Сгенерируй миллион сумм по $n$ слагаемых из своего распределения и посмотри эмпирическую долю превышений. Это пять строк кода и полная защита от того класса ошибок, где приближение промахивается в разы.

Пример: «какова вероятность, что суммарная нагрузка превысит ёмкость кластера?» Ответ $10^{-5}$ по нормальному приближению может на деле оказаться $10^{-3}$ — стократная разница, а решение о закупке железа принимается именно по этому числу.


Заключение

Смотри, что мы получили из одной теоремы. Универсальное объяснение, почему колокол встречается везде: почти всё, что мы измеряем, — это сумма многих мелких независимых вкладов, а сумма стирает форму слагаемых и оставляет только два числа. Формулу $\sigma/\sqrt n$, которая превращает «мы что-то измерили» в «мы измерили это с такой-то точностью». Расчёт размера A/B-теста, доверительный интервал для accuracy, объяснение шума в SGD, вывод коэффициентов инициализации He и Xavier, оценку ошибки квантования. Всё это — одна теорема, применённая семь раз.

И самое ценное, что стоит унести из урока, — это даже не формулы, а два вопроса, которые ты теперь задаёшь автоматически. Первый: что здесь складывается и правда ли слагаемые независимы? Второй: какова стандартная ошибка того числа, на которое я смотрю? Первый вопрос ловит подавляющее большинство ошибок в анализе данных — от кадров видео, выданных за независимые наблюдения, до моделей ипотечных рисков, обрушивших рынок в 2008-м. Второй превращает любую метрику из точки в интервал, и это сразу меняет разговор: «наша модель лучше на 1,2 п.п.» и «наша модель лучше на $1{,}2 \pm 2{,}4$ п.п.» — утверждения разного качества, и второе честнее.

Ты научился отличать сигнал от шума количественно, а не на глаз. В индустрии это редкий навык: формулу $\sigma/\sqrt n$ помнят все, но проверяют независимость наблюдений и считают асимметрию единицы — а именно там и живут дорогие ошибки.

В следующем уроке (242) мы возьмём вторую половину той же истории — закон больших чисел. ЦПТ рассказала, как среднее колеблется вокруг $\mu$; ЗБЧ докажет, что оно туда действительно приходит, причём в двух версиях — слабой и усиленной. Заодно закроется вопрос, ради которого всю теорию вероятностей когда-то и затевали: почему наблюдаемая частота события сходится к его вероятности, и почему обучение моделей на конечной выборке вообще имеет смысл.

💡 Совет: возьми любые свои данные — логи латентности, метрики моделей, что угодно — и посчитай для них две вещи: стандартную ошибку среднего и остаточную асимметрию $\gamma_1/\sqrt n$. Пять минут работы, а результат часто отрезвляет: половина «улучшений», которые ты фиксировал в экспериментах, окажется внутри одной стандартной ошибки. Это не повод расстраиваться — это повод начать измерять по-взрослому. Именно с этого места случайные наблюдения превращаются в доказательства.

Увидимся в уроке 242 — закон больших чисел ждёт. 🚀

Понял тему? Закрепи в боте! 🚀

Попрактикуйся на задачах и получи персональные рекомендации от AI

💪 Начать тренировку
💬 Есть вопрос? Спроси бота!