Центральная предельная теорема 🔔
Ты обучил классификатор, прогнал его на отложенной выборке из 500 объектов и получил accuracy 0,912. Коллега обучил свою модель, прогнал на той же выборке и получил 0,924. Он торжествует: его модель лучше на 1,2 процентных пункта. А ты смотришь на эти цифры и понимаешь, что не знаешь главного — это реальная разница или просто повезло с тем, какие 500 объектов попали в тест?
Ответить на такой вопрос без единой формулы невозможно. Но стоит достать один инструмент — и ответ занимает три строки. Стандартная ошибка accuracy на выборке из 500 объектов при уровне около 0,92 равна примерно $\sqrt{0{,}92 \cdot 0{,}08 / 500} \approx 0{,}012$. То есть разброс самой метрики от выборки к выборке — как раз порядка 1,2 процентных пункта. Разница коллеги укладывается ровно в одну стандартную ошибку, то есть это шум, а не победа. Инструмент, который позволил это сказать, называется центральная предельная теорема — ЦПТ.
ЦПТ — это, пожалуй, самое удивительное утверждение во всей теории вероятностей. Она говорит: возьми какие угодно независимые одинаково распределённые случайные величины — лишь бы у них была конечная дисперсия. Не важно, дискретные они или непрерывные, симметричные или перекошенные, ограниченные или уходящие в бесконечность. Сложи их. И при большом числе слагаемых распределение суммы, если её правильно отцентрировать и отмасштабировать, будет всё ближе и ближе к одной-единственной кривой — стандартному нормальному распределению. Форма исходных величин полностью стирается. Остаются только два числа: математическое ожидание и дисперсия.
Именно поэтому нормальное распределение из урока 240 встречается везде — от роста людей до шума в градиентах нейросети. Не потому что природа его любит, а потому что почти всё, что мы измеряем, есть сумма множества мелких независимых вкладов. В этом уроке мы разберём точную формулировку ЦПТ, увидим на числах, как быстро колокол вырастает из кубика и монетки, узнаем, при каких условиях теорема ломается (спойлер: распределение Коши убивает её начисто), и вытащим из неё практический инструментарий дата-сайентиста: стандартную ошибку метрики, размер выборки для A/B-теста, объяснение шума в SGD и формулы инициализации Xavier и He.
🎯 Ты узнаешь:
- Точную формулировку ЦПТ для нормированной суммы $\frac{\sum X_i - n\mu}{\sigma\sqrt n}$ и что именно в ней «стремится»
- Почему стандартное отклонение выборочного среднего равно $\sigma/\sqrt n$ и почему это самая полезная формула в прикладной статистике
- Чем ЦПТ отличается от закона больших чисел: один говорит куда сходится среднее, другая — как оно колеблется вокруг предела
- Как выглядит сходимость на числах: суммы кубиков, равномерных величин и бросков Бернулли в таблицах
- Когда ЦПТ не работает — распределение Коши, зависимые слагаемые, малое $n$ при сильной асимметрии — и что делать вместо неё
- Откуда в ML берутся доверительные интервалы для accuracy, расчёт размера A/B-теста и коэффициенты $\sqrt{2/n_{\text{in}}}$ в инициализации He
История: откуда это взялось?
Всё началось с азартных игр и очень скучной арифметики. В 1733 году французский математик Абрахам де Муавр, живший в Лондоне и зарабатывавший консультациями для игроков и страховщиков, столкнулся с вычислительным кошмаром. Чтобы найти вероятность выпадения от 45 до 55 орлов в 100 бросках монеты, нужно было сложить одиннадцать биномиальных коэффициентов, каждый из которых — гигантское число вроде $C_{100}^{50} \approx 1{,}0089 \cdot 10^{29}$. В эпоху расчётов пером это было невыполнимо.
Де Муавр нашёл обходной путь. В работе «Approximatio ad Summam Terminorum Binomii $(a+b)^n$ in Seriem expansi», разосланной друзьям в виде частного памфлета в ноябре 1733 года, он показал: биномиальные вероятности при большом $n$ ложатся на гладкую кривую вида $e^{-x^2}$, и сумму можно заменить площадью под этой кривой. Это была первая в истории формулировка того, что сегодня называют теоремой Муавра–Лапласа — частным случаем ЦПТ для схемы Бернулли. Любопытно, что де Муавр не понял всей общности своего открытия: для него это был вычислительный трюк для монетки, а не универсальный закон природы.
Обобщил идею Пьер-Симон Лаплас. В «Аналитической теории вероятностей» (1812) он распространил приближение на произвольное $p$, а не только на $p = 1/2$, и — что важнее — начал догадываться, что колоколообразная кривая появляется при суммировании чего угодно, а не только исходов монетки. Практическая мотивация была астрономическая в буквальном смысле: наблюдатели измеряли положения планет, каждое измерение содержало ошибку, и вопрос «как ведёт себя среднее из ста измерений» стоил очень дорого. Параллельно Карл Фридрих Гаусс в 1809 году, работая над орбитой Цереры, вывел ту же кривую из принципа наименьших квадратов — отсюда «распределение Гаусса».
Строгое доказательство в общем виде появилось только через сто лет, и заметная часть работы была сделана в России. Пафнутий Чебышёв в 1887 году предложил метод моментов и сформулировал теорему, Андрей Марков залатал дыры в доказательстве, а Александр Ляпунов в 1901 году дал первое по-настоящему строгое доказательство при условии, которое сегодня носит его имя, — и вдобавок ввёл метод характеристических функций, ставший стандартным инструментом. Само название «центральная предельная теорема» придумал Джордж Пойа в 1920 году: слово «центральная» у него означало не «про центр распределения», а «центральная по значимости для теории вероятностей». Окончательную точку поставил Яарл Линдеберг (1922), нашедший условие, которое оказалось не только достаточным, но, как показал Вильям Феллер в 1935 году, и необходимым. Сегодня та же теорема, что помогала считать шансы в лондонских кофейнях, определяет, сколько пользователей нужно набрать в A/B-тест, прежде чем катить новую модель ранжирования в прод.
Что мы уже умеем: сумма, её центр и её разброс
Прежде чем формулировать теорему, давай соберём фундамент из предыдущих уроков — без него ЦПТ выглядит магией, а с ним становится почти неизбежной.
Пусть $X_1, X_2, \dots, X_n$ — независимые одинаково распределённые случайные величины (в литературе пишут «н.о.р.», по-английски i.i.d.). У каждой одно и то же математическое ожидание $\mathbb{E}X_i = \mu$ (урок 237) и одна и та же дисперсия $\mathbb{D}X_i = \sigma^2$ (урок 238). Обозначим сумму:
$$S_n = X_1 + X_2 + \dots + X_n$$Из линейности математического ожидания — а она работает всегда, независимость не нужна:
$$\mathbb{E}S_n = n\mu$$Из свойства дисперсии суммы независимых величин — а вот здесь независимость критична:
$$\mathbb{D}S_n = n\sigma^2, \qquad \text{откуда} \qquad \sigma(S_n) = \sigma\sqrt n$$Обрати внимание на асимметрию: центр суммы растёт линейно по $n$, а разброс — только как корень из $n$. Это первое и главное наблюдение всего урока. Если сложить 100 бросков кубика, центр уедет в $350$, а разброс составит всего $\sqrt{100} \cdot 1{,}708 \approx 17{,}1$ — то есть меньше 5% от центра. При 10 000 бросков центр $35\,000$, разброс $\approx 171$ — уже 0,5%. Сумма становится всё более предсказуемой в относительном смысле, хотя её абсолютный разброс растёт.
Выборочное среднее $\overline{X}_n = S_n / n$ ведёт себя зеркально:
$$\mathbb{E}\overline{X}_n = \mu, \qquad \mathbb{D}\overline{X}_n = \frac{\sigma^2}{n}, \qquad \sigma(\overline{X}_n) = \frac{\sigma}{\sqrt n}$$Величина $\sigma/\sqrt n$ называется стандартной ошибкой среднего (standard error, SE) — запомни её, она будет встречаться в этом уроке раз двадцать.
Определение: Стандартной ошибкой оценки называется стандартное отклонение самой оценки как случайной величины — то есть мера того, насколько сильно оценка «прыгает» от выборки к выборке. Для выборочного среднего $n$ независимых одинаково распределённых величин с дисперсией $\sigma^2$ стандартная ошибка равна $\mathrm{SE} = \sigma/\sqrt n$.
Здесь важно не спутать два разных числа. $\sigma$ — разброс одного объекта: насколько отличаются друг от друга отдельные пользователи, отдельные измерения, отдельные объекты датасета. $\sigma/\sqrt n$ — разброс среднего по выборке: насколько отличались бы твои сводные цифры, если бы ты набрал другую выборку такого же размера. Увеличение выборки не делает людей похожими друг на друга ($\sigma$ не меняется), но делает похожими друг на друга твои отчёты (SE падает).
Но всё это — только два числа: центр и разброс. Они ничего не говорят о форме распределения суммы. Может, оно остаётся таким же кривым, как исходное? Может, у него появляются два горба? Вот на этот вопрос и отвечает ЦПТ, и ответ у неё поразительно категоричный.
Почему это важно. Формула $\sigma/\sqrt n$ — это скелет; ЦПТ надевает на него мясо. Знать только SE недостаточно: чтобы сказать «истинное значение лежит в интервале $\pm 2\,\mathrm{SE}$ с вероятностью 95%», нужно знать, что распределение оценки нормальное. Число 1,96 в формуле доверительного интервала берётся из таблицы нормального распределения — и попадает туда исключительно благодаря ЦПТ.
Формулировка ЦПТ: нормированная сумма
Интуиция: как поймать убегающую цель
Представь, что ты фотографируешь воздушный шар, который поднимается вверх и одновременно раздувается. Если стоять на месте, через минуту шар улетит из кадра — снимка не получится. Чтобы разглядеть форму шара, нужно делать две вещи одновременно: ехать за ним вверх с той же скоростью (иначе он уйдёт из кадра) и отъезжать назад по мере раздувания (иначе он не влезет в кадр).
С суммой $S_n$ ровно та же беда. Её центр $n\mu$ уезжает в бесконечность, её разброс $\sigma\sqrt n$ тоже растёт. Если просто смотреть на $S_n$ при $n \to \infty$, никакого предельного распределения не увидишь — оно расползается по всей прямой и «испаряется». Поэтому мы делаем два движения камеры:
1. Центрируем — вычитаем ожидание: $S_n - n\mu$. Теперь картинка стоит на месте, центр всегда в нуле.
2. Нормируем — делим на стандартное отклонение $\sigma\sqrt n$. Теперь картинка не расползается: разброс всегда равен единице.
Получившаяся величина
$$Z_n = \frac{S_n - n\mu}{\sigma\sqrt n}$$называется нормированной (стандартизованной) суммой. У неё при любом $n$ ровно два зафиксированных параметра: $\mathbb{E}Z_n = 0$ и $\mathbb{D}Z_n = 1$. Проверим это прямым счётом — это одна строка:
$$\mathbb{E}Z_n = \frac{\mathbb{E}S_n - n\mu}{\sigma\sqrt n} = \frac{n\mu - n\mu}{\sigma\sqrt n} = 0$$$$\mathbb{D}Z_n = \frac{\mathbb{D}(S_n - n\mu)}{(\sigma\sqrt n)^2} = \frac{\mathbb{D}S_n}{\sigma^2 n} = \frac{n\sigma^2}{\sigma^2 n} = 1$$Центр и разброс мы зафиксировали руками. Всё, что осталось свободным, — это форма. И вот утверждение ЦПТ: форма перестаёт зависеть от того, что мы складывали.
Определение (центральная предельная теорема, вариант Линдеберга–Леви): Пусть $X_1, X_2, \dots$ — последовательность независимых одинаково распределённых случайных величин с конечным математическим ожиданием $\mathbb{E}X_i = \mu$ и конечной ненулевой дисперсией $\mathbb{D}X_i = \sigma^2 \in (0; +\infty)$. Тогда для нормированной суммы
$$Z_n = \frac{X_1 + \dots + X_n - n\mu}{\sigma\sqrt n}$$при $n \to \infty$ выполняется
$$P(Z_n \le x) \longrightarrow \Phi(x) = \frac{1}{\sqrt{2\pi}}\int_{-\infty}^{x} e^{-t^2/2}\,dt$$для каждого вещественного $x$. Коротко пишут $Z_n \xrightarrow{d} N(0;1)$ и говорят: нормированная сумма сходится по распределению к стандартному нормальному закону.
Разберём формулировку по деталям — в ней каждое слово рабочее.
«Сходится по распределению» — это не то же самое, что «$Z_n$ становится равным какой-то нормальной величине». Сама величина $Z_n$ никуда не сходится: если сумма — это сумма кубиков, то $Z_n$ навсегда останется дискретной, она принимает конечное число значений и никогда не станет непрерывной. Сходится не величина, а функция распределения: график $P(Z_n \le x)$ всё точнее ложится на график $\Phi(x)$. Дискретная лесенка остаётся лесенкой, но её ступеньки становятся всё мельче и всё ближе к гладкой кривой.
«Для каждого $x$» — сходимость поточечная. На практике это даже сильнее: поскольку предельная функция $\Phi$ непрерывна, сходимость автоматически равномерная по $x$ (теорема Пойа). Это значит, что максимальное расхождение между лесенкой и кривой по всей прямой стремится к нулю — очень удобное свойство, именно оно позволяет оценивать точность одним числом.
«Конечная дисперсия» — единственное существенное условие, и оно не декоративное. Если $\sigma^2 = \infty$, теорема ломается — мы разберём это на распределении Коши в отдельном разделе.
«$\sigma^2 \ne 0$» — вырожденный случай исключён. Если $\sigma = 0$, то все $X_i$ равны константе $\mu$, сумма всегда ровно $n\mu$, и делить на $\sigma\sqrt n = 0$ нельзя.
Чего в формулировке НЕТ — и это самое ценное. Нет ни слова о том, какое распределение у $X_i$. Дискретное, непрерывное, смешанное, симметричное, скошенное, с одним горбом или с шестью — не важно. Нужны только два конечных момента. Это редчайший случай в математике, когда результат настолько универсален.
Эквивалентные записи
Одну и ту же теорему пишут четырьмя способами, и все четыре встретятся тебе в статьях и учебниках. Полезно уметь мгновенно переходить между ними.
Через сумму:
$$\frac{S_n - n\mu}{\sigma\sqrt n} \xrightarrow{d} N(0;1) \qquad \Longleftrightarrow \qquad S_n \approx N(n\mu;\ n\sigma^2)$$Через среднее — разделим числитель и знаменатель на $n$:
$$\frac{S_n - n\mu}{\sigma\sqrt n} = \frac{S_n/n - \mu}{\sigma\sqrt n / n} = \frac{\overline{X}_n - \mu}{\sigma/\sqrt n}$$$$\frac{\overline{X}_n - \mu}{\sigma/\sqrt n} \xrightarrow{d} N(0;1) \qquad \Longleftrightarrow \qquad \overline{X}_n \approx N\!\left(\mu;\ \frac{\sigma^2}{n}\right)$$Через отклонение среднего, умноженное на корень:
$$\sqrt n\,(\overline{X}_n - \mu) \xrightarrow{d} N(0;\sigma^2)$$Через вероятность попадания в интервал — рабочая форма для расчётов:
$$P(a \le S_n \le b) \approx \Phi\!\left(\frac{b - n\mu}{\sigma\sqrt n}\right) - \Phi\!\left(\frac{a - n\mu}{\sigma\sqrt n}\right)$$Третья запись, $\sqrt n\,(\overline{X}_n - \mu) \xrightarrow{d} N(0;\sigma^2)$, — самая частая в теоретических статьях по ML и статистике. Читать её надо так: отклонение среднего от истинного значения имеет порядок $1/\sqrt n$, и если это отклонение увеличить ровно в $\sqrt n$ раз, получится стабильная картинка с фиксированным разбросом $\sigma$. Множитель $\sqrt n$ — это «микроскоп» нужной кратности: слабее — увидишь точку, сильнее — картинка расползётся.
Примеры с разбором
Пример 1 (простой): сумма 100 бросков кубика
Кубик бросают 100 раз, $S_{100}$ — сумма выпавших очков. Найди приближённое распределение $S_{100}$ и вероятность $P(S_{100} > 380)$.
Решение:
Шаг 1. Характеристики одного броска. Значения $1,\dots,6$ равновероятны:
$$\mu = \frac{1+2+3+4+5+6}{6} = 3{,}5$$$$\mathbb{E}X^2 = \frac{1+4+9+16+25+36}{6} = \frac{91}{6}$$$$\sigma^2 = \frac{91}{6} - 3{,}5^2 = \frac{91}{6} - \frac{49}{4} = \frac{182 - 147}{12} = \frac{35}{12} \approx 2{,}9167$$$$\sigma = \sqrt{35/12} \approx 1{,}7078$$Шаг 2. Параметры суммы:
$$\mathbb{E}S_{100} = 100 \cdot 3{,}5 = 350, \qquad \mathbb{D}S_{100} = 100 \cdot \frac{35}{12} \approx 291{,}67, \qquad \sigma(S_{100}) \approx 17{,}078$$Шаг 3. По ЦПТ $S_{100} \approx N(350;\ 291{,}67)$.
Шаг 4. Нормируем границу. С учётом того, что сумма целочисленная, берём поправку на непрерывность (о ней подробно ниже) — граница $380{,}5$:
$$z = \frac{380{,}5 - 350}{17{,}078} = \frac{30{,}5}{17{,}078} \approx 1{,}786$$Шаг 5. $P(S_{100} > 380) \approx 1 - \Phi(1{,}786) \approx 1 - 0{,}9629 = 0{,}0371$.
Проверим наш ответ: точное значение, посчитанное прямой свёрткой распределений (это 100-кратная свёртка, вручную не сделать, но компьютер справляется мгновенно), равно $0{,}03706$. Приближение дало $0{,}0371$ — совпадение до четвёртого знака.
Ответ: $S_{100} \approx N(350;\ 291{,}67)$, $P(S_{100} > 380) \approx 0{,}037$.
Пример 2 (средний): среднее время ответа сервиса
Время ответа микросервиса — случайная величина с $\mu = 120$ мс и $\sigma = 90$ мс. Распределение сильно скошено вправо (типичная картина для латентности: медиана низкая, хвост длинный). Мы усредняем время по $n = 900$ запросам. В каком интервале окажется среднее с вероятностью 95%?
Решение:
Шаг 1. Форма исходного распределения нас не волнует — ЦПТ её игнорирует. Нужны только $\mu$ и $\sigma$, а они даны. Проверим применимость: дисперсия конечна ($\sigma = 90$ мс — конкретное число), запросы независимы (примем это), $n = 900$ велико. ЦПТ работает.
Шаг 2. Стандартная ошибка среднего:
$$\mathrm{SE} = \frac{\sigma}{\sqrt n} = \frac{90}{\sqrt{900}} = \frac{90}{30} = 3 \text{ мс}$$Шаг 3. По ЦПТ $\overline{X}_{900} \approx N(120;\ 3^2)$.
Шаг 4. 95%-й интервал для нормальной величины — это $\mu \pm 1{,}96\sigma$:
$$120 \pm 1{,}96 \cdot 3 = 120 \pm 5{,}88$$Ответ: с вероятностью примерно 95% среднее время ответа по 900 запросам окажется в интервале $(114{,}1;\ 125{,}9)$ мс.
📌 Обрати внимание на масштаб эффекта: отдельный запрос гуляет с разбросом 90 мс, а среднее по 900 запросам — с разбросом 3 мс. Усреднение сжало неопределённость в 30 раз. И это ровно $\sqrt{900} = 30$.
Пример 3 (сложный): сколько объектов нужно в тестовой выборке
Ты замеряешь accuracy модели. Истинная точность где-то около 0,90. Сколько объектов должно быть в тестовой выборке, чтобы 95%-й доверительный интервал был не шире $\pm 1$ процентного пункта?
Решение:
Шаг 1. Смоделируем измерение. Для каждого объекта $i$ введём индикатор $X_i$: единица, если модель угадала, ноль иначе. Это величина Бернулли с параметром $p \approx 0{,}90$. Измеренная accuracy — это в точности выборочное среднее:
$$\widehat{p} = \overline{X}_n = \frac{1}{n}\sum_{i=1}^{n} X_i$$Шаг 2. Параметры одного индикатора (урок 240): $\mu = p$, $\sigma^2 = p(1-p) = 0{,}9 \cdot 0{,}1 = 0{,}09$, $\sigma = 0{,}3$.
Шаг 3. По ЦПТ:
$$\widehat p \approx N\!\left(p;\ \frac{p(1-p)}{n}\right), \qquad \mathrm{SE} = \sqrt{\frac{0{,}09}{n}} = \frac{0{,}3}{\sqrt n}$$Шаг 4. Полуширина 95%-го интервала равна $1{,}96 \cdot \mathrm{SE}$. Требуем:
$$1{,}96 \cdot \frac{0{,}3}{\sqrt n} \le 0{,}01$$$$\sqrt n \ge \frac{1{,}96 \cdot 0{,}3}{0{,}01} = 58{,}8$$$$n \ge 58{,}8^2 = 3457{,}4$$Шаг 5. Округляем вверх до целого: $n = 3458$.
Проверим наш ответ: при $n = 3458$ получаем $\mathrm{SE} = 0{,}3/\sqrt{3458} = 0{,}3/58{,}80 = 0{,}005102$, полуширина $1{,}96 \cdot 0{,}005102 = 0{,}01000$. Ровно на границе. ✅
Ответ: нужно минимум 3458 объектов в тестовой выборке.
📌 Практический вывод, который стоит запомнить навсегда: чтобы сузить доверительный интервал вдвое, выборку нужно увеличить вчетверо. Точность стоит квадратично дорого. Именно поэтому переход от 1000 к 2000 объектов заметно улучшает оценку, а от 100 000 к 200 000 — почти нет: интервал и так узкий, а собирать данные пришлось бы вдвое дольше.
Почему это важно. ЦПТ превращает два скучных числа ($\mu$ и $\sigma$) в полноценное распределение. Без неё, зная только математическое ожидание и дисперсию, ты можешь применить лишь неравенство Чебышёва — а оно даёт чудовищно грубые оценки: «отклонение больше $2\sigma$ имеет вероятность не более 25%». ЦПТ уточняет: не 25%, а 4,55%. Разница в пять с лишним раз, и именно она отделяет практически бесполезную оценку от рабочего инструмента.
ЦПТ и закон больших чисел: две теоремы про одно среднее
Эти две теоремы постоянно путают, а между ними — принципиальная разница. Разберём её сразу, потому что без неё половина смысла ЦПТ теряется. Подробно закон больших чисел мы разберём в следующем уроке (242), здесь нам нужна только его суть и точка расхождения.
Интуиция: куда и как
Представь толпу людей, которая расходится по домам после концерта. Про эту толпу можно задать два разных вопроса.
Первый: куда все идут? Ответ — к метро. Это закон больших чисел: он говорит, к какой точке всё стягивается.
Второй: как именно они там толпятся — насколько широко растекается поток вокруг направления к метро, симметрично или нет, какая доля отклонится на сто метров вправо? Это ЦПТ: она описывает форму облака вокруг предела.
Теперь на языке формул. Закон больших чисел говорит:
$$\overline{X}_n \xrightarrow{P} \mu \qquad \text{при } n \to \infty$$то есть выборочное среднее сходится по вероятности к истинному математическому ожиданию. Для любого сколь угодно малого $\varepsilon > 0$ вероятность $P(|\overline{X}_n - \mu| > \varepsilon)$ стремится к нулю. Это утверждение о пределе: разброс схлопывается в точку.
Но ЗБЧ ничего не говорит о том, с какой скоростью он схлопывается и какой формы облако по дороге. Ноль есть ноль — ЗБЧ доволен и не уточняет. Причём если посмотреть на $\overline{X}_n - \mu$ при большом $n$, увидишь просто точку в нуле: вся структура «сплющилась» и стала невидимой.
ЦПТ берёт этот схлопнувшийся ноль и растягивает его обратно под микроскопом кратности $\sqrt n$:
$$\sqrt n\,(\overline{X}_n - \mu) \xrightarrow{d} N(0;\sigma^2)$$Умножая на $\sqrt n$, мы точно компенсируем схлопывание — и вместо точки видим устойчивую колоколообразную картинку. Если бы мы умножили на $n$ (микроскоп сильнее нужного), картинка бы разлетелась в бесконечность. Если бы на $n^{1/4}$ (слабее нужного), всё равно осталась бы точка. Ровно $\sqrt n$ — единственная правильная кратность, и это тоже содержательное утверждение ЦПТ.
Сравнение: ЗБЧ отвечает на вопрос «куда сходится среднее?» — ответ: к $\mu$. ЦПТ отвечает на вопрос «как именно оно колеблется вокруг $\mu$ по дороге?» — ответ: отклонение имеет порядок $\sigma/\sqrt n$ и приближённо нормальную форму. ЗБЧ — теорема о пределе, ЦПТ — теорема о скорости и форме приближения к этому пределу.
Полезная мнемоника: ЗБЧ — это «есть куда», ЦПТ — это «вот как быстро и вот какой формы». Из ЦПТ, кстати, ЗБЧ следует как побочный вывод: если $\overline{X}_n - \mu$ имеет порядок $\sigma/\sqrt n \to 0$, то среднее обязано сходиться к $\mu$. Обратное неверно — ЗБЧ выполняется и в ситуациях, где ЦПТ не работает (например, при бесконечной дисперсии, но конечном математическом ожидании).
Пример 4 (средний): почему без ЦПТ нельзя строить интервалы
Пусть $\mu$ неизвестно, $\sigma = 20$, мы усреднили $n = 400$ наблюдений и получили $\overline{X} = 53{,}2$. Что мы можем сказать о $\mu$, опираясь только на ЗБЧ, и что — опираясь на ЦПТ?
Решение:
Шаг 1. Только ЗБЧ. Он говорит: при росте $n$ среднее приближается к $\mu$. Для конкретного $n = 400$ он не даёт никакой количественной оценки — только обещание в пределе. Единственное, что можно выжать без ЦПТ, — неравенство Чебышёва:
$$P(|\overline{X} - \mu| \ge k \cdot \mathrm{SE}) \le \frac{1}{k^2}$$Шаг 2. Считаем стандартную ошибку: $\mathrm{SE} = 20/\sqrt{400} = 20/20 = 1$.
Шаг 3. Чтобы гарантировать вероятность ошибки не выше 5%, по Чебышёву нужно $1/k^2 \le 0{,}05$, то есть $k \ge \sqrt{20} \approx 4{,}47$. Интервал: $53{,}2 \pm 4{,}47$, то есть $(48{,}7;\ 57{,}7)$ — ширина 8,9.
Шаг 4. С ЦПТ. Распределение $\overline{X}$ приближённо нормально, значит нужное $k$ берётся из таблицы нормального закона: $k = 1{,}96$. Интервал: $53{,}2 \pm 1{,}96$, то есть $(51{,}24;\ 55{,}16)$ — ширина 3,92.
Ответ: ЗБЧ + Чебышёв дают интервал шириной 8,9; ЦПТ даёт интервал шириной 3,92 — в 2,28 раза уже при том же объёме данных.
📌 Читай это так: ЦПТ «бесплатно» экономит тебе примерно в 5 раз больше данных. Чтобы получить чебышёвским методом такую же ширину, как у ЦПТ, пришлось бы взять $n$ в $(4{,}47/1{,}96)^2 \approx 5{,}2$ раза больше — то есть 2080 наблюдений вместо 400.
Численная демонстрация: как рождается колокол
Пора посмотреть на теорему глазами. Всё, что ниже, посчитано точной свёрткой распределений (никакого моделирования Монте-Карло, только арифметика с дробями), так что цифрам можно верить до последнего знака.
Опыт 1: суммы бросков кубика
Один бросок кубика — это идеально плоское распределение: все шесть значений по $1/6$. Ни малейшего намёка на колокол. Смотрим, что происходит при сложении.
$n = 1$ — полная равномерность:
| Сумма | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| $P$ | 0,1667 | 0,1667 | 0,1667 | 0,1667 | 0,1667 | 0,1667 |
$n = 2$ — уже треугольник, за один шаг:
| Сумма | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 | 11 | 12 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| $P$ | 0,0278 | 0,0556 | 0,0833 | 0,1111 | 0,1389 | 0,1667 | 0,1389 | 0,1111 | 0,0833 | 0,0556 | 0,0278 |
$n = 3$ — треугольник уже сглажен в колокол, у него появились «плечи»:
| Сумма | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 | 11 | 12 | ... |
|---|---|---|---|---|---|---|---|---|---|---|---|
| $P$ точно | 0,0046 | 0,0139 | 0,0278 | 0,0463 | 0,0694 | 0,0972 | 0,1157 | 0,1250 | 0,1250 | 0,1157 | симметрично |
| Норм. прибл. | 0,0056 | 0,0123 | 0,0242 | 0,0427 | 0,0671 | 0,0942 | 0,1182 | 0,1323 | 0,1323 | 0,1182 |
Уже при трёх кубиках нормальное приближение попадает с ошибкой в пару процентов в центральной зоне. При $n = 5$:
| Сумма | 12 | 13 | 14 | 15 | 16 | 17 | 18 | 19 | 20 |
|---|---|---|---|---|---|---|---|---|---|
| $P$ точно | 0,0392 | 0,0540 | 0,0694 | 0,0837 | 0,0945 | 0,1003 | 0,1003 | 0,0945 | 0,0837 |
| Норм. прибл. | 0,0371 | 0,0522 | 0,0686 | 0,0842 | 0,0965 | 0,1033 | 0,1033 | 0,0965 | 0,0842 |
| Ошибка | −5,3% | −3,3% | −1,2% | +0,6% | +2,1% | +3,0% | +3,0% | +2,1% | +0,6% |
А теперь измерим сходимость одним числом. Возьмём максимальное расхождение функций распределения (расстояние Колмогорова) между точным распределением нормированной суммы и стандартным нормальным:
| $n$ кубиков | 1 | 2 | 3 | 5 | 10 | 20 | 30 |
|---|---|---|---|---|---|---|---|
| Макс. расхождение | 0,0542 | 0,0164 | 0,0098 | 0,0054 | 0,0026 | 0,0013 | 0,0009 |
Смотри, какая красивая картина. Уже при $n = 2$ расхождение падает до 1,6%, при $n = 5$ — до полпроцента, при $n = 30$ — меньше одной десятой процента. И заметь: числа убывают примерно пропорционально $1/\sqrt n$ (от $n=10$ к $n=30$ — втрое больше $n$, расхождение упало примерно в $\sqrt 3 \approx 1{,}73$ раза: $0{,}0026 \to 0{,}0009$, это в 2,9 раза; чуть быстрее теоретической оценки, потому что распределение кубика симметрично — а симметрия ускоряет сходимость).
Опыт 2: суммы равномерных величин
Теперь непрерывный случай. Пусть $X_i \sim U(0;1)$ — равномерное на отрезке от 0 до 1, у него $\mu = 1/2$ и $\sigma^2 = 1/12$. Плотность — прямоугольник, никакого колокола. Сложим $n$ штук и стандартизуем; полученную плотность сравним с плотностью $\varphi(z) = \frac{1}{\sqrt{2\pi}}e^{-z^2/2}$.
| $z$ | 0 | 0,5 | 1,0 | 1,5 | 2,0 | 2,5 |
|---|---|---|---|---|---|---|
| $n = 1$ | 0,2887 | 0,2887 | 0,2887 | 0,2887 | 0 | 0 |
| $n = 2$ | 0,4082 | 0,3249 | 0,2416 | 0,1582 | 0,0749 | 0 |
| $n = 3$ | 0,3750 | 0,3438 | 0,2500 | 0,1406 | 0,0625 | 0,0156 |
| $n = 4$ | 0,3849 | 0,3437 | 0,2480 | 0,1394 | 0,0581 | 0,0166 |
| $n = 6$ | 0,3889 | 0,3472 | 0,2459 | 0,1358 | 0,0567 | 0,0167 |
| $n = 12$ | 0,3939 | 0,3497 | 0,2440 | 0,1326 | 0,0552 | 0,0172 |
| $\varphi(z)$ | 0,3989 | 0,3521 | 0,2420 | 0,1295 | 0,0540 | 0,0175 |
Прочитаем таблицу. При $n=1$ плотность — плоская крышка, обрывающаяся в ноль (правый хвост физически отсутствует: сумма одной равномерной не может уйти дальше $\sqrt 3 \approx 1{,}73$ стандартных отклонений). При $n=2$ — треугольник Симпсона, уже с наклоном. При $n=3$ ошибка в центре около 6%, при $n=4$ — 3,5%, при $n=12$ — 1,3%.
Сходимость в центре отличная почти сразу. А вот в хвостах она принципиально медленнее: сумма $n$ равномерных не выходит за $\pm\sqrt{3n}$ стандартных отклонений (при $n=12$ это $\pm 6$), тогда как у настоящего нормального хвост бесконечен. Это общее правило: ЦПТ хороша в центре и осторожна на далёких хвостах. Считать по нормальному приближению вероятности порядка $10^{-6}$ — плохая идея.
📌 Кстати, строка $n = 12$ — не случайная. Сумма двенадцати равномерных величин минус 6 (её $\mu = 6$, $\sigma^2 = 12/12 = 1$, так что нормировать не нужно вовсе) десятилетиями использовалась как быстрый генератор нормальных чисел в компьютерах: двенадцать сложений вместо логарифмов и синусов. Метод и сегодня встречается в старом коде под именем «сумма 12 равномерных».
Опыт 3: суммы Бернулли — где симметрия важна
Самый поучительный опыт. Величина Бернулли принимает только 0 и 1 — дальше от колокола некуда. Но здесь есть параметр $p$, и он управляет скоростью сходимости.
Симметричный случай $p = 0{,}5$ (честная монета). Сравним точную биномиальную вероятность и нормальное приближение с поправкой на непрерывность.
При $n = 10$ ($\mu = 5$, $\sigma \approx 1{,}5811$):
| $k$ | 2 | 3 | 4 | 5 | 6 | 7 | 8 |
|---|---|---|---|---|---|---|---|
| Точно | 0,0439 | 0,1172 | 0,2051 | 0,2461 | 0,2051 | 0,1172 | 0,0439 |
| Прибл. | 0,0435 | 0,1145 | 0,2045 | 0,2482 | 0,2045 | 0,1145 | 0,0435 |
| Ошибка | −1,0% | −2,3% | −0,3% | +0,8% | −0,3% | −2,3% | −1,0% |
Десять бросков монеты — и точность уже около процента. При $n = 30$ ошибка в центральной зоне падает до 0,2–0,8%.
Скошенный случай $p = 0{,}1$ — та же арифметика, совсем другой результат:
| $n$ | 5 | 10 | 30 | 100 | 300 | 1000 |
|---|---|---|---|---|---|---|
| Макс. расхождение | 0,0905 | 0,0496 | 0,0309 | 0,0175 | 0,0102 | 0,0056 |
| Асимметрия $\gamma_1$ | 1,193 | 0,843 | 0,487 | 0,267 | 0,154 | 0,084 |
Сравни с кубиком: там при $n=10$ расхождение было 0,0026, здесь при $n=10$ — 0,0496, в девятнадцать раз хуже. И при $n = 1000$ скошенная монетка ещё не догнала точность, которую кубик показывал уже при $n = 3$.
Причина в асимметрии. Для суммы $n$ независимых одинаково распределённых величин коэффициент асимметрии равен $\gamma_1(S_n) = \gamma_1(X)/\sqrt n$: он гасится, но только как корень. У кубика $\gamma_1(X) = 0$ — асимметрии нет с самого начала, и гасить нечего. У Бернулли с $p = 0{,}1$ имеем
$$\gamma_1(X) = \frac{1 - 2p}{\sqrt{p(1-p)}} = \frac{0{,}8}{0{,}3} \approx 2{,}67$$и на её подавление уходят сотни наблюдений.
Практическое правило (правило «десяти успехов»): нормальное приближение биномиального распределения считают приемлемым, если $np \ge 10$ и $n(1-p) \ge 10$. Более мягкая (и более рискованная) версия требует $np \ge 5$ и $n(1-p) \ge 5$. Оба условия проверяют одно и то же: чтобы колокол «поместился» между границами $0$ и $n$, не упираясь в них.
Проверим правило на цифрах выше. При $n = 30$, $p = 0{,}1$: $np = 3 < 10$ — правило запрещает, и действительно ошибка 3% плюс промахи в отдельных точках до 17%. При $n = 100$, $p = 0{,}1$: $np = 10$ — ровно на границе, ошибка 1,75%, терпимо. При $n = 300$: $np = 30$ — с запасом, ошибка 1%. Правило работает.
Почему это важно. Три опыта дают тебе интуицию, которую невозможно получить из формулы: скорость сходимости определяется не $n$ самим по себе, а произведением «$n$ на симметричность исходного распределения». Для симметричных величин достаточно $n \approx 5{-}10$. Для умеренно скошенных — $n \approx 30$ (отсюда легендарное «правило тридцати» из учебников). Для сильно скошенных — сотни и тысячи. Прежде чем применять ЦПТ к своим данным, посмотри на гистограмму: если она похожа на распределение доходов или длительностей сессий с длинным правым хвостом, тридцати наблюдений точно не хватит.
Теорема Муавра–Лапласа и поправка на непрерывность
Частный случай, с которого всё началось
Схема Бернулли (урок 233) — это ровно та ситуация, где ЦПТ применяется чаще всего: $n$ независимых испытаний, в каждом успех с вероятностью $p$, считаем общее число успехов $K_n$. Но $K_n$ — это и есть сумма индикаторов:
$$K_n = X_1 + \dots + X_n, \qquad X_i = \begin{cases} 1, & \text{успех} \\ 0, & \text{неудача} \end{cases}$$Для индикатора $\mu = p$ и $\sigma^2 = p(1-p)$ (проверь: $\mathbb{E}X = 0\cdot(1-p) + 1\cdot p = p$; $\mathbb{E}X^2 = p$, значит $\sigma^2 = p - p^2 = p(1-p)$). Подставляем в ЦПТ и получаем историческую теорему.
Определение (интегральная теорема Муавра–Лапласа): Пусть $K_n$ — число успехов в $n$ испытаниях Бернулли с вероятностью успеха $p \in (0;1)$. Тогда
$$\frac{K_n - np}{\sqrt{np(1-p)}} \xrightarrow{d} N(0;1),$$то есть для любых $a < b$
$$P(a \le K_n \le b) \approx \Phi\!\left(\frac{b - np}{\sqrt{np(1-p)}}\right) - \Phi\!\left(\frac{a - np}{\sqrt{np(1-p)}}\right).$$
Есть и локальная версия — для вероятности ровно $k$ успехов:
$$P(K_n = k) \approx \frac{1}{\sqrt{np(1-p)}}\,\varphi\!\left(\frac{k - np}{\sqrt{np(1-p)}}\right), \qquad \varphi(z) = \frac{1}{\sqrt{2\pi}}e^{-z^2/2}$$Логика локальной формулы простая: вероятность точки заменяется на площадь полоски единичной ширины под кривой плотности, а площадь тонкой полоски ≈ высота × ширина = $f(k) \cdot 1$.
Поправка на непрерывность
Вот тонкость, которая отделяет аккуратный расчёт от небрежного. Мы приближаем дискретную величину (число успехов — целое) непрерывной (нормальной). У дискретной величины вероятность сосредоточена в точках $0, 1, 2, \dots$; у непрерывной — размазана по прямой. При переводе одного в другое надо решить: какой кусок прямой «принадлежит» целому числу $k$?
Ответ естественный: отрезок $[k - 0{,}5;\ k + 0{,}5]$. Каждое целое забирает себе полосу шириной 1, центрированную в нём. Отсюда правило.
Определение (поправка на непрерывность): При замене дискретного целочисленного распределения непрерывным каждую границу сдвигают на $0{,}5$ наружу от включаемого множества значений:
- $P(K \le k) \approx \Phi\!\left(\dfrac{k + 0{,}5 - \mu}{\sigma}\right)$
- $P(K < k) = P(K \le k-1) \approx \Phi\!\left(\dfrac{k - 0{,}5 - \mu}{\sigma}\right)$
- $P(K \ge k) \approx 1 - \Phi\!\left(\dfrac{k - 0{,}5 - \mu}{\sigma}\right)$
- $P(K > k) \approx 1 - \Phi\!\left(\dfrac{k + 0{,}5 - \mu}{\sigma}\right)$
- $P(a \le K \le b) \approx \Phi\!\left(\dfrac{b + 0{,}5 - \mu}{\sigma}\right) - \Phi\!\left(\dfrac{a - 0{,}5 - \mu}{\sigma}\right)$
- $P(K = k) \approx \Phi\!\left(\dfrac{k + 0{,}5 - \mu}{\sigma}\right) - \Phi\!\left(\dfrac{k - 0{,}5 - \mu}{\sigma}\right)$
Мнемоника: границы всегда раздвигаются, если значение включено ($\le$, $\ge$, $=$), и сжимаются, если исключено ($<$, $>$). Проверяй себя вопросом: «попадает ли целое число $k$ внутрь моего отрезка?»
Примеры с разбором
Пример 5 (простой): монета, 100 бросков
Найди $P(45 \le K \le 55)$ для честной монеты, брошенной 100 раз, — та самая задача де Муавра.
Решение:
Шаг 1. Параметры: $np = 100 \cdot 0{,}5 = 50$; $\sigma = \sqrt{100 \cdot 0{,}5 \cdot 0{,}5} = \sqrt{25} = 5$.
Шаг 2. Проверяем применимость: $np = 50 \ge 10$, $n(1-p) = 50 \ge 10$ ✅.
Шаг 3. Границы с поправкой: обе включены, значит раздвигаем — от $44{,}5$ до $55{,}5$.
Шаг 4. Нормируем:
$$z_1 = \frac{44{,}5 - 50}{5} = -1{,}1, \qquad z_2 = \frac{55{,}5 - 50}{5} = 1{,}1$$Шаг 5. $P \approx \Phi(1{,}1) - \Phi(-1{,}1) = 2\Phi(1{,}1) - 1 = 2 \cdot 0{,}86433 - 1 = 0{,}72866$.
Проверим наш ответ: точная сумма одиннадцати биномиальных слагаемых равна $0{,}728747$. Расхождение — восемь стотысячных! А без поправки на непрерывность получилось бы $2\Phi(1) - 1 = 0{,}6827$ — ошибка в 4,6 процентных пункта, в пятьсот раз больше.
Ответ: $P(45 \le K \le 55) \approx 0{,}7287$.
Пример 6 (средний): вероятность ровно 126 очков на 36 кубиках
Бросают 36 кубиков. Найди $P(S = 126)$.
Решение:
Шаг 1. $\mu = 36 \cdot 3{,}5 = 126$ (задан ровно центр), $\sigma^2 = 36 \cdot \frac{35}{12} = 105$, $\sigma = \sqrt{105} \approx 10{,}247$.
Шаг 2. Точка — используем формулу для $P(K=k)$ через две границы:
$$P(S = 126) \approx \Phi\!\left(\frac{126{,}5 - 126}{10{,}247}\right) - \Phi\!\left(\frac{125{,}5 - 126}{10{,}247}\right) = \Phi(0{,}0488) - \Phi(-0{,}0488)$$Шаг 3. $= 2\Phi(0{,}0488) - 1 = 2 \cdot 0{,}51946 - 1 = 0{,}03892$.
Проверим наш ответ: точное значение (свёртка 36 распределений) равно $0{,}038761$. Ошибка $+0{,}4\%$. ✅
Ответ: $P(S = 126) \approx 0{,}0389$.
📌 Сравни: локальная формула через плотность дала бы $\frac{1}{10{,}247}\varphi(0) = \frac{0{,}39894}{10{,}247} = 0{,}03893$ — практически то же самое. Для узкой полоски высота × ширина и точная площадь почти совпадают. Разница между двумя подходами становится заметной только далеко в хвостах, где плотность быстро меняется.
Пример 7 (сложный): контроль качества разметки
Асессоры размечают датасет. Доля ошибочных меток в среднем $p = 0{,}03$. Ты берёшь на перепроверку $n = 1000$ объектов. Найди вероятность того, что ошибочных меток окажется больше 40. И скажи, надёжен ли ответ.
Решение:
Шаг 1. Параметры: $\mu = 1000 \cdot 0{,}03 = 30$; $\sigma^2 = 1000 \cdot 0{,}03 \cdot 0{,}97 = 29{,}1$; $\sigma = \sqrt{29{,}1} \approx 5{,}394$.
Шаг 2. Проверяем условие: $np = 30 \ge 10$ ✅, $n(1-p) = 970 \ge 10$ ✅. Формально можно. Но асимметрия исходной величины велика: $\gamma_1(X) = \frac{1 - 0{,}06}{\sqrt{0{,}0291}} = \frac{0{,}94}{0{,}1706} \approx 5{,}51$, значит у суммы $\gamma_1(S) = 5{,}51/\sqrt{1000} \approx 0{,}174$ — заметный правый перекос остаётся. Держим это в уме.
Шаг 3. Строгое «больше 40» — значит $K \ge 41$, граница сжимается к $40{,}5$:
$$z = \frac{40{,}5 - 30}{5{,}394} = \frac{10{,}5}{5{,}394} \approx 1{,}9466$$Шаг 4. $P(K > 40) \approx 1 - \Phi(1{,}9466) \approx 1 - 0{,}9742 = 0{,}0258$.
Шаг 5. Оценка надёжности. Мы залезли почти на $2\sigma$ вправо — в зону, где ЦПТ уже не идеальна, а остаточная асимметрия $+0{,}174$ означает, что реальный правый хвост тяжелее нормального. То есть истинная вероятность должна быть чуть больше нашей оценки. Точное биномиальное вычисление даёт $0{,}03022$ — и действительно, приближение занизило ответ примерно на 15% относительной величины.
Ответ: $P \approx 0{,}026$ по нормальному приближению; точное значение $0{,}0302$; для хвостовых вероятностей при скошенном исходном распределении лучше считать точно или брать пуассоновское приближение.
📌 Универсальное правило: в центре доверяй ЦПТ, в хвостах проверяй. Относительная ошибка приближения растёт по мере удаления от центра — там, где сама вероятность маленькая, промах в полтора раза — обычное дело.
Почему это важно. Поправка на непрерывность стоит одну строчку кода и часто даёт улучшение точности на порядок — особенно при небольших $n$ и узких интервалах. В задаче про монету она уменьшила ошибку в 500 раз. Забыть про неё — самая частая ошибка в расчётах по схеме Бернулли, и чем меньше интервал, тем страшнее последствия: для $P(K = k)$ без поправки ты получишь ноль (площадь под кривой над точкой равна нулю), то есть полную бессмыслицу.
Практика: 30 заданий
Базовые (задания 1-10)
Задание 1: Случайные величины $X_1, \dots, X_{25}$ независимы и одинаково распределены, $\mathbb{E}X_i = 4$, $\sigma = 3$. Найди $\mathbb{E}S_{25}$, $\mathbb{D}S_{25}$, $\sigma(S_{25})$ и стандартную ошибку выборочного среднего.
Задание 2: Разброс одного измерения $\sigma = 12$. Сколько измерений нужно усреднить, чтобы стандартная ошибка среднего не превышала $0{,}5$?
Задание 3: Кубик бросают 300 раз. Каким приближённым распределением описывается сумма выпавших очков?
Задание 4: Сумма $S_{64}$ составлена из 64 независимых величин с $\mu = 10$ и $\sigma = 2$. Нормируй значение $S_{64} = 660$, то есть найди соответствующее $z$.
Задание 5: Время ответа сервиса имеет $\sigma = 40$ мс. Мы усредняем по $n = 100$ запросам. С какой вероятностью среднее отклонится от истинного $\mu$ меньше чем на 8 мс?
Задание 6: Модель с истинной точностью $p = 0{,}8$ проверяется на тесте из 400 объектов. Найди стандартную ошибку измеренной accuracy и полуширину 95%-го доверительного интервала.
Задание 7: Ты оцениваешь величину методом Монте-Карло. Во сколько раз нужно увеличить число прогонов, чтобы стандартная ошибка упала втрое?
Задание 8: У исходной величины коэффициент асимметрии $\gamma_1(X) = 1{,}5$. Чему равна асимметрия суммы 100 таких независимых величин? Хватит ли $n = 100$ для нормального приближения?
Задание 9: Можно ли применить нормальное приближение к числу успехов при $n = 200$, $p = 0{,}04$? Что делать, если нельзя?
Задание 10: Честная монета брошена 100 раз. Найди $P(K \le 60)$ по нормальному приближению с поправкой на непрерывность.
Средние (задания 11-20)
Задание 11: Монету бросают 400 раз. Найди вероятность того, что число орлов окажется в пределах от 190 до 210 включительно.
Задание 12: Складывают 50 независимых величин, равномерно распределённых на $[0;1]$. Найди $P(S_{50} > 27)$.
Задание 13: Латентность сервиса имеет $\sigma = 50$ мс. Сколько запросов нужно замерить, чтобы 95%-й доверительный интервал для средней латентности был не шире $\pm 2$ мс?
Задание 14: Оцени вероятность отклонения среднего более чем на $3\,\mathrm{SE}$ двумя способами: по неравенству Чебышёва и по ЦПТ. Во сколько раз они различаются?
Задание 15: Градиент лосса по одному объекту имеет по каждой компоненте стандартное отклонение $\sigma = 0{,}6$. Какой шум у усреднённого градиента при batch size 256? Во сколько раз нужно увеличить батч, чтобы шум упал вдвое?
Задание 16: В сервисе 10 000 запросов, каждый падает с вероятностью $0{,}002$ независимо. Оцени $P(K \ge 30)$ по нормальному приближению и объясни, в какую сторону оно ошибается.
Задание 17: На тесте из 1000 объектов модель показала accuracy $0{,}87$. Построй 95%-й доверительный интервал. Можно ли утверждать, что истинная точность выше $0{,}85$?
Задание 18: Кубик бросают 100 раз. Найди такое целое $c$, что вероятность превысить его суммой очков составляет около 1%.
Задание 19: Время до отказа узла распределено экспоненциально со средним 50 часов (у экспоненциального распределения $\sigma = \mu$). Наблюдали 200 независимых отказов. Найди $P(\overline X > 55)$ и оцени, врёт ли приближение.
Задание 20: Две группы пользователей по 100 человек. В контроле среднее время на сайте $\overline X = 48$ мин, в тесте $\overline Y = 53$ мин. Известно, что в обеих группах $\sigma = 15$ мин. Значима ли разница в 5 минут?
Продвинутые (задания 21-30)
Задание 21: Выведи коэффициент инициализации He. Нейрон линейного слоя считает $z = \sum_{i=1}^{n_{\text{in}}} w_i x_i$, веса независимы, $\mathbb{E}w_i = 0$, $\mathbb{D}w_i = \sigma_w^2$, входы независимы от весов. Покажи, почему $z$ приближённо нормально, и найди $\sigma_w$, при котором дисперсия сигнала не меняется от слоя к слою в сети с ReLU. Посчитай для $n_{\text{in}} = 512$.
Задание 22: Выведи «правило линейного масштабирования» learning rate. Шаг SGD равен $\Delta\theta = -\eta\, g_B$, где $g_B$ — усреднённый градиент по батчу размера $B$, а разброс градиента по одному объекту равен $\sigma$. Покажи, что для сохранения суммарного шума за эпоху нужно $\eta \propto B$. Какой $\eta$ взять при $B = 1024$, если при $B = 256$ работал $\eta = 0{,}1$?
Задание 23: Базовая конверсия в сервисе $4\%$. Нужно уметь ловить прирост от 4,0% до 4,4% (то есть $\Delta = 0{,}4$ п.п.) при уровне значимости $5\%$ и мощности $80\%$. Сколько пользователей нужно в каждую группу?
Задание 24: Величины $X_i$ имеют распределение Коши с плотностью $f(x) = \dfrac{1}{\pi(1+x^2)}$. Известно, что среднее $\overline X_n$ таких величин снова имеет ровно то же распределение Коши при любом $n$. Посчитай $P(|\overline X_n| > 2)$ для $n = 1$, $n = 100$ и $n = 10^6$. Объясни, почему ЦПТ здесь бессильна, и что это значит для ML.
Задание 25: Лосс на одном объекте имеет $\mu = 0{,}35$, $\sigma = 0{,}5$ и сильную правую асимметрию $\gamma_1 = 3$ (редкие «тяжёлые» примеры дают огромный лосс). Батч $B = 64$. Найди вероятность того, что средний лосс батча превысит $0{,}45$, и оцени, насколько ответу можно верить.
Задание 26: Accuracy модели от запуска к запуску (разные random seed) гуляет со стандартным отклонением $\sigma = 0{,}004$. Ты хочешь доказать, что новая архитектура лучше старой на $0{,}003$ (0,3 п.п.). Сколько сидов нужно прогнать для каждой модели?
Задание 27: В слое 2048 нейронов, dropout выключает каждый независимо с вероятностью $0{,}5$. Найди вероятность того, что активных нейронов окажется не более 990. Насколько сильно вообще гуляет число активных нейронов?
Задание 28: Ты оцениваешь accuracy детектора по 900 кадрам, взятым из 90 видео (по 10 кадров с каждого). Наблюдённая accuracy $0{,}90$. Внутри одного видео кадры скоррелированы, коэффициент корреляции ошибок $\rho = 0{,}5$. Посчитай наивный доверительный интервал и правильный.
Задание 29: Число $\pi$ оценивают методом Монте-Карло: бросают точки в квадрат $[-1;1]^2$ и считают долю попавших в вписанный круг. Оценка $\widehat\pi = 4\widehat p$. Сколько точек нужно, чтобы 95%-й интервал для $\pi$ был не шире $\pm 0{,}001$?
Задание 30: Слой с $n_{\text{in}} = 4096$ входами, веса инициализированы по He: $\sigma_w = \sqrt{2/4096} \approx 0{,}0221$. Веса квантуют в int8 по каналу: диапазон $\pm 4\sigma_w$ разбивается на 255 уровней. Входы имеют среднеквадратичное значение 1. Оцени, какую ошибку квантование вносит в выход нейрона, и какую долю от полезного сигнала она составляет.
Частые ошибки
❌ Ошибка 1: путать разброс объекта $\sigma$ и разброс среднего $\sigma/\sqrt n$
Неправильно: «Средняя зарплата в выборке из 10 000 человек равна 95 тысяч, стандартное отклонение 40 тысяч, значит доверительный интервал для средней зарплаты — от 15 до 175 тысяч».
Правильно: 40 тысяч — это разброс между людьми, он никуда не денется, сколько людей ни опрашивай. Интервал для среднего строится по стандартной ошибке:
$$\mathrm{SE} = \frac{40\,000}{\sqrt{10\,000}} = 400 \text{ рублей}$$Интервал: $95\,000 \pm 1{,}96 \cdot 400 = (94\,216;\ 95\,784)$.
Почему важно: ошибка в 200 раз по ширине интервала. Это, пожалуй, самая частая путаница в прикладной статистике вообще. Мнемоника: $\sigma$ отвечает на вопрос «насколько разные объекты?», $\sigma/\sqrt n$ — на вопрос «насколько разными были бы мои отчёты, набери я другую выборку?». Это два разных вопроса, и большие данные помогают только со вторым.
❌ Ошибка 2: применять ЦПТ к зависимым наблюдениям
Неправильно: «У нас 50 000 кликов от 800 пользователей, значит $n = 50\,000$ и $\mathrm{SE} = \sigma/\sqrt{50\,000}$».
Правильно: клики одного пользователя зависимы — один активный человек может дать сотню кликов, и все они «про него», а не про популяцию. Считать надо по независимым единицам: агрегируй метрику внутри пользователя, а потом усредняй 800 пользовательских чисел. Стандартная ошибка вырастет примерно в $\sqrt{50\,000/800} = 7{,}9$ раза.
Почему важно: дисперсия суммы равна $n\sigma^2$ только для независимых слагаемых; при положительной корреляции появляются ковариационные члены, и настоящая дисперсия больше. Все доверительные интервалы, посчитанные без учёта этого, оказываются обманчиво узкими — и ты «находишь» эффекты, которых нет. Правило: единица анализа = единица независимости.
❌ Ошибка 3: забывать поправку на непрерывность для целочисленных величин
Неправильно: «$n = 100$, $p = 0{,}5$, $P(K = 50) \approx$ площадь под нормальной кривой в точке 50 $= 0$».
Правильно: дискретному значению соответствует полоса $[49{,}5;\ 50{,}5]$:
$$P(K = 50) \approx \Phi\!\left(\frac{50{,}5 - 50}{5}\right) - \Phi\!\left(\frac{49{,}5 - 50}{5}\right) = 2\Phi(0{,}1) - 1 = 0{,}0797$$(точное биномиальное значение $0{,}0796$).
Почему важно: без поправки в точечном случае получается буквально ноль — полная бессмыслица, а на узких интервалах ошибка легко достигает нескольких процентных пунктов. И зеркальная ошибка: применять поправку к непрерывной величине. Если складываешь времена отклика или равномерные величины, никаких $\pm 0{,}5$ добавлять не надо — они появляются только там, где значения целые.
❌ Ошибка 4: считать, что «$n \ge 30$» всегда достаточно
Неправильно: «У нас 40 наблюдений, значит по правилу тридцати ЦПТ работает, строим нормальный доверительный интервал».
Правильно: правило тридцати выведено для умеренно симметричных распределений. Если исходная величина сильно скошена — доход, длительность сессии, размер заказа, лосс на объекте, — сорока наблюдений может не хватить катастрофически. Проверяй асимметрию: остаточный перекос среднего равен $\gamma_1(X)/\sqrt n$, и он должен быть примерно $\le 0{,}2$. При $\gamma_1(X) = 3$ это требует $n \ge 225$, при $\gamma_1(X) = 6$ — уже $n \ge 900$.
Почему важно: в уроке мы видели это на числах: для симметричного кубика приближение точное уже при $n = 3$, а для Бернулли с $p = 0{,}1$ даже при $n = 1000$ расхождение больше, чем у кубика при $n = 3$. «Тридцать» — это не закон природы, а грубая эвристика для приличных распределений.
❌ Ошибка 5: доверять ЦПТ в далёких хвостах
Неправильно: «Нормальное приближение даёт $P = 3\cdot10^{-7}$, значит такое событие практически невозможно, инцидент был не случайностью, а багом».
Правильно: ЦПТ приближает центр распределения, а относительная точность в хвостах падает. Если исходная величина скошена или ограничена, реальная вероятность может отличаться в разы и на порядки. Для хвостовых вероятностей нужны либо точные вычисления, либо специальные инструменты (приближение Пуассона для редких событий, неравенства Чернова, теория больших уклонений).
Почему важно: мы видели это в примере 7 урока: на $2\sigma$ вправо нормальное приближение уже занизило вероятность на 15% относительной величины. На $4\sigma$ промах может быть в разы. Решения вида «увольняем/откатываем, потому что вероятность $10^{-7}$» слишком дороги, чтобы строить их на приближении, которое в этой зоне не гарантирует ничего.
❌ Ошибка 6: складывать стандартные ошибки вместо дисперсий
Неправильно: «SE первой группы $1{,}5$, второй $1{,}5$, значит SE разности $= 3$».
Правильно: складываются дисперсии независимых величин, а не стандартные отклонения:
$$\mathrm{SE}_{\text{разн}} = \sqrt{1{,}5^2 + 1{,}5^2} = \sqrt{4{,}5} \approx 2{,}12$$Почему важно: ошибка в $\sqrt 2 \approx 1{,}41$ раза — и она всегда в консервативную сторону, то есть ты будешь пропускать реальные эффекты. Полезная памятка: при сложении $k$ одинаковых независимых источников шума общий разброс растёт как $\sqrt k$, а не как $k$. Тот же корень, что и в $\sigma/\sqrt n$ — это одна и та же математика.
❌ Ошибка 7: применять ЦПТ там, где дисперсия бесконечна
Неправильно: «Отношение двух метрик усредним по 10 000 запусков, по ЦПТ среднее будет нормальным».
Правильно: если знаменатель может оказаться близко к нулю, у отношения тяжёлые хвосты вплоть до коши-подобных, и дисперсия бесконечна. Тогда усреднение не сужает разброс вообще: как мы посчитали в задании 24, для распределения Коши $P(|\overline X_n| > 2) \approx 0{,}295$ и при $n = 1$, и при $n = 10^6$.
Почему важно: нарушение единственного существенного условия ЦПТ ломает её полностью, а не «немножко». В реальном ML это встречается в метриках-отношениях, в шуме градиента у трансформеров, в доходах на пользователя. Лечится не увеличением выборки, а сменой оценки: медиана, усечённое среднее, логарифм величины, клиппинг.
Главное запомнить
📝 Ключевые понятия
✅ Центральная предельная теорема: для независимых одинаково распределённых $X_i$ с $\mathbb{E}X_i = \mu$ и конечной $\mathbb{D}X_i = \sigma^2 \in (0;\infty)$ нормированная сумма сходится по распределению к стандартному нормальному:
$$Z_n = \frac{X_1 + \dots + X_n - n\mu}{\sigma\sqrt n} \xrightarrow{d} N(0;1)$$Форма исходного распределения не имеет значения — нужны только два конечных момента.
✅ Центр и разброс суммы: $\mathbb{E}S_n = n\mu$ растёт линейно, а $\sigma(S_n) = \sigma\sqrt n$ — только как корень. Отсюда вся практическая польза: относительная неопределённость суммы падает как $1/\sqrt n$.
✅ Стандартная ошибка среднего: $\mathrm{SE} = \sigma/\sqrt n$ — разброс не объектов, а самой оценки от выборки к выборке. Главная формула прикладной статистики: доверительные интервалы, размер A/B-теста, шум минибатчевого градиента — всё отсюда.
✅ Четыре эквивалентные записи ЦПТ: $S_n \approx N(n\mu;\,n\sigma^2)$; $\overline X_n \approx N(\mu;\,\sigma^2/n)$; $\sqrt n(\overline X_n - \mu) \xrightarrow{d} N(0;\sigma^2)$; $P(a \le S_n \le b) \approx \Phi\!\big(\frac{b-n\mu}{\sigma\sqrt n}\big) - \Phi\!\big(\frac{a-n\mu}{\sigma\sqrt n}\big)$. Все четыре про одно и то же, множитель $\sqrt n$ — «микроскоп» правильной кратности.
✅ ЦПТ против ЗБЧ: закон больших чисел отвечает «куда сходится среднее» — к $\mu$. ЦПТ отвечает «как быстро и какой формы облако вокруг предела» — порядок $\sigma/\sqrt n$, форма нормальная. ЗБЧ даёт предел, ЦПТ — скорость и форму.
✅ Правило квадратичной цены точности: сузить доверительный интервал в $k$ раз — значит увеличить выборку в $k^2$ раз. Вдвое точнее = вчетверо дороже. Это ограничение фундаментальное и обойти его нельзя, можно только уменьшить $\sigma$.
✅ Скорость сходимости определяется асимметрией: $\gamma_1(S_n) = \gamma_1(X)/\sqrt n$. Для симметричных величин хватает $n \approx 5{-}10$, для умеренно скошенных — $n \approx 30$, для сильно скошенных — сотни и тысячи. Ориентир: остаточная асимметрия должна быть $\lesssim 0{,}2$.
✅ Теорема Муавра–Лапласа — частный случай ЦПТ для схемы Бернулли: $\frac{K_n - np}{\sqrt{np(1-p)}} \xrightarrow{d} N(0;1)$ при условии $np \ge 10$ и $n(1-p) \ge 10$. Отсюда формула $\mathrm{SE} = \sqrt{p(1-p)/n}$ для accuracy, конверсии и любой доли.
✅ Поправка на непрерывность: при переходе от целочисленной величины к нормальной каждую границу сдвигают на $0{,}5$ — наружу для включённых значений ($\le, \ge, =$), внутрь для исключённых ($<, >$). Даёт улучшение точности на порядок и больше; для непрерывных величин не применяется.
✅ Когда ЦПТ не работает: бесконечная дисперсия (распределение Коши, отношения величин, степенные хвосты), зависимые слагаемые (кадры одного видео, клики одного пользователя, соседние запросы), малое $n$ при сильной асимметрии, а также далёкие хвосты — там приближение теряет относительную точность даже при большом $n$.
Связь с другими темами курса
Что нужно было знать до этого урока. ЦПТ стоит ровно на том фундаменте, который мы строили последние восемь уроков. Из урока 237 нужна линейность математического ожидания: она даёт $\mathbb{E}S_n = n\mu$ и работает даже для зависимых величин. Из урока 238 — дисперсия суммы независимых величин $\mathbb{D}S_n = n\sigma^2$, закон $\sigma/\sqrt n$ и стандартизация $Z = (X-\mu)/\sigma$: нормированная сумма из ЦПТ — это в точности стандартизованная $S_n$. Оттуда же неравенство Чебышёва, с которым мы сравнивали ЦПТ и увидели разницу в 40 раз. Из урока 239 — коэффициент асимметрии $\gamma_1$, который управляет скоростью сходимости, и распределение Коши как пример величины без моментов. Из урока 240 — нормальное распределение $N(\mu;\sigma^2)$, функция $\Phi(x)$, правила сигм и биномиальное распределение, которое ЦПТ и приближает в теореме Муавра–Лапласа. Наконец, из урока 233 — сама схема Бернулли: там мы пользовались теоремами Муавра–Лапласа как готовым рецептом, а теперь увидели, откуда они берутся.
Что изучить дальше. Следующий урок 242 — закон больших чисел. Мы уже наметили границу между ним и ЦПТ: ЗБЧ говорит, что среднее сходится к $\mu$, ЦПТ — с какой скоростью и какой формы облако. В 242 мы разберём ЗБЧ строго, увидим слабую и усиленную версии, теорему Бернулли для частот и поймём, почему обучение моделей на конечной выборке вообще имеет смысл. Дальше по курсу ЦПТ становится рабочим инструментом: доверительные интервалы и проверка гипотез — это ЦПТ плюс арифметика; бутстрэп — способ получить распределение оценки, когда аналитическую формулу для $\sigma$ выписать невозможно; t-распределение появится там, где $\sigma$ приходится оценивать по той же выборке и малому $n$ уже не хватает нормального приближения. А многомерная версия ЦПТ лежит под всей теорией асимптотической нормальности оценок максимального правдоподобия — то есть под доверительными интервалами для коэффициентов почти любой модели.
Где это нужно в жизни.
💻 В программировании. Оценка производительности: среднее время выполнения по $n$ прогонам имеет разброс $\sigma/\sqrt n$, и без этого бенчмарки превращаются в гадание — «стало на 3% быстрее» при разбросе 5% не значит ничего. Нагрузочное тестирование и планирование мощностей: суммарная нагрузка от многих независимых пользователей нормальна, значит запас по мощности считается в сигмах. Мониторинг: контрольные границы $\pm 3\sigma$ для метрик сервиса, оценка числа ошибок в логах, расчёт SLA. Хеш-таблицы и балансировщики: заполненность корзин — сумма независимых попаданий, и ЦПТ говорит, какой перекос считать нормальным, а какой — признаком плохой хеш-функции.
🤖 В ML/AI. Доверительные интервалы для accuracy, precision, recall и любой метрики-доли. Расчёт размера тестовой выборки и A/B-теста. Инициализация Xavier и He — прямое следствие того, что предактивация есть сумма многих слагаемых и потому нормальна. Шум минибатчевого градиента $\sigma/\sqrt B$ и правило линейного масштабирования learning rate. Батч-нормализация, которая стандартизует именно потому, что распределение активаций близко к нормальному. Dropout как схема Бернулли на широком слое. Ошибка квантования весов, которая суммируется по входам и оказывается нормальной. Ансамблирование: усреднение $k$ независимых моделей снижает дисперсию предсказания в $\sqrt k$ раз — это буквально ЦПТ, применённая к предсказаниям.
📊 В Data Science. Всё, что связано с выборками: опросы, оценка долей, стандартные ошибки в отчётах, бутстрэп-интервалы для любой статистики, сравнение сегментов, поправка на дизайн-эффект при кластерных выборках. Прогнозирование агрегатов: выручка за месяц — сумма многих независимых покупок, значит она нормальна, и интервал прогноза считается за одну строку. Обнаружение аномалий: «сколько сигм» — это язык, который работает только благодаря ЦПТ.
🔬 В науке. Теория ошибок измерений: погрешность прибора складывается из множества мелких независимых источников, поэтому она нормальна — именно так Гаусс пришёл к своей кривой, работая с астрономическими наблюдениями. Метод наименьших квадратов и все его доверительные интервалы. В физике: броуновское движение — сумма огромного числа независимых толчков молекул, отсюда нормальное распределение смещения и $\sqrt t$ в диффузии. В биологии: количественные признаки (рост, вес, урожайность) — суммарный эффект многих генов и факторов среды, поэтому колоколообразны. В медицине: клинические испытания, размер группы, значимость эффекта препарата.
Интересные факты
💡 ЦПТ появилась как способ не считать факториалы вручную — де Муавр в 1733 году искал не «главный закон природы», а обходной путь вокруг $C_{100}^{50} \approx 1{,}0089\cdot10^{29}$. Он разослал открытие друзьям частным памфлетом на латыни и не стал публиковать в журнале. Универсальность своего результата он так и не осознал: для него это остался трюк для монетки. Сто лет спустя ту же кривую независимо переоткрыл Гаусс, вычисляя орбиту астероида Цереры, — и с тех пор она носит его имя, а не имя де Муавра.
💡 Слово «центральная» означает не то, что все думают. Джордж Пойа, придумавший термин в 1920 году, имел в виду «центральная по важности для теории вероятностей», а вовсе не «про центр распределения». То есть правильно читать название как «главная предельная теорема». Ирония в том, что по-английски Central Limit Theorem можно разобрать и как «теорема о центральном пределе», и путаница живёт уже сто лет.
💡 Генератор нормальных чисел из двенадцати равномерных. Десятилетиями в вычислительных библиотеках стоял приём: сложить 12 случайных чисел из $[0;1]$ и вычесть 6. У такой суммы $\mu = 6$ и $\sigma^2 = 12/12 = 1$, то есть результат сразу стандартизован — нормировать не надо вовсе. Двенадцать сложений вместо логарифмов и синусов метода Бокса–Мюллера. Метод честно даёт нормальность в центре, но обрывается на $\pm 6\sigma$ — за этой границей у него ровно ноль вероятности, тогда как у настоящего нормального хвост бесконечен. Для симуляции редких событий такой генератор давал систематически заниженные риски.
💡 Финансовый кризис 2008 года частично вырос из злоупотребления ЦПТ. Модели оценки рисков ипотечных облигаций предполагали, что потери по портфелю — сумма многих независимых дефолтов, а значит нормальны. Оба допущения оказались неверными: дефолты сильно коррелируют (все заёмщики живут в одной экономике), а распределение потерь имеет тяжёлый хвост. Вероятности, посчитанные как «десять сигм, раз в миллиард лет», реализовались за пару месяцев. Это, возможно, самый дорогой в истории урок на тему «проверяй независимость и конечность дисперсии».
💡 Гальтонова доска — физическая модель ЦПТ, которую можно потрогать. Фрэнсис Гальтон в 1873 году построил доску с рядами штырьков: шарик падает сверху и на каждом штырьке случайно отклоняется влево или вправо. Итоговое смещение — сумма независимых отклонений, и шарики закономерно укладываются в колокол внизу. Гальтон использовал её как наглядный аргумент в спорах о наследственности; сегодня такие доски стоят в научных музеях по всему миру, и каждая из них — работающая иллюстрация теоремы Муавра–Лапласа.
Лайфхаки и полезные трюки
1. Первый вопрос всегда: «что здесь складывается?»
ЦПТ применима ровно тогда, когда интересующая тебя величина — сумма или среднее многих независимых слагаемых. Прежде чем искать формулы, найди слагаемые и убедись, что их много и они независимы. Если слагаемых не видно — ЦПТ, скорее всего, не при чём.
Пример: accuracy = среднее индикаторов «угадал/не угадал» → сумма есть, ЦПТ работает. Максимум лосса по батчу → это не сумма, а максимум, и у него совсем другая предельная теория (теория экстремальных значений, распределения Гумбеля и Фреше).
2. Прикидка «сколько сигм» за десять секунд.
Прежде чем открывать таблицу нормального распределения, посчитай, на сколько стандартных ошибок отстоит наблюдённое значение от ожидаемого. Дальше работают три числа, которые стоит помнить наизусть: $1\sigma \to 32\%$, $2\sigma \to 4{,}6\%$, $3\sigma \to 0{,}27\%$ (это двусторонние вероятности отклонения).
Пример: метрика упала с 0,74 до 0,72 при $\mathrm{SE} = 0{,}015$. Отклонение $0{,}02/0{,}015 = 1{,}33\sigma$ — то есть примерно 18% шансов получить такое или большее падение чисто случайно. Никакого инцидента нет, идём дальше.
3. Правило «вчетверо за вдвое».
Точность стоит квадратично: чтобы улучшить её вдвое, нужно вчетверо больше данных. Держи это в голове при планировании любого измерения — оно мгновенно отвечает на вопрос «а если добавим ещё немного данных?».
Пример: тест на 1000 объектов даёт интервал $\pm 2$ п.п. Хочешь $\pm 0{,}5$ п.п. — это в 4 раза уже, значит нужно в 16 раз больше объектов: 16 000. Если разметка стоит 20 рублей за объект, вопрос «а стоит ли» получает конкретный ценник в 320 тысяч.
4. Для доли — сразу $\sqrt{p(1-p)/n}$, и худший случай при $p = 0{,}5$.
Для accuracy, конверсии, CTR и любой другой доли стандартная ошибка считается без всякой выборочной дисперсии — прямо из $p$. А максимум $p(1-p) = 0{,}25$ достигается при $p = 0{,}5$, поэтому консервативная оценка сверху всегда $\mathrm{SE} \le 0{,}5/\sqrt n$.
Пример: «сколько нужно объектов, чтобы интервал был не шире $\pm 3$ п.п. при любом $p$?» Берём худший случай: $1{,}96 \cdot 0{,}5/\sqrt n \le 0{,}03 \Rightarrow \sqrt n \ge 32{,}67 \Rightarrow n \ge 1068$. Это и есть знаменитая «выборка в тысячу человек с погрешностью 3%», которую ты видел в каждом социологическом опросе.
5. Считай асимметрию, а не полагайся на правило тридцати.
Возьми выборочный коэффициент асимметрии своих данных, раздели на $\sqrt n$ и посмотри на результат. Если получилось меньше $0{,}2$ — нормальному приближению можно верить в центральной зоне. Если больше — либо увеличивай $n$, либо переходи к бутстрэпу.
Пример: данные о длительности сессий, $\gamma_1 = 4{,}5$, выборка $n = 200$. Остаточная асимметрия $4{,}5/\sqrt{200} = 0{,}32$ — многовато. Нужное $n$ находим из $4{,}5/\sqrt n \le 0{,}2$: $\sqrt n \ge 22{,}5$, то есть $n \ge 507$. Либо логарифмируй величину — логарифм длительностей обычно почти симметричен, и тогда двухсот наблюдений хватит с запасом.
6. Когда формулы для $\sigma$ нет — бери бутстрэп.
ЦПТ даёт готовую формулу только для средних и долей. Для медианы, для 95-го перцентиля латентности, для AUC, для отношения двух метрик аналитической формулы либо нет, либо она страшная. Рецепт: пересемплируй выборку с возвращением $B$ раз (обычно $B = 1000$), посчитай статистику на каждой копии и возьми перцентили полученного распределения — это и есть доверительный интервал.
Пример: нужен интервал для медианной латентности по 5000 замерам. Делаешь 1000 бутстрэп-выборок по 5000 элементов, считаешь 1000 медиан, берёшь их 2,5-й и 97,5-й перцентили. Десять строк кода вместо вывода асимптотики.
7. Единица анализа = единица независимости.
Перед любым расчётом стандартной ошибки спроси: что здесь по-настоящему независимо? Кадры одного видео — нет. Клики одного пользователя — нет. Запросы из одной минуты — скорее всего нет. Агрегируй метрику до уровня независимых единиц и считай $n$ по ним.
Пример: 50 000 предсказаний по 200 пациентам. Правильное $n$ — не 50 000, а 200. Стандартная ошибка вырастет в $\sqrt{250} \approx 15{,}8$ раза, и половина «значимых» находок из отчёта растворится. Лучше узнать это до публикации, чем после.
8. Проверяй хвосты симуляцией, а не верой.
Если ответ зависит от вероятности редкого события, не доверяй нормальному приближению — прогони симуляцию. Сгенерируй миллион сумм по $n$ слагаемых из своего распределения и посмотри эмпирическую долю превышений. Это пять строк кода и полная защита от того класса ошибок, где приближение промахивается в разы.
Пример: «какова вероятность, что суммарная нагрузка превысит ёмкость кластера?» Ответ $10^{-5}$ по нормальному приближению может на деле оказаться $10^{-3}$ — стократная разница, а решение о закупке железа принимается именно по этому числу.
Заключение
Смотри, что мы получили из одной теоремы. Универсальное объяснение, почему колокол встречается везде: почти всё, что мы измеряем, — это сумма многих мелких независимых вкладов, а сумма стирает форму слагаемых и оставляет только два числа. Формулу $\sigma/\sqrt n$, которая превращает «мы что-то измерили» в «мы измерили это с такой-то точностью». Расчёт размера A/B-теста, доверительный интервал для accuracy, объяснение шума в SGD, вывод коэффициентов инициализации He и Xavier, оценку ошибки квантования. Всё это — одна теорема, применённая семь раз.
И самое ценное, что стоит унести из урока, — это даже не формулы, а два вопроса, которые ты теперь задаёшь автоматически. Первый: что здесь складывается и правда ли слагаемые независимы? Второй: какова стандартная ошибка того числа, на которое я смотрю? Первый вопрос ловит подавляющее большинство ошибок в анализе данных — от кадров видео, выданных за независимые наблюдения, до моделей ипотечных рисков, обрушивших рынок в 2008-м. Второй превращает любую метрику из точки в интервал, и это сразу меняет разговор: «наша модель лучше на 1,2 п.п.» и «наша модель лучше на $1{,}2 \pm 2{,}4$ п.п.» — утверждения разного качества, и второе честнее.
Ты научился отличать сигнал от шума количественно, а не на глаз. В индустрии это редкий навык: формулу $\sigma/\sqrt n$ помнят все, но проверяют независимость наблюдений и считают асимметрию единицы — а именно там и живут дорогие ошибки.
В следующем уроке (242) мы возьмём вторую половину той же истории — закон больших чисел. ЦПТ рассказала, как среднее колеблется вокруг $\mu$; ЗБЧ докажет, что оно туда действительно приходит, причём в двух версиях — слабой и усиленной. Заодно закроется вопрос, ради которого всю теорию вероятностей когда-то и затевали: почему наблюдаемая частота события сходится к его вероятности, и почему обучение моделей на конечной выборке вообще имеет смысл.
💡 Совет: возьми любые свои данные — логи латентности, метрики моделей, что угодно — и посчитай для них две вещи: стандартную ошибку среднего и остаточную асимметрию $\gamma_1/\sqrt n$. Пять минут работы, а результат часто отрезвляет: половина «улучшений», которые ты фиксировал в экспериментах, окажется внутри одной стандартной ошибки. Это не повод расстраиваться — это повод начать измерять по-взрослому. Именно с этого места случайные наблюдения превращаются в доказательства.
Увидимся в уроке 242 — закон больших чисел ждёт. 🚀
Понял тему? Закрепи в боте! 🚀
Попрактикуйся на задачах и получи персональные рекомендации от AI
💪 Начать тренировку