Центральная предельная теорема (ЦПТ, central limit theorem)
28 августа 2026 Время чтения ≈ 10 мин.
Центральная предельная теорема говорит, что средние по выборкам ведут себя предсказуемо даже тогда, когда сами данные распределены как угодно криво. С ростом размера выборки распределение средних приближается к нормальному, а его разброс сжимается как корень из числа наблюдений.
Это то, на чём стоит вся практика опросов. Именно поэтому по тысяче ответов можно говорить о миллионе людей, и именно поэтому у оценки есть погрешность, а не просто «примерно так».
Что именно утверждает теорема
Возьмите генеральную совокупность с каким-то средним и каким-то разбросом. Наберите из неё выборку размера n, посчитайте среднее. Повторите это много раз: получится набор разных средних, у которого есть своё распределение. Теорема описывает именно его, а не сами данные.
У теоремы два условия, о которых обычно молчат. Наблюдения должны быть независимыми, то есть один респондент не должен влиять на ответ другого. И у совокупности должна быть конечная дисперсия: если разброс бесконечен, никакого выпрямления не произойдёт, сколько бы данных вы ни собрали.
Что происходит на самом деле
Проще один раз увидеть. Возьмём заведомо кривые данные: время на сайте, где среднее 100 секунд, а медиана всего 70, потому что большинство уходит быстро, а редкие посетители сидят подолгу. Наберём из этой совокупности по 20 тысяч выборок разного размера и посмотрим на распределение средних.
При выборке из одного наблюдения распределение средних это просто распределение самих данных: круто падающая кривая со скошенностью 1,92. При пяти наблюдениях уже проглядывает горб, скошенность 0,87. При тридцати перед нами почти симметричный узкий колокол со скошенностью 0,35.
Закон корня из n
Вторая половина теоремы важнее первой, потому что именно она стоит в счёте за исследование. Разброс средних равен разбросу данных, делённому на корень из размера выборки, и это та самая стандартная ошибка.
Корень в знаменателе означает, что точность дорожает нелинейно. Сто ответов дают ошибку в десять секунд. Чтобы сжать её вдвое, нужно не двести ответов, а четыреста. Ещё вдвое это уже тысяча шестьсот. Отсюда и практическое правило исследователей: первые несколько сотен ответов покупают почти всю точность, а дальше каждый шаг стоит вчетверо дороже предыдущего. Прикинуть нужный объём можно калькулятором размера выборки.
Правило тридцати наблюдений и когда оно врёт
Ходовой ориентир гласит: от тридцати наблюдений нормальное приближение уже работает. Ориентир удобный, но это именно ориентир, а не порог из теоремы. Скорость выпрямления зависит от того, насколько крива исходная совокупность.
- Для симметричных данных вроде оценок по шкале тридцати наблюдений обычно достаточно
- Для скошенных величин, где среднее заметно выше медианы, берите от сотни
- Не применяйте нормальное приближение к редким событиям: при доле 1% нужно около тысячи ответов, иначе на успехи придётся единицы наблюдений
- Не полагайтесь на теорему, если наблюдения зависимы: повторные ответы одних людей, кластеры внутри отделов, семьи в одной квартире
Есть и совсем патологический случай. Для распределений с бесконечной дисперсией, например распределения Коши, теорема просто не выполняется: среднее по тысяче наблюдений ведёт себя так же дико, как единственное наблюдение. В опросах такое почти не встречается, но знать полезно, потому что это показывает, что теорема не универсальное заклинание, а утверждение с условиями.
Для долей правило другое
Всё сказанное выше про среднее. Но в опросах чаще смотрят не на средние, а на доли: сколько процентов выбрали вариант, сколько промоутеров, какая конверсия. Приближение работает и для долей, только условие формулируется иначе: в выборке должно быть хотя бы около десяти наблюдений в каждой из двух групп, и «да», и «нет».
| Ожидаемая доля | Минимум ответов | Почему |
|---|---|---|
| 50% | 20 | обе группы наполняются быстро |
| 20% | 50 | меньшая группа набирает десяток |
| 5% | 200 | редкий вариант нужно чем-то наполнить |
| 1% | 1000 | иначе на «да» приходятся единицы |
Вот почему нельзя измерить долю в один процент на сотне ответов. Формально среднее посчитается, но нормальное приближение к нему неприменимо, и погрешность окажется совсем не такой, как обещает формула.
Что это значит для NPS
Хороший пример того, как теорема отрезвляет. Допустим, у вас 50% промоутеров и 20% критиков, то есть NPS равен 30 пунктам. Индекс это разность двух долей, и разброс у него больше, чем у каждой из них по отдельности.
То есть NPS = 30, посчитанный на сотне ответов, честно означает «где-то между 15 и 45». Именно поэтому сравнение волн вида «было 30, стало 36, мы выросли» на небольших выборках почти всегда разговор о шуме.
Когда интервал выходит за пределы возможного
Есть простой способ проверить, достаточно ли у вас данных для нормальной формулы: посмотреть, не вылезает ли интервал за границы, которые физически возможны.
В нашем примере со временем на сайте при одном наблюдении формула даёт интервал от минус 96 до 296 секунд. Отрицательного времени не бывает, и это прямой сигнал, что приближение к таким данным пока неприменимо. То же самое случается с долями около нуля и со шкалами: если интервал для средней оценки по пятибалльной шкале выходит за пятёрку, формулу применили рано.
Чего теорема не обещает
- Она не делает ваши данные нормальными. Распределение ответов останется таким же кривым, каким было. Выпрямляется распределение средних, и именно поэтому средним можно пользоваться там, где сами данные несимметричны.
- Она ничего не говорит про один замер. Теорема описывает, как ведёт себя оценка при многократном повторении. У вас есть только одна выборка, и она может оказаться неудачной, поэтому рядом со средним всегда идёт интервал.
- Она не спасает от смещения выборки. Это главное. Теорема уменьшает случайный шум, но систематическую ошибку она не лечит: если анкету заполнили только самые лояльные клиенты, рост числа ответов сделает неверную оценку лишь более уверенной. Про это есть карточка про репрезентативность.
- Она не про медиану и не про доли крайних ответов. Для них есть свои приближения и свои формулы погрешности, а нормальная формула для среднего к ним не применяется напрямую.
Среднему верить можно
Данные симметричны или выборка большая, интервал не выходит за возможные границы, наблюдения независимы.
Лучше медиана и квартили
Сильная скошенность и малая выборка, крупные выбросы, порядковая шкала, где расстояния между вариантами условны.
Не путать с законом больших чисел
Эти два утверждения постоянно смешивают, хотя они отвечают на разные вопросы. Закон больших чисел говорит, куда сходится среднее: с ростом выборки оно приближается к истинному значению. Центральная предельная теорема говорит, как именно распределены отклонения от этого истинного значения по пути.
Практическая разница простая. Из закона больших чисел следует, что собирать больше ответов полезно. Из центральной предельной теоремы следует, насколько именно полезно и какой интервал вокруг оценки честно нарисовать.
ЦПТ и соседние понятия
| Понятие | На какой вопрос отвечает |
|---|---|
| Центральная предельная теорема | как распределены выборочные средние |
| Закон больших чисел | куда сходится среднее с ростом выборки |
| Нормальное распределение | какая форма получается в пределе |
| Стандартная ошибка | насколько велик разброс самой оценки |
| Доверительный интервал | в каких границах лежит истинное значение |
| Размер выборки | сколько ответов нужно для нужной точности |
Отдельно про малые выборки. Когда наблюдений мало и разброс совокупности неизвестен, вместо нормального распределения берут распределение Стьюдента, у которого хвосты толще. Это ровно та поправка на неуверенность, из которой вырос t-тест, и по мере роста выборки она сходит на нет.
Как это сделано в WebAsk
В интерфейсе теоремы нет, зато она стоит за каждым числом в отчёте. Когда вы смотрите среднюю оценку по вопросу, вы смотрите на оценку неизвестного истинного среднего, и у неё есть погрешность. Практический порядок работы такой: прикинуть объём выборки калькулятором до сбора, собрать ответы, посчитать среднее и рядом доверительный интервал.
Если данные скошены, а такое бывает со временем прохождения и суммами, показывайте рядом со средним медиану и квартили. Среднее останется корректной оценкой, но читателю отчёта полезно видеть, что типичный респондент выглядит иначе.
Проверить всё это можно на своих данных бесплатно: соберите опрос в конструкторе WebAsk, выгрузите числовой столбец и посмотрите, как ведёт себя среднее по мере роста числа ответов.
Частые вопросы
Что говорит центральная предельная теорема простыми словами?
Что средние ведут себя аккуратно даже там, где сами данные разбросаны криво. Если много раз брать выборку и считать среднее, эти средние соберутся в симметричный колокол вокруг истинного значения, а его ширина будет тем меньше, чем больше выборка.
Зачем она нужна на практике?
Из неё следуют доверительные интервалы, расчёт размера выборки и все тесты на сравнение средних. Без неё нельзя было бы сказать, что среднее по тысяче ответов лежит в таком-то диапазоне: сама идея погрешности выборки опирается на эту теорему.
Правда ли, что нужно минимум тридцать наблюдений?
Это ориентир, а не требование теоремы. Для симметричных данных тридцати обычно достаточно, для скошенных мало: на нашем примере со временем на сайте при тридцати наблюдениях скошенность средних всё ещё 0,35. Для денег и времени отклика берите от сотни.
Делает ли теорема мои данные нормальными?
Нет, и это самое частое заблуждение. Распределение ответов остаётся таким, какое оно есть. Нормальным становится распределение выборочных средних, то есть поведение оценки, а не поведение данных.
Почему точность растёт как корень, а не пропорционально?
Потому что при усреднении случайные отклонения частично гасят друг друга, и выигрыш накапливается медленнее, чем растёт число слагаемых. Отсюда практический вывод: чтобы уменьшить погрешность вдвое, нужно вчетверо больше ответов.
Поможет ли большая выборка, если анкету заполнили не те люди?
Нет. Теорема борется со случайным шумом, а не с систематическим перекосом. Если отвечали в основном лояльные клиенты, увеличение выборки просто сделает смещённую оценку более уверенной. Лечится это дизайном выборки, а не её размером.
Чем ЦПТ отличается от закона больших чисел?
Закон больших чисел отвечает на вопрос «куда»: среднее сходится к истинному значению. Центральная предельная теорема отвечает на вопрос «как»: она описывает форму и ширину распределения отклонений вокруг него. Первое обещает, что собирать данные полезно, второе позволяет посчитать, насколько.
Опубликовано 28 августа 2026
Алексей Логинов 
