Дисперсия (variance)
28 августа 2026 Время чтения ≈ 10 мин.
Дисперсия это средний квадрат отклонения значений от их среднего. Она измеряет разброс данных, но в квадратах исходных единиц, поэтому в отчёты обычно попадает не она сама, а её квадратный корень.
Тем не менее считать нужно именно дисперсию, и не только как промежуточный шаг. У неё есть свойство, которого нет ни у одной другой меры разброса: её можно складывать и разбивать на части. На этом стоит половина статистики опросов.
Что показывает дисперсия
Порядок расчёта простой. Находим среднее, у каждого значения берём отклонение от него, возводим отклонения в квадрат, усредняем. Полученное число и есть дисперсия, а корень из неё это стандартное отклонение.
Почему квадраты, а не модули
Вопрос законный: чтобы избавиться от знака отклонения, достаточно взять модуль, и получится среднее абсолютное отклонение, которое даже проще читается. Такая мера существует и применяется, например медиана абсолютных отклонений в поиске выбросов. Но у квадратов есть два преимущества, из-за которых стандартом стали именно они.
- Квадраты сильнее реагируют на крупные отклонения, а в задачах контроля качества именно крупные промахи важнее мелких
- Дисперсии независимых величин складываются, а средние абсолютные отклонения нет
- Не пытайтесь сравнивать дисперсию с модульными мерами напрямую: это разные шкалы, а не разные оценки одного и того же
Второй пункт и есть главный. Именно из него растут расчёт погрешности, центральная предельная теорема и вообще возможность что-то посчитать про сумму или среднее нескольких величин.
Почему в формуле стоит n − 1
Если вы считаете дисперсию по всей совокупности, знаменатель равен n. Если по выборке, в знаменателе появляется n − 1, и это не бюрократическая мелочь, а поправка на систематическую ошибку.
Причина в том, что отклонения считаются не от истинного среднего совокупности, которое вам неизвестно, а от среднего вашей же выборки. Выборочное среднее по определению лежит в центре именно этих данных, поэтому сумма квадратов от него всегда минимальна, а разброс получается заниженным.
Насколько занижается, легко увидеть на симуляции. Двести тысяч выборок из совокупности с известной дисперсией, и деление на n даёт в среднем ровно долю (n − 1) / n от истины: половину при двух наблюдениях, 80% при пяти, 90% при десяти, 96,7% при тридцати. Деление на n − 1 убирает смещение полностью при любом размере выборки. В литературе это называют поправкой Бесселя.
Дисперсию можно разложить
Вот свойство, ради которого дисперсию считают отдельно от стандартного отклонения. Общий разброс в данных раскладывается на две части: разброс внутри групп и разброс между группами. Складываются они точно, без остатка.
На примере это выглядит так. Три отдела оценили условия по пятибалльной шкале: продажи в среднем 4,50, поддержка 3,12, разработка 4,00. Общая дисперсия по всем ответам равна 0,693, и она распадается на 0,370 внутри отделов и 0,323 между отделами. То есть почти половина всех различий в оценках объясняется не характером людей, а тем, в каком отделе человек работает.
Ровно на этом разложении построен дисперсионный анализ: он берёт межгрупповую часть, делит на внутригрупповую и смотрит, достаточно ли велико отношение, чтобы считать различия между группами неслучайными. Название «анализ дисперсий» перестаёт быть загадкой, как только увидишь это разложение.
Дисперсия доли
Отдельный случай, который постоянно встречается в опросах: у вопроса всего два ответа, «да» и «нет». Тогда дисперсия считается не по формуле со квадратами, а прямо из доли: p умножить на (1 − p).
| Доля ответивших «да» | Дисперсия | Что это значит |
|---|---|---|
| 10% или 90% | 0,09 | мнение почти единодушное, разброс маленький |
| 30% или 70% | 0,21 | заметный раскол |
| 50% | 0,25 | максимально возможный разброс |
Из симметрии этой формулы следует практическое правило расчёта выборки. Максимум дисперсии приходится на долю 50%, поэтому, когда ожидаемую долю заранее не знают, в расчёт размера выборки подставляют именно 50%: это худший случай, и полученного объёма точно хватит.
Дисперсия суммы и разности
Складывать дисперсии можно, и это работает не только для суммы, но и для разности. Отсюда следует неочевидная вещь: у разности двух величин разброс не гасится, а накапливается.
Показательный пример это NPS. Индекс равен доле промоутеров минус доля критиков. Допустим, промоутеров 50%, критиков 20%. Дисперсия доли промоутеров равна 0,25, критиков 0,16, а дисперсия их разности получается 0,61, то есть больше суммы двух частей. Причина в том, что промоутеры и критики взаимно исключают друг друга, и эта связь добавляет разброса, а не убирает.
Как объединять дисперсии разных групп
Частая ошибка при сведении данных: посчитать дисперсию в каждой группе и взять среднее этих дисперсий. Так делать нельзя, потому что группы разного размера, и большая группа должна весить больше.
Возьмите две группы: сорок ответов с дисперсией 0,25 и восемь ответов с дисперсией 0,50. Правильная объединённая дисперсия с учётом весов равна 0,288. Наивное среднее двух чисел даёт 0,375, то есть завышение на 30% из-за того, что маленькая шумная группа получила такой же вес, как большая.
Правило простое: объединяя разброс, взвешивайте по числу наблюдений, а не по числу групп. Это же правило стоит за t-тестом для двух выборок разного размера.
Чего дисперсия не показывает
- Ничего в понятных единицах. Квадратные секунды и квадратные рубли не имеют смысла на словах, поэтому дисперсию не показывают заказчику. Её роль вычислительная.
- Ничего про форму распределения. Два набора данных с одинаковой дисперсией могут выглядеть совершенно по-разному: один симметричный, другой с длинным хвостом. Для формы смотрят квартили и гистограмму.
- Устойчивости к выбросам. Квадраты усиливают крайние значения, поэтому одно аномальное наблюдение способно раздуть дисперсию в разы. Если такое возможно, рядом считают межквартильный размах.
- Сравнимости между метриками. Дисперсия времени и дисперсия суммы чека несравнимы. Для этого есть коэффициент вариации, безразмерный по построению.
- Того, что нулевая дисперсия это хорошо. Ноль означает, что все ответили одинаково, и в опросах это чаще признак проблемы: вопрос сформулирован так, что другого ответа не подразумевает.
Дисперсия и соседние меры разброса
| Мера | Единицы | Главное свойство |
|---|---|---|
| Дисперсия | квадраты исходных | складывается и раскладывается на части |
| Стандартное отклонение | как у данных | читается словами, идёт в отчёт |
| Коэффициент вариации | проценты | сравнивает метрики разного масштаба |
| Межквартильный размах | как у данных | не боится выбросов |
| Размах | как у данных | показывает только края |
Как это сделано в WebAsk
Числовые и шкальные ответы выгружаются в Excel или CSV, и дальше дисперсия считается одной функцией: ДИСП.В для выборки, ДИСП.Г для полной совокупности. Если нужен разброс в понятных единицах, возьмите калькулятор стандартного отклонения, он посчитает и дисперсию по пути.
Практический сценарий, где разложение дисперсии окупается: опрос сотрудников по подразделениям. Считаете общий разброс оценок, потом смотрите, какая его часть приходится на различия между подразделениями. Если межгрупповая часть велика, работать надо с конкретными командами, а не с компанией в целом. Значимость такого расхождения проверяет ANOVA.
Собрать данные можно бесплатно: заведите числовой или шкальный вопрос в конструкторе WebAsk, разметьте респондентов по группам скрытой переменной и посмотрите, где разброс больше.
Частые вопросы
Что такое дисперсия простыми словами?
Это средний квадрат того, насколько значения отклоняются от своего среднего. Чем больше дисперсия, тем сильнее ответы разбросаны. Читать её напрямую неудобно, потому что она в квадратах единиц, поэтому обычно берут корень и получают стандартное отклонение.
Чем дисперсия отличается от стандартного отклонения?
Только возведением в квадрат. Стандартное отклонение это корень из дисперсии, и оно измеряется в тех же единицах, что данные. Дисперсия нужна там, где идут вычисления, а стандартное отклонение там, где нужно объяснить результат человеку.
Почему в формуле делят на n − 1, а не на n?
Потому что отклонения считаются от выборочного среднего, а не от истинного, и поэтому разброс получается заниженным. Симуляция показывает величину смещения: при пяти наблюдениях деление на n даёт всего 80% истинной дисперсии, при десяти 90%. Деление на n − 1 убирает это смещение.
Когда делить на n всё-таки правильно?
Когда у вас на руках не выборка, а вся совокупность целиком: все сотрудники компании, все заказы за месяц. Тогда среднее известно точно, поправка не нужна, и в Excel для этого есть отдельная функция ДИСП.Г.
Что значит разложение дисперсии?
Что общий разброс можно разделить на разброс внутри групп и разброс между группами, причём точно, без остатка. В примере с тремя отделами общая дисперсия 0,693 распалась на 0,370 внутри отделов и 0,323 между ними, то есть 47% различий связаны с принадлежностью к отделу.
Чему равна дисперсия доли?
Произведению доли на единицу минус доля. При доле 50% дисперсия максимальна и равна 0,25, при 10% всего 0,09. Именно поэтому в расчёте размера выборки при неизвестной доле подставляют 50%: это худший случай по разбросу.
Может ли дисперсия быть отрицательной?
Нет. Это сумма квадратов, делённая на положительное число, поэтому она либо положительна, либо равна нулю. Ноль означает, что все значения совпали, и в опросах это скорее сигнал проверить формулировку вопроса, чем повод радоваться согласию.
Опубликовано 28 августа 2026
Алексей Логинов 
