Содержание

Каждое мнение важно

Создайте опрос и превратите обратную связь в источник роста

Создать сейчас
Лого WebAsk

Дисперсия (variance)

Дисперсия это средний квадрат отклонения значений от их среднего. Она измеряет разброс данных, но в квадратах исходных единиц, поэтому в отчёты обычно попадает не она сама, а её квадратный корень.

Тем не менее считать нужно именно дисперсию, и не только как промежуточный шаг. У неё есть свойство, которого нет ни у одной другой меры разброса: её можно складывать и разбивать на части. На этом стоит половина статистики опросов.

Что показывает дисперсия

Порядок расчёта простой. Находим среднее, у каждого значения берём отклонение от него, возводим отклонения в квадрат, усредняем. Полученное число и есть дисперсия, а корень из неё это стандартное отклонение.

Дисперсия живёт в квадратах единиц. Если вы меряли время в секундах, дисперсия окажется в квадратных секундах, а это величина, которую невозможно интерпретировать словами. Поэтому в отчёт идёт стандартное отклонение: оно в тех же секундах, что и данные.

Почему квадраты, а не модули

Вопрос законный: чтобы избавиться от знака отклонения, достаточно взять модуль, и получится среднее абсолютное отклонение, которое даже проще читается. Такая мера существует и применяется, например медиана абсолютных отклонений в поиске выбросов. Но у квадратов есть два преимущества, из-за которых стандартом стали именно они.

WebAsk · сервис опросов Проверьте это на своих данных Соберите ответы и посмотрите распределение — без выгрузок в Excel Создать опрос
  • Квадраты сильнее реагируют на крупные отклонения, а в задачах контроля качества именно крупные промахи важнее мелких
  • Дисперсии независимых величин складываются, а средние абсолютные отклонения нет
  • Не пытайтесь сравнивать дисперсию с модульными мерами напрямую: это разные шкалы, а не разные оценки одного и того же

Второй пункт и есть главный. Именно из него растут расчёт погрешности, центральная предельная теорема и вообще возможность что-то посчитать про сумму или среднее нескольких величин.

Почему в формуле стоит n − 1

Если вы считаете дисперсию по всей совокупности, знаменатель равен n. Если по выборке, в знаменателе появляется n − 1, и это не бюрократическая мелочь, а поправка на систематическую ошибку.

Причина в том, что отклонения считаются не от истинного среднего совокупности, которое вам неизвестно, а от среднего вашей же выборки. Выборочное среднее по определению лежит в центре именно этих данных, поэтому сумма квадратов от него всегда минимальна, а разброс получается заниженным.

Симуляция на 200 тысячах выборок: деление на n даёт 49,8% истинной дисперсии при двух наблюдениях, 79,9% при пяти, 90,1% при десяти и 96,7% при тридцати

Насколько занижается, легко увидеть на симуляции. Двести тысяч выборок из совокупности с известной дисперсией, и деление на n даёт в среднем ровно долю (n − 1) / n от истины: половину при двух наблюдениях, 80% при пяти, 90% при десяти, 96,7% при тридцати. Деление на n − 1 убирает смещение полностью при любом размере выборки. В литературе это называют поправкой Бесселя.

Практический вывод. На больших выборках разница между делением на n и на n − 1 незаметна, но на десяти наблюдениях это уже 10% разницы. Поэтому в отчёте полезно указывать, какую дисперсию вы считали, выборочную или генеральную: в Excel это разные функции, ДИСП.В и ДИСП.Г.

Дисперсию можно разложить

Вот свойство, ради которого дисперсию считают отдельно от стандартного отклонения. Общий разброс в данных раскладывается на две части: разброс внутри групп и разброс между группами. Складываются они точно, без остатка.

Оценки в трёх отделах: общая дисперсия 0,693 складывается из внутригрупповой 0,370 и межгрупповой 0,323, то есть 47% различий это различия между отделами

На примере это выглядит так. Три отдела оценили условия по пятибалльной шкале: продажи в среднем 4,50, поддержка 3,12, разработка 4,00. Общая дисперсия по всем ответам равна 0,693, и она распадается на 0,370 внутри отделов и 0,323 между отделами. То есть почти половина всех различий в оценках объясняется не характером людей, а тем, в каком отделе человек работает.

Ровно на этом разложении построен дисперсионный анализ: он берёт межгрупповую часть, делит на внутригрупповую и смотрит, достаточно ли велико отношение, чтобы считать различия между группами неслучайными. Название «анализ дисперсий» перестаёт быть загадкой, как только увидишь это разложение.

Дисперсия доли

Отдельный случай, который постоянно встречается в опросах: у вопроса всего два ответа, «да» и «нет». Тогда дисперсия считается не по формуле со квадратами, а прямо из доли: p умножить на (1 − p).

Доля ответивших «да»ДисперсияЧто это значит
10% или 90%0,09мнение почти единодушное, разброс маленький
30% или 70%0,21заметный раскол
50%0,25максимально возможный разброс

Из симметрии этой формулы следует практическое правило расчёта выборки. Максимум дисперсии приходится на долю 50%, поэтому, когда ожидаемую долю заранее не знают, в расчёт размера выборки подставляют именно 50%: это худший случай, и полученного объёма точно хватит.

Дисперсия суммы и разности

Складывать дисперсии можно, и это работает не только для суммы, но и для разности. Отсюда следует неочевидная вещь: у разности двух величин разброс не гасится, а накапливается.

Показательный пример это NPS. Индекс равен доле промоутеров минус доля критиков. Допустим, промоутеров 50%, критиков 20%. Дисперсия доли промоутеров равна 0,25, критиков 0,16, а дисперсия их разности получается 0,61, то есть больше суммы двух частей. Причина в том, что промоутеры и критики взаимно исключают друг друга, и эта связь добавляет разброса, а не убирает.

Вот почему у составных показателей вроде NPS погрешность заметно больше, чем у простой доли на той же выборке. Считая интервал для индекса, нельзя брать формулу для доли, нужна формула для разности.

Как объединять дисперсии разных групп

Частая ошибка при сведении данных: посчитать дисперсию в каждой группе и взять среднее этих дисперсий. Так делать нельзя, потому что группы разного размера, и большая группа должна весить больше.

Возьмите две группы: сорок ответов с дисперсией 0,25 и восемь ответов с дисперсией 0,50. Правильная объединённая дисперсия с учётом весов равна 0,288. Наивное среднее двух чисел даёт 0,375, то есть завышение на 30% из-за того, что маленькая шумная группа получила такой же вес, как большая.

Правило простое: объединяя разброс, взвешивайте по числу наблюдений, а не по числу групп. Это же правило стоит за t-тестом для двух выборок разного размера.

Чего дисперсия не показывает

  • Ничего в понятных единицах. Квадратные секунды и квадратные рубли не имеют смысла на словах, поэтому дисперсию не показывают заказчику. Её роль вычислительная.
  • Ничего про форму распределения. Два набора данных с одинаковой дисперсией могут выглядеть совершенно по-разному: один симметричный, другой с длинным хвостом. Для формы смотрят квартили и гистограмму.
  • Устойчивости к выбросам. Квадраты усиливают крайние значения, поэтому одно аномальное наблюдение способно раздуть дисперсию в разы. Если такое возможно, рядом считают межквартильный размах.
  • Сравнимости между метриками. Дисперсия времени и дисперсия суммы чека несравнимы. Для этого есть коэффициент вариации, безразмерный по построению.
  • Того, что нулевая дисперсия это хорошо. Ноль означает, что все ответили одинаково, и в опросах это чаще признак проблемы: вопрос сформулирован так, что другого ответа не подразумевает.

Дисперсия и соседние меры разброса

МераЕдиницыГлавное свойство
Дисперсияквадраты исходныхскладывается и раскладывается на части
Стандартное отклонениекак у данныхчитается словами, идёт в отчёт
Коэффициент вариациипроцентысравнивает метрики разного масштаба
Межквартильный размахкак у данныхне боится выбросов
Размахкак у данныхпоказывает только края
Дескриптивный анализ: как описать данные опроса

Как это сделано в WebAsk

Числовые и шкальные ответы выгружаются в Excel или CSV, и дальше дисперсия считается одной функцией: ДИСП.В для выборки, ДИСП.Г для полной совокупности. Если нужен разброс в понятных единицах, возьмите калькулятор стандартного отклонения, он посчитает и дисперсию по пути.

Практический сценарий, где разложение дисперсии окупается: опрос сотрудников по подразделениям. Считаете общий разброс оценок, потом смотрите, какая его часть приходится на различия между подразделениями. Если межгрупповая часть велика, работать надо с конкретными командами, а не с компанией в целом. Значимость такого расхождения проверяет ANOVA.

Собрать данные можно бесплатно: заведите числовой или шкальный вопрос в конструкторе WebAsk, разметьте респондентов по группам скрытой переменной и посмотрите, где разброс больше.

Частые вопросы

Что такое дисперсия простыми словами?

Это средний квадрат того, насколько значения отклоняются от своего среднего. Чем больше дисперсия, тем сильнее ответы разбросаны. Читать её напрямую неудобно, потому что она в квадратах единиц, поэтому обычно берут корень и получают стандартное отклонение.

Чем дисперсия отличается от стандартного отклонения?

Только возведением в квадрат. Стандартное отклонение это корень из дисперсии, и оно измеряется в тех же единицах, что данные. Дисперсия нужна там, где идут вычисления, а стандартное отклонение там, где нужно объяснить результат человеку.

Почему в формуле делят на n − 1, а не на n?

Потому что отклонения считаются от выборочного среднего, а не от истинного, и поэтому разброс получается заниженным. Симуляция показывает величину смещения: при пяти наблюдениях деление на n даёт всего 80% истинной дисперсии, при десяти 90%. Деление на n − 1 убирает это смещение.

Когда делить на n всё-таки правильно?

Когда у вас на руках не выборка, а вся совокупность целиком: все сотрудники компании, все заказы за месяц. Тогда среднее известно точно, поправка не нужна, и в Excel для этого есть отдельная функция ДИСП.Г.

Что значит разложение дисперсии?

Что общий разброс можно разделить на разброс внутри групп и разброс между группами, причём точно, без остатка. В примере с тремя отделами общая дисперсия 0,693 распалась на 0,370 внутри отделов и 0,323 между ними, то есть 47% различий связаны с принадлежностью к отделу.

Чему равна дисперсия доли?

Произведению доли на единицу минус доля. При доле 50% дисперсия максимальна и равна 0,25, при 10% всего 0,09. Именно поэтому в расчёте размера выборки при неизвестной доле подставляют 50%: это худший случай по разбросу.

Может ли дисперсия быть отрицательной?

Нет. Это сумма квадратов, делённая на положительное число, поэтому она либо положительна, либо равна нулю. Ноль означает, что все значения совпали, и в опросах это скорее сигнал проверить формулировку вопроса, чем повод радоваться согласию.

0

Каждое мнение важно

Создайте опрос и превратите обратную связь в источник роста

Создать сейчас