Содержание

Не с чистого листа

Возьмите готовую анкету и поправьте под себя

Выбрать шаблон
Лого WebAsk

Доверительный интервал

Доверительный интервал это диапазон, в котором с заданной уверенностью лежит истинное значение показателя по всей совокупности. Он превращает одну цифру из отчёта в честное утверждение о том, насколько эта цифра точна.

Что такое доверительный интервал

В отчёте написано: «доля готовых рекомендовать составила 72%». Руководитель спрашивает, значит ли это ровно 72% у всех клиентов. Честный ответ отрицательный: опрошена выборка, и одна точка не передаёт неопределённость. Корректная формулировка звучит иначе: истинная доля с высокой уверенностью лежит между 68% и 76%.

Этот диапазон и называется доверительным интервалом. Точечная оценка по выборке стоит внутри него, а ширина показывает, сколько разброса мы допускаем из-за того, что опросили не всех, а часть.

Одна и та же доля 72 процента при выборках 100, 400 и 1000 человек даёт интервалы разной ширины

Отсюда важное: сама цифра «72%» без числа ответов почти ничего не сообщает. При сотне ответов она означает «где-то от двух третей до четырёх пятых», при тысяче уже вполне определённую величину.

Что означает уровень доверия 95%

Здесь сидит самая распространённая ошибка, и она встречается даже в учебных материалах.

WebAsk · сервис опросов Спросите свою аудиторию Готовые шаблоны, ветвления по ответам и отчёты — опрос собирается за пару минут Выбрать шаблон

Сорок смоделированных доверительных интервалов вокруг истинной доли 50 процентов, один из них истину не накрыл

Уровень доверия 95% не означает, что истинное значение лежит в вашем интервале с вероятностью 95%. Он означает другое: если многократно повторять опрос на новых случайных выборках того же размера и каждый раз строить такой интервал, примерно 95% построенных интервалов накроют неизвестное истинное значение.

Различие тонкое, но принципиальное: вероятность относится к методу, а не к одному уже построенному интервалу. Для конкретного интервала истина либо внутри, либо нет, и никакой вероятности тут уже не осталось.

На картинке выше это видно наглядно. Сорок смоделированных опросов по 400 человек при истинной доле 50%, и у каждого свой интервал. Тридцать девять накрыли истину, один нет. Промахнувшийся ничем не отличается от остальных изнутри. По одному интервалу понять, повезло вам или нет, невозможно.

Чем выше уровень доверия, тем шире интервал

Уровень доверия это не бесплатная надёжность, а размен. При тех же данных 99% даёт более широкий диапазон, чем 95%, а 90% более узкий.

Уровень доверияКогда берут
90%разведочные и скрининговые замеры, где допустимо больше промахов
95%обычный выбор в прикладных опросах, компромисс точности и ширины
99%когда цена ошибки высока: медицина, регуляторные требования

Важнее самого выбора то, что уровень фиксируется один раз в методологии. Менять его после того, как результат посчитан, нельзя: так подгоняют вывод под желаемый.

Четыре ошибки при чтении интервала

Читать вероятность как свойство своего интервала. «Истина здесь с вероятностью 95%» это неверная формулировка, и почему, разобрано выше.

Сравнивать только точечные оценки. «В прошлом месяце было 60%, сейчас 64%, значит стало лучше» без учёта ширины интервалов вводит в заблуждение. При погрешности около четырёх пунктов оба числа могут описывать одно и то же положение дел.

Забывать про размер подгруппы. Выборка из 1000 человек даёт узкий интервал по всему опросу, но подгруппа из 50 респондентов внутри неё даёт очень широкий. Выводы по сегментам надо делать с учётом их собственного размера, а не размера всей выборки.

Считать интервал доказательством различия. Если интервалы двух групп не перекрываются, различие есть с большим запасом. А вот перекрытие само по себе не доказывает, что различия нет: это повод посчитать статистическую значимость, а не готовый вывод.

Узкий интервал не значит верный результат

Это ограничение метода забывают чаще всего. А оно важнее всех тонкостей интерпретации.

Четыре мишени: узкий и верный результат, узкий и неверный, широкий и верный, широкий и неверный

Доверительный интервал считает только случайную ошибку, связанную с тем, что опрошена часть, а не все. Систематические смещения он не видит вовсе: ни того, что в выборку попали не те люди, ни того, что ответили далеко не все приглашённые, ни того, что формулировка вопроса подталкивала к ответу.

Отсюда неприятное следствие. Опросите 5000 своих активных пользователей, и интервал станет очень узким. Но узким он будет вокруг неверного числа, потому что активные пользователи это не все клиенты. Узкий интервал при плохой репрезентативности создаёт ложное чувство точности.

Разбор систематических смещений и их видов лежит в отдельном материале про отклонения в опросах.

Интервалы для средних и разниц

В опросах чаще всего говорят про интервалы для долей: сколько процентов выбрали вариант. Но тем же способом описывают неопределённость и других оценок.

  • для среднего: например, для средней оценки по шкале от 1 до 10
  • для разницы между двумя средними, когда сравниваете две группы
  • для доли внутри сегмента, и он будет шире, чем по всей выборке
  • для медианы и процентилей формулы другие, обычными не считайте

Логика везде одна: точечная оценка плюс диапазон неопределённости, зависящий от объёма данных и выбранного уровня доверия. Для среднего в расчёт входит ещё и разброс ответов: чем сильнее ответы разбросаны, тем шире интервал при том же числе респондентов.

Как его посчитать для доли

Для доли расчёт короткий. Берётся полученная доля, к ней прибавляется и от неё отнимается погрешность:

погрешность = z * корень( p * (1 - p) / n )

p  доля в выборке, например 0,5
n  число ответов
z  1,96 при уровне доверия 95%
   1,64 при 90%
   2,58 при 99%

Проверим на числах при доле 50% и уровне доверия 95%. Сто ответов дают погрешность около 9,8 пункта, то есть интервал примерно от 40% до 60%. Четыреста ответов сужают его до 45–55%, тысяча до 47–53%.

Кривая зависимости погрешности от числа ответов с отметками на 100, 400 и 1000

Из кривой видно главное свойство: чтобы сузить интервал вдвое, ответов нужно вчетверо больше, потому что их число стоит под корнем. Кривая быстро выполаживается, и это делает погоню за узким интервалом дорогой.

Ещё одна деталь из формулы: разброс максимален при доле около 50% и уменьшается к краям. При доле 90% интервал при том же числе ответов будет уже, чем при 50%. Поэтому планировать выборку принято по худшему случаю, то есть по 50%.

Связь с погрешностью и размером выборки

В отчётах интервал часто пишут короткой формой: «72% ± 4%». Половина ширины интервала это и есть погрешность выборки.

Ширина зависит от числа ответов: чем их больше, тем интервал уже при том же уровне доверия. Зависимость не линейная, поэтому удвоение выборки не сужает интервал вдвое. Как под нужную погрешность подобрать объём выборки, с формулой и таблицей, разобрано в отдельной статье.

Размер выборки и доверительный интервал для опросов Погрешность выборки (Margin of Error)

Как это сделано в WebAsk

Сводки и проценты по ответам считаются в отчётах, а расчёт интервалов встроен не везде. Для строгой отчётности ответы выгружаются в CSV или XLSX через отчёты и ответы, и интервал считается в таблице или статистическом пакете.

Практически полезнее другое: фильтры и разбивка по сегментам в отчётах сразу показывают, где ответов мало. Именно эти места в отчёте и надо сопровождать оговоркой о точности, потому что там интервал самый широкий, а выводы по ним делают так же уверенно, как по всей выборке.

Коротко

  • Доверительный интервал показывает диапазон, в котором лежит истинное значение, а не точность одной цифры.
  • Уровень доверия 95% относится к методу: примерно 95% таких интервалов накрывают истину при повторении опроса.
  • Для одного построенного интервала вероятности нет: истина либо внутри, либо нет.
  • Чем выше уровень доверия, тем шире интервал. Уровень фиксируют заранее.
  • Интервал учитывает только случайную ошибку выборки и не видит смещений.
  • Подгруппы требуют отдельного интервала: по 50 ответам он широкий, даже если вся выборка велика.

Вопросы и ответы

Что означает доверительный интервал 95%?

Что при многократном повторении опроса на новых случайных выборках примерно 95% построенных интервалов накроют истинное значение. Про ваш конкретный интервал это ничего не говорит: истина в нём либо есть, либо нет, вероятности здесь уже не осталось.

Какой уровень доверия выбрать?

В прикладных опросах обычно 95%. Уровень 99% берут, когда цена ошибки высока, и платят за это более широким интервалом. Уровень 90% годится для разведочных замеров. Главное зафиксировать выбор до расчёта, а не после.

Если интервалы двух групп перекрываются, различия нет?

Не обязательно. Отсутствие перекрытия говорит о различии с запасом, а перекрытие само по себе ничего не доказывает. В этом случае нужно посчитать статистическую значимость различия, а не делать вывод по картинке.

Можно ли построить интервал для средней оценки, а не для доли?

Да, и это частый случай: например, для средней оценки по шкале от 1 до 10. Логика та же, но в расчёт входит разброс ответов: чем он больше, тем шире интервал при том же числе респондентов. Для медиан и процентилей формулы другие.

Интервал узкий, значит результат точный?

Нет. Узкий интервал означает малую случайную ошибку, и только её. Если выборка смещена, например опрошены одни активные пользователи, интервал будет узким вокруг неверного числа. Точность и репрезентативность это разные вещи.

3

Не с чистого листа

Возьмите готовую анкету и поправьте под себя

Выбрать шаблон