Содержание

Опрос, который дочитывают

Готовые шаблоны, ветвления по ответам и отчёты — в одном месте

Создать опрос Есть бесплатный тариф
Лого WebAsk

Хи-квадрат (χ², критерий Пирсона, Chi-square test)

Критерий хи-квадрат отвечает на один вопрос: перекос в ваших данных похож на реальную связь или на обычный разброс. За этим названием стоят сразу три теста, и в опросах обычно имеют в виду один из них.

Как тест применяют на живых данных, со сквозным примером на числах и разбором готовой выгрузки, показано в статье Хи-квадрат по данным опроса. Ниже про сам термин.

Что проверяет хи-квадрат

Данные для теста сводят в таблицу сопряжённости, где стоит количество людей, выбравших каждую пару вариантов. Тест сравнивает эту таблицу с той, которая получилась бы при полном отсутствии связи между вопросами. Числа из ваших данных зовут наблюдаемыми частотами, числа из воображаемой таблицы ожидаемыми, а расхождение собирают в одну сумму по всем ячейкам: χ² = Σ (O − E)² / E, где O это наблюдаемая частота, E ожидаемая.

В формуле работает не только разность, но и делитель. Каждое расхождение делится на ожидаемую частоту, поэтому одинаковый по величине перекос в мелкой ячейке весит больше, чем в крупной. Отсюда растут и все требования к размеру ячеек.

Само значение вердикта не выносит: одно и то же число на разных таблицах означает разное. Вывод делают по паре из значения критерия и числа степеней свободы, переводя её в p-значение либо сравнивая с критическим значением. Если p ниже выбранного заранее порога, обычно это 0,05, связь называют статистически значимой.

Откуда взялось название

Критерий предложил Карл Пирсон в 1900 году, поэтому полное имя теста это хи-квадрат Пирсона. Хи это греческая буква χ, а квадрат в названии от того, что отклонения возводят в квадрат: из-за этого значение критерия никогда не бывает отрицательным. Встречаются написания «чи-квадрат» и обозначение χ², это всё один и тот же критерий.

WebAsk · сервис опросов Так выглядит вопрос NPS · это демо

Насколько вероятно, что вы порекомендуете нас коллеге?

Вот и всё — такой опрос собирается за пару минут, а индекс WebAsk считает сам.

Создать свой опрос

Важно не путать два объекта с одним именем. Есть распределение хи-квадрат, то есть сумма квадратов независимых стандартных нормальных величин: оно неотрицательное, скошено вправо, а его форма зависит от числа степеней свободы. И есть семейство критериев, которые по этому распределению переводят своё значение в вероятность. Отсюда же следует, что критерий всегда правосторонний: смотрят только правый хвост распределения, большое значение это сигнал, а маленькое само по себе не доказывает ничего. Как устроена процедура вокруг этого решения, разобрано в карточке про проверку гипотез.

Три критерия под одним названием

За словом «хи-квадрат» стоят три разных теста. Считаются они похоже, а отвечают на разные вопросы, и путают их постоянно.

  • Критерий согласия. Одно распределение сравнивают с теоретическим или эталонным: равномерно ли ответы разошлись по дням недели, совпадает ли структура выборки с известной структурой генеральной совокупности. Данных хватает одной строки.
  • Критерий независимости. Два вопроса, заданных одной и той же выборке, проверяют на связь. Самый частый случай в опросах, и обычно именно его имеют в виду, когда говорят «посчитать хи-квадрат по кросстабу».
  • Критерий однородности. Один и тот же вопрос сравнивают в нескольких выборках: волны трекинга, филиалы, тестовая и контрольная группы. Арифметика та же, что у независимости, но выборки набирают заранее, поэтому вывод формулируют про совпадение распределений, а не про связь двух признаков.

Две задачи критерия хи-квадрат: тест согласия сравнивает одно распределение с ожидаемым, тест независимости сравнивает два вопроса между собой

Что такое ожидаемые частоты

Ожидаемую частоту ячейки получают из итогов её строки и столбца: итог строки умножают на итог столбца и делят на общее число ответов. Скажем, в опросе на 200 человек 80 пришли из поиска, а подписку оформили 50. Если канал и подписка никак не связаны, в ячейке «пришёл из поиска и оформил подписку» ожидается 80 × 50 / 200, то есть 20 человек.

Дальше два уточнения, на которых спотыкаются чаще всего. Ожидаемая частота почти всегда получается нецелой, и это не ошибка: 20,8 человека в природе не бывает, но это среднее, а не люди. И ожидаемая таблица не берётся с потолка, итоги по строкам и столбцам в ней те же, что в ваших данных, меняется только распределение внутри.

Что такое степени свободы

Степени свободы это количество ячеек, которые можно заполнить произвольно, пока итоги строк и столбцов зафиксированы. Для таблицы сопряжённости df = (число строк − 1) × (число столбцов − 1): на таблице 2×2 это 1, на 3×2 это 2, на 4×5 уже 12. Для критерия согласия df равно числу категорий минус один.

Зачем это нужно, проще увидеть на числах. Значение 9,5 на таблице 2×2 даёт p около 0,002, то есть уверенную значимость. То же самое значение 9,5 на таблице 4×5 даёт p около 0,66, то есть ровным счётом ничего. Чем больше в таблице клеток, тем большее расхождение считается обычным делом, и степени свободы это ровно та поправка, которая приводит критерий к сопоставимому виду.

Чего этим числом не сказать

Хи-квадрат непараметрический: он не требует нормальности данных и работает с номинальными признаками, где у вариантов нет ни порядка, ни расстояния. Но его значение не нормировано, верхней границы у него нет, и вычитать из него больше, чем в нём заложено, не получится.

  • Силу связи он не измеряет. Умножьте все числа в таблице на десять, не тронув пропорций, и значение критерия вырастет в те же десять раз, хотя связь осталась прежней. Силу измеряют отдельными мерами: V Крамера для таблиц любой формы, коэффициент φ для 2×2. Зачем вообще считать её рядом со значимостью, объясняет карточка про размер эффекта.
  • Причинность он не доказывает. Связь двух признаков не означает, что один влияет на другой: рядом может стоять третий, который объясняет оба.
  • Незначимый результат это не доказательство отсутствия связи. p выше порога говорит только о том, что на этих данных связи не видно, а не о том, что её нет.
  • Он не показывает, где именно сидит эффект. Сумма собрана со всех ячеек сразу, поэтому после значимого результата отдельно ищут, какая клетка таблицы его дала.
  • Порядок вариантов для него не существует. Переставьте строки местами, и значение не изменится. Поэтому на порядковых шкалах вроде шкалы Лайкерта тест замечает различие распределений, но пропускает плавный тренд, а если вы ждёте именно тренда, точнее сработает тау-b Кендалла.

Одна и та же таблица на выборках 240 и 2400 человек: хи-квадрат вырос с 5,4 до 54,1, а V Крамера остался 0,15

Какими должны быть данные

  • Одно наблюдение в одну ячейку. Респондент попадает ровно в одну клетку таблицы. Поэтому вопрос «отметьте всё подходящее» тест ломает, а повторные замеры одной и той же группы считают тестом Макнемара.
  • Частоты, а не проценты. В ячейках стоят абсолютные количества ответов. Подставите проценты, и тест решит, что в каждой строке ровно сто человек, а результат перестанет иметь отношение к вашей выборке.
  • Ожидаемые частоты не слишком мелкие. Распределение, по которому считают p, здесь только приближение, и работает оно тем точнее, чем крупнее ожидаемые частоты. На таблице 2×2 при ожидаемой частоте меньше пяти надёжнее сразу взять точный тест Фишера.

Конкретные пороги по мелким ячейкам и полный чек-лист проверок перед расчётом собраны в статье про хи-квадрат.

Хи-квадрат и соседние инструменты

ИнструментЧто делаетКогда берут
Кросс-табуляцияпоказывает таблицу частот, ничего не проверяетнужно увидеть распределение по группам
Хи-квадратпроверяет, значим ли перекос в таблицеоба вопроса категориальные
Z-тест для двух долейто же самое, что хи-квадрат на таблице 2×2сравниваете две доли между собой
Точный тест Фишерасчитает вероятность точно, без приближениятаблица 2×2, где ожидаемые частоты мелкие
Тест Макнемарасравнивает два замера на одних людяхзамеры до и после на той же группе
V Крамераизмеряет силу связи от 0 до 1значимость уже подтверждена
T-тест и ANOVAсравнивают средние в группаходна переменная категориальная, вторая числовая
Корреляцияизмеряет связь двух числовых переменныхчисловые обе

Чаще всего хи-квадрат путают с кросс-табуляцией: таблица только показывает данные, а тест отвечает, можно ли доверять перекосу в ней. Если ответы числовые, таблицы частот просто не возникает, и вопрос переходит к t-тесту, ANOVA или корреляционному анализу. Как связывают между собой ответы на два вопроса и что делают с результатом дальше, разобрано в статье про двумерный анализ.

Как это сделано в WebAsk

Таблица частот собирается из ответов на закрытые вопросы: одиночный выбор, дропдаун, матрица. Признак, по которому вы потом режете аудиторию, не обязательно спрашивать у респондента: его можно передать скрытой переменной прямо в ссылке и получить в выгрузке рядом с ответами. Готовую таблицу частот можно вбить в калькулятор хи-квадрата, он принимает целые числа и таблицы от 2×2 до 5×5, а если сравниваете всего две доли, тот же результат даст калькулятор значимости A/B-теста.

Проверить это на своих данных можно бесплатно. Соберите в конструкторе WebAsk два вопроса с вариантами выбора, дождитесь пары сотен ответов и посмотрите, держится ли разница между сегментами.

Частые вопросы

Что такое критерий хи-квадрат простыми словами?

Допустим, в отчёте видно, что с мобильных выбирают дорогой тариф чаще, чем с компьютеров. Хи-квадрат отвечает, устоит ли эта разница на другой выборке или вы смотрите на рябь. Для этого он сравнивает вашу таблицу с той, которая получилась бы при полном отсутствии связи между вопросами.

Почему тест называется хи-квадрат?

По имени распределения, с которым сравнивают полученное значение. Хи это греческая буква χ, а квадрат от того, что отклонения в формуле возводятся в квадрат. Сумма таких квадратов при отсутствии связи ведёт себя как χ²-распределение с известным числом степеней свободы, и по нему значение переводят в p. Критерий предложил Карл Пирсон в 1900 году.

Сколько бывает критериев хи-квадрат?

Три. Критерий согласия сравнивает одно распределение с теоретическим, критерий независимости проверяет связь двух вопросов в одной выборке, критерий однородности сравнивает одно распределение в нескольких выборках. Арифметика у них близкая, но вопросы разные, и в опросной практике по умолчанию имеют в виду критерий независимости.

Зачем в хи-квадрате нужны степени свободы?

Они показывают, насколько крупное расхождение считается обычным для таблицы такого размера. Формально это число ячеек, которые можно заполнить свободно при зафиксированных итогах строк и столбцов, а на практике без них значение критерия прочитать нельзя: одно и то же число у таблицы 2×2 и у таблицы 4×5 означает совершенно разное.

Почему одно значение хи-квадрата ни о чём не говорит?

Потому что оно зависит сразу от трёх вещей: силы связи, размера таблицы и числа ответов. Верхней границы у него нет, на больших выборках оно легко уходит в десятки. Читают его только в паре со степенями свободы, а сравнивать значения между двумя разными исследованиями бессмысленно, для этого нужны нормированные меры вроде V Крамера.

Чем хи-квадрат отличается от t-теста?

Типом данных. Хи-квадрат работает с частотами по категориям, то есть с количеством людей в ячейках, а t-тест с числовым показателем и сравнивает средние двух групп. Если числовыми оказались оба признака, нужен уже не тест на различия, а корреляция.

Чем хи-квадрат отличается от точного теста Фишера?

Хи-квадрат считает вероятность приближённо, а тест Фишера перебирает все возможные таблицы с теми же итогами и даёт точный ответ. На мелких ожидаемых частотах приближение врёт, поэтому на таблице 2×2 в этом случае берут Фишера. Расплата за точность это трудоёмкость расчёта, поэтому на больших таблицах его применяют редко.

Можно ли посчитать хи-квадрат по процентам?

Нет. Тесту нужны абсолютные количества ответов, потому что от объёма данных напрямую зависит результат. Если подставить проценты, тест примет за размер выборки сотню на строку, и значение критерия окажется взято из воздуха.

2

Опрос, который дочитывают

Готовые шаблоны, ветвления по ответам и отчёты — в одном месте

Создать опрос Есть бесплатный тариф