Содержание

Не с чистого листа

Возьмите готовую анкету и поправьте под себя

Выбрать шаблон
Лого WebAsk

Z-test (z-тест, z-критерий)

Z-тест проверяет, отличается ли наблюдённое значение от гипотетического настолько, что случайностью это не объяснить. Расчёт опирается на нормальное распределение, отсюда и буква z в названии.

Что тест делает на самом деле

Механика у всех тестов одна. Мы считаем, каким было бы распределение результата, если разницы нет, отмечаем на нём черту и всё, что за чертой, объявляем разницей.

Два распределения и порог z 1,96: справа от черты объявляем разницу, серая область это ложная тревога альфа 5 процентов, синяя это пропущенная разница бета 20 процентов

Порог z = 1,96 при уровне значимости 0,05 берётся из нормального распределения: за него уходит ровно 5% случаев, когда разницы нет. Это ошибка первого рода, ложная тревога.

Второе распределение на картинке это то, что происходит, когда разница настоящая. Часть его всё равно лежит слева от черты, и в этих случаях мы разницу пропустим. Это ошибка второго рода, а её дополнение до единицы называется мощностью.

Серая область справа от черты это ложная тревога: разницы нет, а мы её объявили. Синяя слева от черты это пропущенная настоящая разница. Обе видны на одной картинке, и видно же, что они связаны: сдвиг черты вправо уменьшает серое и увеличивает синее.

Сдвинуть черту значит обменять одну ошибку на другую: строже порог, меньше ложных тревог и больше пропусков. Уменьшить обе сразу нельзя ничем, кроме увеличения выборки. Это общая арифметика проверки гипотез, а не особенность z-теста.

Требование, которое почти никогда не выполняется

Формально z-тест применим, когда стандартное отклонение генеральной совокупности известно. Именно это условие отличает его от t-теста, а не размер выборки.

WebAsk · сервис опросов Спросите свою аудиторию Готовые шаблоны, ветвления по ответам и отчёты — опрос собирается за пару минут Выбрать шаблон

Тут и загвоздка. Если бы вы знали разброс по всей совокупности, вы, скорее всего, знали бы и среднее, и проверять было бы нечего. На практике разброс оценивают по той же выборке, а оценка добавляет собственную неопределённость. Учёт этой неопределённости и есть t-тест.

Поэтому для средних честный ответ такой: берите t-тест почти всегда. Он не требует знать σ, а на большой выборке даёт практически тот же результат.

Откуда взялось правило «больше тридцати»

Распространённый совет звучит так: при выборке больше тридцати можно брать z. У совета есть содержание, и его можно измерить.

Кривая: на пяти наблюдениях интервал по z уже настоящего на 29,4 процента, на тридцати на 4,2 процента, на ста на 1,2 процента

Если взять z там, где нужен t, интервал получится уже настоящего, то есть вы объявите точность выше, чем она есть. Величина ошибки считается точно.

НаблюденийКритическое значение tИнтервал по z уже на
52,77629,4%
102,26213,4%
302,0454,2%
1001,9841,2%
10001,9620,1%

Видно, откуда взялась тридцатка: примерно там ошибка опускается ниже пяти процентов и перестаёт менять выводы. На пяти наблюдениях расхождение уже почти в треть, и подмена становится грубой.

Практический вывод парадоксальный: правило «после тридцати можно z» верно, но бесполезно. Там, где z допустим, он не нужен, потому что t даёт то же самое. Там, где он что-то менял бы, он запрещён. Для средних z-тест остаётся учебной конструкцией.

Где z-тест действительно на месте

А вот с долями всё иначе, и это его настоящая область применения. У доли разброс определяется самой долей: если доля равна p, то дисперсия равна p(1−p). Оценивать отдельно нечего, лишней неопределённости не возникает, и нормальное приближение работает по делу.

Поэтому сравнение двух конверсий, двух долей согласившихся, двух долей выбравших вариант это z-тест для двух долей. В А/Б-тестировании он и стоит по умолчанию.

Две конверсии 12 и 14 процентов по тысяче человек, их интервалы сильно пересекаются, интервал разницы от минус 0,95 до 4,95 пункта содержит ноль

Разберём типичную ситуацию. Вариант A дал конверсию 12%, вариант B дал 14%, в каждой группе по тысяче человек. Разница в два пункта выглядит как победа.

Считаем: объединённая доля 13%, стандартная ошибка разницы 0,0150, отсюда z = 1,33 и p = 0,18. Порога не достигли. Интервал для самой разницы тянется от −0,95 до +4,95 пункта и содержит ноль, то есть данные совместимы и с тем, что B хуже.

Сколько наблюдений нужно, чтобы поймать разницу

Отсюда вопрос, который стоит задавать до запуска, а не после. Объём считается из той разницы, которую вы хотите различить, и он растёт как квадрат обратной величины.

Различить разницуНужно на группу
12% против 13%17 166
12% против 14%4 435
12% против 15%2 033
12% против 17%775

Числа посчитаны при уровне значимости 0,05 и мощности 80%. Обратите внимание на первую строку: чтобы уверенно различить один процентный пункт, нужно семнадцать тысяч человек в каждой группе. Именно поэтому тест на тысяче наблюдений и не увидел двух пунктов: он и не мог. Величина, которую тест способен обнаружить при заданном объёме, называется MDE.

Одна выборка или две

Под словом «z-тест» скрываются два разных расчёта, и путать их не стоит.

Одна выборка против известного значения. Есть норматив или прошлогодний результат, и вы проверяете, отличается ли от него текущий замер. В знаменателе стандартная ошибка одной выборки.

Две выборки друг против друга. Классический А/Б-тест: два варианта, ни одно значение заранее не известно. Стандартная ошибка здесь складывается из вкладов обеих групп, поэтому она больше, и разницу поймать труднее, чем кажется по первому случаю.

Отсюда частая ошибка в отчётах: конверсию нового варианта сравнивают с прошлогодним средним как с точным нормативом. Но прошлогоднее среднее само посчитано по выборке и тоже имеет разброс. Если сравниваются два замера, нужен тест для двух выборок, а не для одной.

Когда нормальное приближение ломается

  • Редкие события. При доле около одного процента и небольшой группе приближение перестаёт работать. Ориентир: в каждой группе должно быть хотя бы по десятку событий и по десятку не-событий.
  • Зависимые наблюдения. Если один человек попал в обе группы или отвечал дважды, формула недооценивает разброс и p-value выходит слишком оптимистичным.
  • Подглядывание. Тест рассчитан на однократную проверку. Если смотреть результат каждый день и останавливаться на первом же успехе, доля ложных тревог оказывается кратно выше заявленных пяти процентов.
  • Много сравнений. Пять вариантов вместо двух дают десять пар, и хотя бы одна «значимая» разница появится почти наверняка. Тут нужна поправка на множественность.

Как это сделано в WebAsk

Сами тесты считаются не в опросном сервисе, а в таблице или статистическом пакете. Задача сервиса дать корректные числа для расчёта, и тут важны две вещи.

Первая: знаменатель. Для z-теста нужны и число событий, и число тех, у кого события не произошло. Из выгрузки ответов в CSV или XLSX это видно, из сводки с одними процентами уже нет. Проценты без знаменателя для теста бесполезны.

Вторая: разделение групп. Вариант, который человек увидел, передают скрытой переменной в ссылке, тогда группы в выгрузке разложены сразу. Делить постфактум по времени ответа или по источнику ненадёжно и легко даёт перекос.

Коротко

  • Z-тест сравнивает результат с гипотезой через нормальное распределение, порог 1,96 при уровне 0,05.
  • От t-теста отличается требованием знать разброс совокупности, а не размером выборки.
  • Для средних это требование почти никогда не выполняется, поэтому берут t-тест.
  • Правило «больше тридцати» верно: там ошибка от подмены падает ниже пяти процентов.
  • Настоящая область z-теста это доли, потому что у доли разброс задаётся самой долей.
  • Разница 12% против 14% на тысяче в группе неотличима от нуля, для неё нужно 4435 человек в каждой группе.
T-тест MDE (минимально обнаружимый эффект)

Вопросы и ответы

Чем z-тест отличается от t-теста?

Требованием к разбросу. Z-тест предполагает, что стандартное отклонение генеральной совокупности известно, t-тест оценивает его по выборке и учитывает неопределённость этой оценки. Размер выборки тут вторичен: он лишь определяет, насколько ответы двух тестов расходятся.

Правда ли, что при выборке больше 30 можно брать z-тест?

Правда, но пользы в этом мало. При тридцати наблюдениях интервал по z уже настоящего примерно на 4%, при ста на 1,2%. То есть там, где z допустим, t даёт практически то же самое, а там, где разница существенна, z уже нельзя. На пяти наблюдениях расхождение достигает 29%.

Когда z-тест применяют по делу?

Для долей. У доли дисперсия определяется самой долей и равна p(1−p), поэтому отдельно оценивать разброс не нужно и лишней неопределённости не возникает. Сравнение двух конверсий в А/Б-тесте это как раз z-тест для двух долей.

Конверсия выросла с 12% до 14%, это значимо?

При тысяче человек в каждой группе нет. Расчёт даёт z = 1,33 и p = 0,18, а интервал для разницы тянется от −0,95 до +4,95 процентного пункта и содержит ноль. Чтобы такая разница стала различимой, нужно около 4435 человек в каждой группе.

Что означает z = 1,96?

Это порог при уровне значимости 0,05 для двусторонней проверки. За него уходит 5% случаев, когда настоящей разницы нет. Если посчитанная z-статистика по модулю больше 1,96, разницу объявляют статистически значимой.

Когда нормальное приближение перестаёт работать?

При редких событиях, когда в группе меньше десятка событий или меньше десятка не-событий. Также при зависимых наблюдениях, когда один человек попал в обе группы, при многократном подглядывании в промежуточные результаты и при большом числе одновременных сравнений.

4

Не с чистого листа

Возьмите готовую анкету и поправьте под себя

Выбрать шаблон