Z-test (z-тест, z-критерий)
Обновлено 8 сентября 2026 Время чтения ≈ 9 мин.
Z-тест проверяет, отличается ли наблюдённое значение от гипотетического настолько, что случайностью это не объяснить. Расчёт опирается на нормальное распределение, отсюда и буква z в названии.
Что тест делает на самом деле
Механика у всех тестов одна. Мы считаем, каким было бы распределение результата, если разницы нет, отмечаем на нём черту и всё, что за чертой, объявляем разницей.
Порог z = 1,96 при уровне значимости 0,05 берётся из нормального распределения: за него уходит ровно 5% случаев, когда разницы нет. Это ошибка первого рода, ложная тревога.
Второе распределение на картинке это то, что происходит, когда разница настоящая. Часть его всё равно лежит слева от черты, и в этих случаях мы разницу пропустим. Это ошибка второго рода, а её дополнение до единицы называется мощностью.
Серая область справа от черты это ложная тревога: разницы нет, а мы её объявили. Синяя слева от черты это пропущенная настоящая разница. Обе видны на одной картинке, и видно же, что они связаны: сдвиг черты вправо уменьшает серое и увеличивает синее.
Сдвинуть черту значит обменять одну ошибку на другую: строже порог, меньше ложных тревог и больше пропусков. Уменьшить обе сразу нельзя ничем, кроме увеличения выборки. Это общая арифметика проверки гипотез, а не особенность z-теста.
Требование, которое почти никогда не выполняется
Формально z-тест применим, когда стандартное отклонение генеральной совокупности известно. Именно это условие отличает его от t-теста, а не размер выборки.
Тут и загвоздка. Если бы вы знали разброс по всей совокупности, вы, скорее всего, знали бы и среднее, и проверять было бы нечего. На практике разброс оценивают по той же выборке, а оценка добавляет собственную неопределённость. Учёт этой неопределённости и есть t-тест.
Поэтому для средних честный ответ такой: берите t-тест почти всегда. Он не требует знать σ, а на большой выборке даёт практически тот же результат.
Откуда взялось правило «больше тридцати»
Распространённый совет звучит так: при выборке больше тридцати можно брать z. У совета есть содержание, и его можно измерить.
Если взять z там, где нужен t, интервал получится уже настоящего, то есть вы объявите точность выше, чем она есть. Величина ошибки считается точно.
| Наблюдений | Критическое значение t | Интервал по z уже на |
|---|---|---|
| 5 | 2,776 | 29,4% |
| 10 | 2,262 | 13,4% |
| 30 | 2,045 | 4,2% |
| 100 | 1,984 | 1,2% |
| 1000 | 1,962 | 0,1% |
Видно, откуда взялась тридцатка: примерно там ошибка опускается ниже пяти процентов и перестаёт менять выводы. На пяти наблюдениях расхождение уже почти в треть, и подмена становится грубой.
Практический вывод парадоксальный: правило «после тридцати можно z» верно, но бесполезно. Там, где z допустим, он не нужен, потому что t даёт то же самое. Там, где он что-то менял бы, он запрещён. Для средних z-тест остаётся учебной конструкцией.
Где z-тест действительно на месте
А вот с долями всё иначе, и это его настоящая область применения. У доли разброс определяется самой долей: если доля равна p, то дисперсия равна p(1−p). Оценивать отдельно нечего, лишней неопределённости не возникает, и нормальное приближение работает по делу.
Поэтому сравнение двух конверсий, двух долей согласившихся, двух долей выбравших вариант это z-тест для двух долей. В А/Б-тестировании он и стоит по умолчанию.
Разберём типичную ситуацию. Вариант A дал конверсию 12%, вариант B дал 14%, в каждой группе по тысяче человек. Разница в два пункта выглядит как победа.
Считаем: объединённая доля 13%, стандартная ошибка разницы 0,0150, отсюда z = 1,33 и p = 0,18. Порога не достигли. Интервал для самой разницы тянется от −0,95 до +4,95 пункта и содержит ноль, то есть данные совместимы и с тем, что B хуже.
Сколько наблюдений нужно, чтобы поймать разницу
Отсюда вопрос, который стоит задавать до запуска, а не после. Объём считается из той разницы, которую вы хотите различить, и он растёт как квадрат обратной величины.
| Различить разницу | Нужно на группу |
|---|---|
| 12% против 13% | 17 166 |
| 12% против 14% | 4 435 |
| 12% против 15% | 2 033 |
| 12% против 17% | 775 |
Числа посчитаны при уровне значимости 0,05 и мощности 80%. Обратите внимание на первую строку: чтобы уверенно различить один процентный пункт, нужно семнадцать тысяч человек в каждой группе. Именно поэтому тест на тысяче наблюдений и не увидел двух пунктов: он и не мог. Величина, которую тест способен обнаружить при заданном объёме, называется MDE.
Одна выборка или две
Под словом «z-тест» скрываются два разных расчёта, и путать их не стоит.
Одна выборка против известного значения. Есть норматив или прошлогодний результат, и вы проверяете, отличается ли от него текущий замер. В знаменателе стандартная ошибка одной выборки.
Две выборки друг против друга. Классический А/Б-тест: два варианта, ни одно значение заранее не известно. Стандартная ошибка здесь складывается из вкладов обеих групп, поэтому она больше, и разницу поймать труднее, чем кажется по первому случаю.
Отсюда частая ошибка в отчётах: конверсию нового варианта сравнивают с прошлогодним средним как с точным нормативом. Но прошлогоднее среднее само посчитано по выборке и тоже имеет разброс. Если сравниваются два замера, нужен тест для двух выборок, а не для одной.
Когда нормальное приближение ломается
- Редкие события. При доле около одного процента и небольшой группе приближение перестаёт работать. Ориентир: в каждой группе должно быть хотя бы по десятку событий и по десятку не-событий.
- Зависимые наблюдения. Если один человек попал в обе группы или отвечал дважды, формула недооценивает разброс и p-value выходит слишком оптимистичным.
- Подглядывание. Тест рассчитан на однократную проверку. Если смотреть результат каждый день и останавливаться на первом же успехе, доля ложных тревог оказывается кратно выше заявленных пяти процентов.
- Много сравнений. Пять вариантов вместо двух дают десять пар, и хотя бы одна «значимая» разница появится почти наверняка. Тут нужна поправка на множественность.
Как это сделано в WebAsk
Сами тесты считаются не в опросном сервисе, а в таблице или статистическом пакете. Задача сервиса дать корректные числа для расчёта, и тут важны две вещи.
Первая: знаменатель. Для z-теста нужны и число событий, и число тех, у кого события не произошло. Из выгрузки ответов в CSV или XLSX это видно, из сводки с одними процентами уже нет. Проценты без знаменателя для теста бесполезны.
Вторая: разделение групп. Вариант, который человек увидел, передают скрытой переменной в ссылке, тогда группы в выгрузке разложены сразу. Делить постфактум по времени ответа или по источнику ненадёжно и легко даёт перекос.
Коротко
- Z-тест сравнивает результат с гипотезой через нормальное распределение, порог 1,96 при уровне 0,05.
- От t-теста отличается требованием знать разброс совокупности, а не размером выборки.
- Для средних это требование почти никогда не выполняется, поэтому берут t-тест.
- Правило «больше тридцати» верно: там ошибка от подмены падает ниже пяти процентов.
- Настоящая область z-теста это доли, потому что у доли разброс задаётся самой долей.
- Разница 12% против 14% на тысяче в группе неотличима от нуля, для неё нужно 4435 человек в каждой группе.
Вопросы и ответы
Чем z-тест отличается от t-теста?
Требованием к разбросу. Z-тест предполагает, что стандартное отклонение генеральной совокупности известно, t-тест оценивает его по выборке и учитывает неопределённость этой оценки. Размер выборки тут вторичен: он лишь определяет, насколько ответы двух тестов расходятся.
Правда ли, что при выборке больше 30 можно брать z-тест?
Правда, но пользы в этом мало. При тридцати наблюдениях интервал по z уже настоящего примерно на 4%, при ста на 1,2%. То есть там, где z допустим, t даёт практически то же самое, а там, где разница существенна, z уже нельзя. На пяти наблюдениях расхождение достигает 29%.
Когда z-тест применяют по делу?
Для долей. У доли дисперсия определяется самой долей и равна p(1−p), поэтому отдельно оценивать разброс не нужно и лишней неопределённости не возникает. Сравнение двух конверсий в А/Б-тесте это как раз z-тест для двух долей.
Конверсия выросла с 12% до 14%, это значимо?
При тысяче человек в каждой группе нет. Расчёт даёт z = 1,33 и p = 0,18, а интервал для разницы тянется от −0,95 до +4,95 процентного пункта и содержит ноль. Чтобы такая разница стала различимой, нужно около 4435 человек в каждой группе.
Что означает z = 1,96?
Это порог при уровне значимости 0,05 для двусторонней проверки. За него уходит 5% случаев, когда настоящей разницы нет. Если посчитанная z-статистика по модулю больше 1,96, разницу объявляют статистически значимой.
Когда нормальное приближение перестаёт работать?
При редких событиях, когда в группе меньше десятка событий или меньше десятка не-событий. Также при зависимых наблюдениях, когда один человек попал в обе группы, при многократном подглядывании в промежуточные результаты и при большом числе одновременных сравнений.
Обновлено 8 сентября 2026 Опубликовано 4 июня 2024
Дарья Лисовенко 

