Ошибки I и II рода (Type I and Type II Errors)
29 августа 2026 Время чтения ≈ 8 мин.
Ошибка I рода это ложная тревога: тест нашёл эффект, которого нет. Ошибка II рода это пропуск: эффект был, а тест его не заметил.
Обе неизбежны. Статистическая проверка работает с выборкой, а не со всей аудиторией, поэтому ошибиться она может в любую сторону. Управлять можно только тем, какую из двух ошибок вы готовы допускать чаще.
Четыре исхода вместо двух
Удобнее всего держать в голове матрицу. По одной оси лежит правда о мире, которую вы не знаете, по другой ваше решение по данным.
Привычные 0,05 в отчётах это и есть α, выбранный уровень ложных тревог.
Откуда взялись 0,05
Порог полезно понимать как договорённость, а не как закон природы. Рональд Фишер в книге 1925 года заметил, что значению P = 0,05 отвечает отклонение примерно в два стандартных отклонения, и предложил взять эту точку за границу просто потому, что она удобна.
Так и написано: удобно. Никакого вывода из теории за цифрой нет, есть круглое число и почти столетие привычки. Отсюда практическое следствие: порог можно двигать под задачу, если вы готовы объяснить, почему двигаете, и пересчитать выборку. Медицина в критических исследованиях берёт 0,01 и строже, продуктовые команды при дешёвых обратимых решениях спокойно живут на 0,1.
Уменьшить обе сразу нельзя
Главное свойство пары, из-за которого и возникает большинство недоразумений: при неизменной выборке α и β связаны. Ужесточаете порог, реже поднимаете ложную тревогу, но чаще пропускаете реальный эффект.
В числах на конкретной задаче. Сравниваем две доли, 40% и 50%, по 250 человек в группе:
| Порог α | Мощность | Ошибка II рода |
|---|---|---|
| 0,10 | 72,8% | 27,2% |
| 0,05 | 61,4% | 38,6% |
| 0,01 | 37,1% | 62,9% |
| 0,001 | 14,7% | 85,3% |
При пороге 0,001 тест пропустит реальную разницу в десять пунктов в 85 случаях из ста. Осторожность обошлась дорого.
Выход из размена ровно один: увеличить выборку. Для той же задачи при мощности 80% нужно 387 человек в группе при α = 0,05 и 577 при α = 0,01. Строгость покупается людьми, а не решительностью.
Почему «каждый двадцатый значимый результат случаен» неверно
Фраза встречается часто и звучит логично: раз α = 5%, значит из двадцати находок одна ложная. На самом деле пять процентов это доля ошибок среди неверных гипотез, а не среди полученных находок.
Считается это в одно действие. Из тысячи проверенных гипотез верна каждая десятая, значит верных сто и неверных девятьсот. Тест с мощностью 80% найдёт 80 из ста верных. От девятисот неверных он ошибётся на пяти процентах, это 45 ложных срабатываний. Итого значимых результатов 125, из них ложных 45.
Ключевой параметр здесь тот, которого нет в формулах теста: какая доля ваших гипотез вообще верна.
| Доля верных гипотез | Значимых результатов | Из них ложных | Доля ложных |
|---|---|---|---|
| 10% | 125 | 45 | 36% |
| 25% | 238 | 38 | 16% |
| 50% | 425 | 25 | 6% |
| 80% | 650 | 10 | 2% |
Отсюда практический вывод, неприятный для любителей проверять всё подряд: чем более случайные гипотезы вы тестируете, тем большая доля ваших «значимых» находок окажется мусором. Тот же механизм разобран в карточке про предвзятость подтверждения, где срез подбирают уже после того, как посмотрели данные.
Подглядывание раздувает α
Размер выборки и доверительный интервал для опросовСамый частый способ незаметно испортить себе уровень значимости выглядит невинно: открывать отчёт по ходу сбора ответов и остановиться, когда разница станет значимой.
Каждый взгляд это отдельный шанс поймать случайное отклонение. Шансы складываются. Смоделировал это на двадцати тысячах прогонов: две группы с одинаковой долей 50%, набираем до двух тысяч ответов, порог 0,05 на каждой проверке.
| Сколько раз смотрели по ходу | Доля ложных тревог |
|---|---|
| 1 (только в конце) | 5,3% |
| 2 | 8,6% |
| 5 | 14,8% |
| 10 | 19,6% |
Заявленные пять процентов превращаются в двадцать, а в отчёте по-прежнему написано «p меньше 0,05». Формально ни одна цифра не подделана.
Лечится дисциплиной: объём выборки называется до старта, отчёт открывается один раз. Если смотреть по ходу всё же нужно, для этого есть последовательные схемы с поправленными порогами, но самодельная остановка «когда стало значимо» к ним не относится.
Какая ошибка дороже
Ответ зависит от того, что стоит за решением, и универсального нет.
- Дороже ложная тревога. Редизайн всего личного кабинета по результатам одного опроса. Ошиблись, значит потратили квартал разработки впустую. Здесь порог стоит ужесточить и набрать людей.
- Поменять формулировку письма стоит полчаса, и откатить её так же просто. Когда решение дешёвое и обратимое, обиднее пропустить рабочую идею из-за строгого порога, чем зря её протестировать.
- Отдельный случай это регулярный мониторинг. Пятьдесят две еженедельные проверки за год при α = 0,05 дают в среднем 2,6 ложных тревоги, а вероятность получить хотя бы одну составляет 93%. Даже если весь год ничего не менялось, дашборд что-нибудь покажет.
В исследованиях опросов чаще недооценивают именно ошибку II рода. Компания собирает двести ответов, разницы не находит и делает вывод «изменений нет». Хотя корректный вывод звучит иначе: «этой выборкой такую разницу не поймать». Отсутствие значимости не доказывает отсутствия эффекта.
Как с этим работать на практике
- считать нужный размер выборки до сбора данных, а не после: калькулятор размера выборки берёт на вход ожидаемый эффект и выдаёт объём;
- называть заранее, какую разницу вы считаете важной. Это MDE, и без него мощность не считается;
- при отрицательном результате смотреть доверительный интервал: если он тянется от минус восьми до плюс десяти пунктов, вы не доказали отсутствие эффекта, вы просто ничего не измерили;
- Не стоит понижать α «для надёжности», не пересчитав выборку: строгость без людей превращается в машину для пропусков.
Как это сделано в WebAsk
Отчёт показывает доли и число ответов за ними, а решение о том, считать ли разницу настоящей, остаётся за исследователем. Пара практических опор.
Число под каждой долей это первое, на что стоит смотреть. Разница между 62% и 55% выглядит одинаково внушительно и при восьмистах ответах, и при сорока, но в первом случае она реальна, а во втором целиком укладывается в погрешность.
Вторая опора это дублирование опроса вместо написания нового. Формулировки и структура остаются прежними, значит две волны сравнимы, и разница между ними говорит о продукте, а не о том, что анкету переписали.
Скрытые поля и фильтры отчёта позволяют разложить выборку по сегментам. Полезная привычка при этом: перечислить сегменты до того, как открыли отчёт. Перебор всех подряд с остановкой на красивом это ровно та процедура, для которой посчитанный p-value уже не годится.
Коротко
- ошибка I рода это ложная тревога, её вероятность α;
- ошибка II рода это пропуск эффекта, её вероятность β, а мощность это 1 − β;
- при неизменной выборке одна растёт за счёт другой, развязать их можно только людьми;
- α = 0,05 это доля ошибок среди неверных гипотез, а не среди находок;
- при доле верных гипотез 10% ложной оказывается треть находок;
- подглядывание по ходу набора поднимает долю ложных тревог с 5% до 20%;
- отсутствие значимости не доказывает отсутствие эффекта.
Вопросы и ответы
Чем ошибка I рода отличается от ошибки II рода?
Ошибка I рода это ложная тревога: нашли эффект, которого нет. Ошибка II рода это пропуск: эффект есть, а тест его не заметил. Вероятность первой обозначают α, второй β.
Можно ли уменьшить обе ошибки сразу?
Только увеличив выборку. При фиксированном числе ответов ужесточение порога снижает ложные тревоги и одновременно повышает долю пропусков.
Что такое мощность критерия?
Шанс заметить существующий эффект, то есть 1 − β. Стандартный ориентир 80%: при таком уровне тест пропустит реальный эффект в каждом пятом случае.
Правда ли, что при α = 0,05 каждый двадцатый значимый результат случаен?
Нет. Пять процентов это доля ошибок среди неверных гипотез. Доля ложных среди находок зависит ещё от мощности и от того, какая часть проверяемых гипотез верна. При десяти процентах верных гипотез ложной окажется треть находок.
Какая ошибка опаснее в опросах?
Чаще недооценивают ошибку II рода. На маленькой выборке реальная разница не находится, и это читают как «изменений нет», хотя корректный вывод звучит иначе: такой выборкой такую разницу не поймать.
Что делать, если результат оказался незначимым?
Посмотреть доверительный интервал. Если он широкий и включает практически важные значения, эффект не опровергнут, просто данных не хватило. Дальше считают нужный размер выборки и повторяют замер.
Опубликовано 29 августа 2026
Алексей Логинов