Usability Testing (юзабилити-тестирование)
Обновлено 6 сентября 2026 Время чтения ≈ 9 мин.
Юзабилити-тестирование это наблюдение за тем, как человек выполняет задачу в интерфейсе. Не «удобно ли вам», а «сделайте это, а мы посмотрим, где вы застрянете».
Чем отличается от опроса
Опрос спрашивает мнение, юзабилити-тест смотрит на действие. Разница принципиальная, потому что человек не знает, где именно он споткнулся, и в опросе описывает не проблему, а своё раздражение от неё.
| Что делаем | Что получаем |
|---|---|
| Спрашиваем «удобна ли форма» | оценку по шкале и общее «длинновато» |
| Даём задачу «оформите заказ» | минуту у поля «тип организации» и три клика мимо |
Отсюда и место метода в исследовании: тест отвечает на вопрос «что именно сломано», опрос на вопрос «насколько это распространено». Тест находит проблему на восьми людях, опрос подтверждает её масштаб на двухстах.
Юзабилити-тест это не фокус-группа. На фокус-группе обсуждают, здесь молча делают. Вопрос «а вам нравится этот дизайн» в юзабилити-тесте бесполезен: важно, справился человек или нет, а не что он думает про цвет кнопки.
Откуда взялось правило пяти пользователей
Самое известное утверждение о методе принадлежит Якобу Нильсену: пять участников находят около 85% проблем. Оно верное, но у него есть условие, которое обычно теряют по дороге.
За правилом стоит простая формула. Если вероятность, что один участник наткнётся на конкретную проблему, равна L, то n участников найдут долю 1 − (1 − L)n. Нильсен взял L = 0,31, среднюю величину по своим исследованиям, подставил пятерых и получил 84%.
Всё держится на L. Это не константа природы, а свойство конкретного интерфейса и конкретной задачи. Грубая проблема, на которую спотыкается каждый второй, имеет L около 0,5. Редкая, вылезающая у одного из десяти, имеет L = 0,1.
| Какая проблема | Найдут пятеро | Сколько нужно до 85% |
|---|---|---|
| Заметная, L = 0,45 | 95% | 4 человека |
| Средняя, L = 0,31 | 84% | 6 человек |
| Неочевидная, L = 0,20 | 67% | 9 человек |
| Редкая, L = 0,10 | 41% | 19 человек |
Правило работает так, как обещано, ровно для среднего интерфейса со средними проблемами. На зрелом продукте, где грубое давно вычистили, остаются как раз редкие проблемы, и пятеро находят от них меньше половины. Поэтому «протестировали на пятерых, всё нашли» на пятой итерации звучит куда самоувереннее, чем на первой.
Пять на сегмент, а не пять всего
Второе условие: правило описывает однородную группу. Если аудитория делится на части, которые пользуются продуктом по-разному, то и проблемы у них разные, и считать надо по каждой отдельно.
Пятеро, размазанные на три сегмента, это один или два человека на группу. При L = 0,31 два участника находят 52% проблем сегмента, а один участник 31%. Пятеро на каждую группу дают привычные 84%, но это уже пятнадцать человек, а не пять.
Делить стоит там, где сценарий реально разный: новички против опытных, мобильные против десктопных, а в корпоративном продукте ещё и роли. Делить по возрасту или полу обычно смысла нет: на путь в интерфейсе это влияет слабо.
Три теста по пятеро лучше одного на пятнадцать
Из той же кривой следует вывод, который часто кажется контринтуитивным. При одном и том же бюджете в пятнадцать участников выгоднее провести три круга по пятеро с доработками между ними, чем один большой тест.
Причина в том, что проблемы загораживают друг друга. Пока человек не может пройти второй шаг, всё, что за ним, остаётся непроверенным: до третьего шага никто просто не добирается. Один тест на пятнадцать человек пятнадцать раз покажет одну и ту же грубую заслонку. Починили её, и следующая пятёрка увидит то, чего не видел никто.
Отсюда практический ритм: короткий тест перед каждым заметным изменением, а не одно большое исследование раз в полгода. Пятеро участников это полдня работы, и такой замер можно ставить регулярно.
Что на такой выборке измерять нельзя
Отсюда следует ограничение, которое в отчётах нарушают чаще всего. Найти проблему на восьми участниках можно. Измерить долю нельзя.
«Пять из восьми справились» выглядит как 62%. На деле доверительный интервал для этой доли тянется от 31% до 86%, то есть 56 пунктов ширины. Утверждение «задачу выполняют примерно две трети» такими данными не подтверждается никак.
Практическое правило: числа юзабилити-теста годятся в рабочий отчёт как описание того, что происходило в комнате. В презентацию для руководства как измеренный факт они не годятся. Если нужна именно доля, её меряют на выборке в сотни человек, а не в восемь.
Зато качественные наблюдения на восьми участниках полноценны. «Трое из восьми не поняли поле „тип организации“» это не оценка доли, а находка: поле непонятное, и это видно.
Модерируемый и немодерируемый
Два формата отличаются присутствием исследователя и тем, что из этого следует.
| Модерируемый | Немодерируемый | |
|---|---|---|
| Кто рядом | исследователь, очно или по видео | участник один, идёт запись |
| Можно спросить «почему» | да, сразу после заминки | нет, только догадываться по записи |
| Сколько тестов параллельно | по одному | десятки |
| Для чего | сложный сценарий, прототип | проверка готовых экранов |
Модерируемый даёт глубину: слышно, как человек рассуждает, и можно спросить, чего он ждал. Немодерируемый даёт масштаб и снимает эффект наблюдателя, но оставляет вас наедине с записью, где видно застревание и не видно его причины.
Четыре промаха, которые обесценивают тест
- Подсказывать. «Кнопка справа вверху» стирает результат. Ждите, пока участник попробует сам, а если застрял надолго, это и есть находка, её фиксируют и только потом помогают.
- Давать не задачу, а тему. «Посмотрите сайт» не проверяется. «Найдите, как оформить возврат» проверяется: либо нашёл, либо нет.
- Звать коллег. Они знают структуру продукта и проходят сценарий по памяти, а не по интерфейсу.
- Называть задачу словами интерфейса. Если в задаче сказано «нажмите „Оформить возврат“», вы проверили умение читать, а не понятность пути. Задача формулируется целью: «вам привезли не тот размер, верните деньги».
Как это сделано в WebAsk
Наблюдение даёт «что сломано», а числовую оценку к нему добирают опросом сразу после сессии. Обычно это короткая анкета: SEQ после каждой задачи одним вопросом о сложности и SUS в конце всей сессии.
Версию прототипа и сегмент участника удобно передавать скрытыми переменными в ссылке на опрос: тогда в выгрузке видно, к какому варианту относится оценка, и две версии интерфейса можно сравнить, не складывая их в кучу.
Оговорка та же, что выше: SUS на восьми участниках это ориентир для команды, а не измеренная величина. Как метрика он начинает работать на выборке в десятки и сотни ответов.
Коротко
- Юзабилити-тест смотрит на действие, опрос спрашивает мнение.
- Правило пяти участников верно при L = 0,31: пятеро находят 84% проблем.
- При L = 0,10 те же пятеро находят 41%, а до 85% нужно девятнадцать человек.
- Однородная группа обязательна: три сегмента требуют пятерых на каждый.
- «5 из 8» это доля где-то от 31% до 86%, поэтому метрики с такой выборки в презентацию не идут.
- Задача формулируется целью, а не словами из интерфейса.
Вопросы и ответы
Правда ли, что достаточно пяти пользователей?
Пять участников находят 84% проблем при условии, что вероятность обнаружения одной проблемы одним человеком равна 0,31. Это среднее значение из работ Нильсена. Если проблемы в вашем интерфейсе менее заметные, скажем с вероятностью 0,10, те же пятеро найдут только 41%, а до 85% понадобится девятнадцать человек.
Сколько участников нужно, если аудитория разная?
По пять на каждый сегмент, который проходит сценарий по-своему. Пятеро, размазанные на три группы, дают один или два человека на группу, а это 31% и 52% найденных проблем соответственно. Делить имеет смысл по способу использования: новички против опытных, мобильные против десктопных, роли в корпоративном продукте.
Можно ли по юзабилити-тесту посчитать долю выполнивших задачу?
Посчитать можно, опираться на неё нельзя. Результат «5 из 8» даёт доверительный интервал от 31% до 86%, то есть 56 пунктов ширины. Для доли нужна выборка в сотни человек, юзабилити-тест же силён как искатель проблем.
Чем модерируемый тест отличается от немодерируемого?
В модерируемом рядом исследователь: можно спросить, чего человек ждал, и увидеть сомнение. В немодерируемом участник проходит сценарий сам под запись, поэтому можно запустить десятки тестов параллельно, но причину заминки придётся угадывать.
Как правильно сформулировать задачу?
Целью, а не действием из интерфейса. «Нажмите кнопку „Оформить возврат“» проверяет умение читать. «Вам привезли не тот размер, верните деньги» проверяет, найдёт ли человек путь. У задачи должен быть однозначный признак выполнения.
Юзабилити-тест заменяет опрос?
Нет, они отвечают на разные вопросы. Тест показывает, что именно сломано, и делает это на восьми участниках. Опрос показывает, насколько это распространено, и требует выборки в сотни ответов. Обычная связка это тест, а потом опрос для подтверждения масштаба.
Обновлено 6 сентября 2026 Опубликовано 28 февраля 2026
Алексей Логинов 

