Содержание

Опрос за пару минут

Насколько вероятно, что вы нас порекомендуете?

Собрать ответы Есть бесплатный тариф
Лого WebAsk

Usability Testing (юзабилити-тестирование)

Юзабилити-тестирование это наблюдение за тем, как человек выполняет задачу в интерфейсе. Не «удобно ли вам», а «сделайте это, а мы посмотрим, где вы застрянете».

Чем отличается от опроса

Опрос спрашивает мнение, юзабилити-тест смотрит на действие. Разница принципиальная, потому что человек не знает, где именно он споткнулся, и в опросе описывает не проблему, а своё раздражение от неё.

Что делаемЧто получаем
Спрашиваем «удобна ли форма»оценку по шкале и общее «длинновато»
Даём задачу «оформите заказ»минуту у поля «тип организации» и три клика мимо

Отсюда и место метода в исследовании: тест отвечает на вопрос «что именно сломано», опрос на вопрос «насколько это распространено». Тест находит проблему на восьми людях, опрос подтверждает её масштаб на двухстах.

Юзабилити-тест это не фокус-группа. На фокус-группе обсуждают, здесь молча делают. Вопрос «а вам нравится этот дизайн» в юзабилити-тесте бесполезен: важно, справился человек или нет, а не что он думает про цвет кнопки.

Откуда взялось правило пяти пользователей

Самое известное утверждение о методе принадлежит Якобу Нильсену: пять участников находят около 85% проблем. Оно верное, но у него есть условие, которое обычно теряют по дороге.

WebAsk · сервис опросов Спросите свою аудиторию Готовые шаблоны, ветвления по ответам и отчёты — опрос собирается за пару минут Создать опрос

За правилом стоит простая формула. Если вероятность, что один участник наткнётся на конкретную проблему, равна L, то n участников найдут долю 1 − (1 − L)n. Нильсен взял L = 0,31, среднюю величину по своим исследованиям, подставил пятерых и получил 84%.

Кривая находок: при L 0,45 пятеро находят 95% проблем, при 0,31 находят 84%, при 0,20 находят 67%, при 0,10 всего 41%

Всё держится на L. Это не константа природы, а свойство конкретного интерфейса и конкретной задачи. Грубая проблема, на которую спотыкается каждый второй, имеет L около 0,5. Редкая, вылезающая у одного из десяти, имеет L = 0,1.

Какая проблемаНайдут пятероСколько нужно до 85%
Заметная, L = 0,4595%4 человека
Средняя, L = 0,3184%6 человек
Неочевидная, L = 0,2067%9 человек
Редкая, L = 0,1041%19 человек

Правило работает так, как обещано, ровно для среднего интерфейса со средними проблемами. На зрелом продукте, где грубое давно вычистили, остаются как раз редкие проблемы, и пятеро находят от них меньше половины. Поэтому «протестировали на пятерых, всё нашли» на пятой итерации звучит куда самоувереннее, чем на первой.

Пять на сегмент, а не пять всего

Второе условие: правило описывает однородную группу. Если аудитория делится на части, которые пользуются продуктом по-разному, то и проблемы у них разные, и считать надо по каждой отдельно.

Пятеро на три сегмента дают от 31 до 52 процентов найденных проблем в каждом, пятеро на каждый сегмент дают 84 процента

Пятеро, размазанные на три сегмента, это один или два человека на группу. При L = 0,31 два участника находят 52% проблем сегмента, а один участник 31%. Пятеро на каждую группу дают привычные 84%, но это уже пятнадцать человек, а не пять.

Делить стоит там, где сценарий реально разный: новички против опытных, мобильные против десктопных, а в корпоративном продукте ещё и роли. Делить по возрасту или полу обычно смысла нет: на путь в интерфейсе это влияет слабо.

Три теста по пятеро лучше одного на пятнадцать

Из той же кривой следует вывод, который часто кажется контринтуитивным. При одном и том же бюджете в пятнадцать участников выгоднее провести три круга по пятеро с доработками между ними, чем один большой тест.

Причина в том, что проблемы загораживают друг друга. Пока человек не может пройти второй шаг, всё, что за ним, остаётся непроверенным: до третьего шага никто просто не добирается. Один тест на пятнадцать человек пятнадцать раз покажет одну и ту же грубую заслонку. Починили её, и следующая пятёрка увидит то, чего не видел никто.

Отсюда практический ритм: короткий тест перед каждым заметным изменением, а не одно большое исследование раз в полгода. Пятеро участников это полдня работы, и такой замер можно ставить регулярно.

Что на такой выборке измерять нельзя

Отсюда следует ограничение, которое в отчётах нарушают чаще всего. Найти проблему на восьми участниках можно. Измерить долю нельзя.

Интервалы для доли выполнивших задачу: 5 из 8 это от 31 до 86 процентов, 31 из 50 это от 48 до 74, 125 из 200 это от 56 до 69

«Пять из восьми справились» выглядит как 62%. На деле доверительный интервал для этой доли тянется от 31% до 86%, то есть 56 пунктов ширины. Утверждение «задачу выполняют примерно две трети» такими данными не подтверждается никак.

Практическое правило: числа юзабилити-теста годятся в рабочий отчёт как описание того, что происходило в комнате. В презентацию для руководства как измеренный факт они не годятся. Если нужна именно доля, её меряют на выборке в сотни человек, а не в восемь.

Зато качественные наблюдения на восьми участниках полноценны. «Трое из восьми не поняли поле „тип организации“» это не оценка доли, а находка: поле непонятное, и это видно.

Модерируемый и немодерируемый

Два формата отличаются присутствием исследователя и тем, что из этого следует.

МодерируемыйНемодерируемый
Кто рядомисследователь, очно или по видеоучастник один, идёт запись
Можно спросить «почему»да, сразу после заминкинет, только догадываться по записи
Сколько тестов параллельнопо одномудесятки
Для чегосложный сценарий, прототиппроверка готовых экранов

Модерируемый даёт глубину: слышно, как человек рассуждает, и можно спросить, чего он ждал. Немодерируемый даёт масштаб и снимает эффект наблюдателя, но оставляет вас наедине с записью, где видно застревание и не видно его причины.

Четыре промаха, которые обесценивают тест

  • Подсказывать. «Кнопка справа вверху» стирает результат. Ждите, пока участник попробует сам, а если застрял надолго, это и есть находка, её фиксируют и только потом помогают.
  • Давать не задачу, а тему. «Посмотрите сайт» не проверяется. «Найдите, как оформить возврат» проверяется: либо нашёл, либо нет.
  • Звать коллег. Они знают структуру продукта и проходят сценарий по памяти, а не по интерфейсу.
  • Называть задачу словами интерфейса. Если в задаче сказано «нажмите „Оформить возврат“», вы проверили умение читать, а не понятность пути. Задача формулируется целью: «вам привезли не тот размер, верните деньги».

Как это сделано в WebAsk

Наблюдение даёт «что сломано», а числовую оценку к нему добирают опросом сразу после сессии. Обычно это короткая анкета: SEQ после каждой задачи одним вопросом о сложности и SUS в конце всей сессии.

Версию прототипа и сегмент участника удобно передавать скрытыми переменными в ссылке на опрос: тогда в выгрузке видно, к какому варианту относится оценка, и две версии интерфейса можно сравнить, не складывая их в кучу.

Оговорка та же, что выше: SUS на восьми участниках это ориентир для команды, а не измеренная величина. Как метрика он начинает работать на выборке в десятки и сотни ответов.

Коротко

  • Юзабилити-тест смотрит на действие, опрос спрашивает мнение.
  • Правило пяти участников верно при L = 0,31: пятеро находят 84% проблем.
  • При L = 0,10 те же пятеро находят 41%, а до 85% нужно девятнадцать человек.
  • Однородная группа обязательна: три сегмента требуют пятерых на каждый.
  • «5 из 8» это доля где-то от 31% до 86%, поэтому метрики с такой выборки в презентацию не идут.
  • Задача формулируется целью, а не словами из интерфейса.
SUS (System Usability Scale) SEQ (Single Ease Question)

Вопросы и ответы

Правда ли, что достаточно пяти пользователей?

Пять участников находят 84% проблем при условии, что вероятность обнаружения одной проблемы одним человеком равна 0,31. Это среднее значение из работ Нильсена. Если проблемы в вашем интерфейсе менее заметные, скажем с вероятностью 0,10, те же пятеро найдут только 41%, а до 85% понадобится девятнадцать человек.

Сколько участников нужно, если аудитория разная?

По пять на каждый сегмент, который проходит сценарий по-своему. Пятеро, размазанные на три группы, дают один или два человека на группу, а это 31% и 52% найденных проблем соответственно. Делить имеет смысл по способу использования: новички против опытных, мобильные против десктопных, роли в корпоративном продукте.

Можно ли по юзабилити-тесту посчитать долю выполнивших задачу?

Посчитать можно, опираться на неё нельзя. Результат «5 из 8» даёт доверительный интервал от 31% до 86%, то есть 56 пунктов ширины. Для доли нужна выборка в сотни человек, юзабилити-тест же силён как искатель проблем.

Чем модерируемый тест отличается от немодерируемого?

В модерируемом рядом исследователь: можно спросить, чего человек ждал, и увидеть сомнение. В немодерируемом участник проходит сценарий сам под запись, поэтому можно запустить десятки тестов параллельно, но причину заминки придётся угадывать.

Как правильно сформулировать задачу?

Целью, а не действием из интерфейса. «Нажмите кнопку „Оформить возврат“» проверяет умение читать. «Вам привезли не тот размер, верните деньги» проверяет, найдёт ли человек путь. У задачи должен быть однозначный признак выполнения.

Юзабилити-тест заменяет опрос?

Нет, они отвечают на разные вопросы. Тест показывает, что именно сломано, и делает это на восьми участниках. Опрос показывает, насколько это распространено, и требует выборки в сотни ответов. Обычная связка это тест, а потом опрос для подтверждения масштаба.

2
Опрос за пару минут

Насколько вероятно, что вы нас порекомендуете?

Собрать ответы Есть бесплатный тариф