Содержание

Не с чистого листа

Возьмите готовую анкету и поправьте под себя

Выбрать шаблон
Лого WebAsk

SUS: балл, процентиль и оценка

SUS это шкала удобства из десяти утверждений, которая сводит ответы пользователей к одному числу от 0 до 100. Само число почти ничего не говорит, пока его не поставить рядом с чем-то: с другими продуктами или со своим прошлым замером.

Что такое SUS

System Usability Scale, или SUS, это опросник удобства, который Джон Брук предложил в 1986 году. Пользователь отвечает на десять утверждений по пятибалльной шкале согласия, причём нечётные утверждения сформулированы положительно, а чётные отрицательно. Ответы пересчитывают в единый балл от 0 до 100.

Шкала прижилась по двум причинам. Она короткая, поэтому её соглашаются заполнить после обычной задачи. И она устойчива на маленьких выборках: в сравнении опросников Таллиса и Стетсон SUS раньше остальных приходил к верному выводу, давая правильный ответ в 75% случаев уже на восьми участниках и в 90-100% на двенадцати.

Здесь разбираем SUS как метрику. Речь о том, что означает полученное число и как его читать, а порядок проведения опроса и разбор формулы лежат в отдельной статье.

Опросник SUS: 10 вопросов на русском, формула расчёта и нормы

Балл SUS это не процент

Чаще всего балл читают неверно самым простым способом: принимают за проценты. Балл 68 не означает, что продукт удобен на 68% или что его одобрили 68% пользователей. Множитель 2,5 в расчёте нужен лишь для того, чтобы растянуть сумму ответов до привычного вида от 0 до 100.

WebAsk · сервис опросов Спросите свою аудиторию Готовые шаблоны, ветвления по ответам и отчёты — опрос собирается за пару минут Выбрать шаблон

У числа нет собственного смысла, потому что у удобства нет естественной единицы измерения. Балл получает смысл только в сравнении: с другими продуктами или с собственным замером до изменений.

Цифра 68, которую обычно называют нормой, тоже взялась из сравнения. Это среднее по накопленной базе исследований, то есть описание сложившейся практики, а не порог качества, установленный кем-то намеренно. Ставить её целью бессмысленно. Попадание в 68 означает ровно то, что продукт оказался в середине, и ничего больше.

Как перевести балл в процентиль

Сравнение с другими продуктами делают через процентиль. Процентиль отвечает на вопрос, какую долю продуктов вы обошли: 50-й процентиль означает, что половина продуктов набирает меньше, а половина больше.

Джефф Сауро и Джеймс Льюис свели данные 241 исследования и построили перевод балла в процентиль и буквенную оценку. То самое среднее значение 68 попало у них в середину: это оценка C и примерно 50-й процентиль.

Шкала SUS от 0 до 100 с отметками 52, 68 и 79, которым соответствуют 15-й, 50-й и 85-й процентили

Шкала при этом неравномерна, и в таблице ниже это видно по ширине строк. Продукты сгущаются в середине, поэтому одинаковый шаг в баллах двигает по рейтингу совсем по-разному.

ОценкаБалл SUSПроцентиль
A+84,1 и выше96–100
A80,8–84,090–95
A-78,9–80,785–89
B+77,2–78,880–84
B74,1–77,170–79
B-72,6–74,065–69
C+71,1–72,560–64
C65,0–71,041–59
C-62,7–64,935–40
D51,7–62,615–34
F51,6 и ниже0–14

Участок от 52 до 79 баллов это 27 пунктов шкалы, и в него попадает 70% всех продуктов. Остальные 73 пункта делят между собой оставшиеся 30%.

Отсюда два практических следствия. В середине шкалы даже небольшой прирост заметно поднимает продукт в рейтинге: плюс три балла с 68 до 71 это переход с 50-го процентиля примерно на 59-й. А вот у краёв рост почти ничего не меняет. Продукт с баллом 40 и продукт с баллом 50 оба сидят в нижних 14%.

Процентили Сауро и Льюиса посчитаны по западной выборке продуктов. Для русскоязычных сервисов это ориентир, а не закон, поэтому надёжнее сравнивать себя с собственным прошлым замером.

Почему SUS не делят на подшкалы

В интернете до сих пор советуют считать по SUS два показателя: удобство по восьми пунктам и обучаемость по четвёртому и десятому. Совет опирается на работу Льюиса и Сауро 2009 года, где факторный анализ действительно нашёл в шкале две составляющие, Usable и Learnable.

Дальше история пошла иначе. Независимые исследования ту же структуру не находили, а в 2017 году те же авторы вернулись к вопросу на выборке больше девяти тысяч анкет. Две составляющие в данных нашлись снова, но совпали они не со смыслом пунктов, а с их тоном: в одну группу собрались положительные утверждения, в другую отрицательные. То есть шкала распадалась на части из-за чередования формулировок, а не потому что измеряла два разных свойства.

Три шага истории с подшкалами SUS: предложение 2009 года, неудачные попытки повторить и объяснение 2017 года через чередование тона вопросов

Практический вывод простой: пользуйтесь одним общим баллом. Дело не в надёжности двухпунктовой подшкалы, с ней всё в порядке. Дело в том, что само деление не воспроизводится, поэтому и сами авторы больше не советуют считать обучаемость отдельно.

Что SUS не измеряет

SUS собирает мнение о продукте, а не наблюдение за работой в нём. Это воспринимаемое удобство: человек отвечает, каким продукт ему показался, и его ответ может расходиться с тем, что он делал на самом деле. Расходится оно чаще, чем принято думать: в обзоре 105 парных сравнений система с более высоким баллом SUS оказывалась медленнее в каждом четвёртом случае.

Причём медленнее не значит хуже. В одном из этих сравнений люди собирали двигатель по инструкции в очках дополненной реальности вдвое дольше, чем по бумажной, и всё равно оценили её выше: 91,8 против 80,0. Ошибок при этом они сделали втрое меньше, то есть высокий балл отражал реальную выгоду, а не заблуждение.

Поэтому балл не заменяет замеры поведения: время выполнения задачи, долю успешных попыток, число обращений в поддержку. Смотреть их стоит рядом.

Частая ошибка: сравнивать несравнимое

Балл SUS зависит от того, что человек делал перед опросом. Тот же продукт даст разные числа после простой задачи и после сложной, у новичка и у опытного пользователя, на мобильном и на десктопе. Поэтому два замера сопоставимы, если совпадают три вещи:

  • задача, которую выполняли перед опросом
  • состав участников: доля новичков, роли, платформа
  • формулировки пунктов и шкала

Две привычки ломают сопоставимость сразу. Первая: переписывать пункты под свой продукт. Проверенные варианты SUS существуют, но самодельная правка формулировок выводит вас из-под накопленных норм. Вторая: брать семибалльную шкалу вместо пятибалльной. Тогда множитель 2,5 даёт уже не 0-100, и таблица оценок к вашему числу не подходит.

Ещё SUS не отвечает на вопрос, что именно неудобно. Он даёт уровень, но не диагноз, поэтому к десяти пунктам стоит добавить открытый вопрос о самом неудобном месте.

Чем SUS отличается от соседних опросников

Метрик удобства много. Путают их часто, хотя отвечают они на разные вопросы.

МетрикаОбъёмЧто измеряет
SUS10 утвержденийобщее удобство продукта, с переводом в процентиль
UMUX-Lite2 утвержденияполезность и простота, короткая замена SUS
SEQ1 вопроссложность одной конкретной задачи
CSAT1 вопросудовлетворённость, а не удобство

Выбор зависит от шага исследования: SUS ставят после сессии целиком, SEQ после каждой задачи, UMUX-Lite берут, когда на десять пунктов нет места.

UMUX-Lite

Как это сделано в WebAsk

В WebAsk десять утверждений SUS собираются в анкету матричным вопросом: утверждения идут строками, градации согласия столбцами. Отвечающий проходит их одним экраном, а не десятью отдельными.

Чтобы замеры оставались сопоставимыми, анкету стоит завести один раз и дальше копировать: формулировки и порядок пунктов при копии сохраняются. Ответы выгружаются в Excel или CSV, там балл и считают. А к матрице полезно добавить открытый вопрос о неудобствах: он объясняет полученное число.

Коротко

  • SUS сводит десять утверждений к баллу от 0 до 100, и этот балл не процент.
  • Смысл появляется при переводе в процентиль: 68 это оценка C и середина распределения.
  • Шкала неравномерна: 27 баллов в середине покрывают 70% продуктов.
  • Делить SUS на подшкалы не нужно, двухфакторность оказалась следствием чередования тона пунктов.
  • Сравнивать замеры можно, если совпали задача, состав участников и формулировки.

Вопросы и ответы

SUS 68 это хорошо?

Это середина. Балл 68 попадает в оценку C, а это диапазон с 41-го по 59-й процентиль, то есть примерно половина продуктов набирает меньше, половина больше. Как повод для спокойствия этого мало, как повод для тревоги тоже.

Можно ли считать SUS в процентах?

Нет. Множитель 2,5 приводит сумму ответов к диапазону 0–100 для удобства, но доли эти числа не выражают. Балл 80 не означает «80% довольных пользователей».

Сколько респондентов нужно для SUS?

Шкала терпима к небольшим выборкам. В сравнении опросников Таллиса и Стетсон SUS давал верный вывод в 75% случаев на восьми участниках и в 90-100% случаев на двенадцати. Для сравнения двух версий продукта этого обычно достаточно.

Нужно ли считать по SUS обучаемость отдельно?

Не нужно. Подшкалы Usable и Learnable предложили в 2009 году, но повторить эту структуру не удавалось, а в 2017 году выяснилось, что деление отражает тон формулировок, а не разные свойства продукта. Поэтому считать обучаемость отдельно авторы больше не советуют.

Что делать, если балл низкий?

Искать причину другими методами. SUS показывает уровень удобства, но молчит о причинах, поэтому дальше идут открытый вопрос о неудобствах, запись сессий или юзабилити-тестирование.

5

Не с чистого листа

Возьмите готовую анкету и поправьте под себя

Выбрать шаблон