Содержание

Не с чистого листа

Возьмите готовую анкету и поправьте под себя

Выбрать шаблон
Лого WebAsk

Коэффициент детерминации (R², R-squared)

R² показывает, какую долю разброса зависимой переменной объясняет модель. Значение 0,4 означает, что модель забрала на себя 40% дисперсии, а остальные 60% остались необъяснёнными.

Показатель удобный и потому опасный: он выглядит как оценка качества модели, но качеством не является. Ниже разберём, что он считает, почему растёт сам по себе и в каких случаях ему нельзя верить.

Что именно означает доля объяснённой дисперсии

Возьмите разброс ответов вокруг их среднего, то есть дисперсию. Это то, что нужно объяснить. Теперь постройте модель и посчитайте, какой разброс остался вокруг её предсказаний. R² это доля, на которую второе меньше первого.

R² = 0модель предсказывает не лучше простого среднего
R² = 0,4объяснено 40% разброса, остальное вне модели
R² = 1предсказания совпадают с данными точно

Отсюда сразу два вывода. Первый: R² всегда сравнивает вашу модель с одной и той же отправной точкой, со средним. Второй: показатель безразмерный, поэтому его нельзя перевести в рубли, секунды или баллы, и «объяснено 40%» не означает «предсказываем с точностью 40%».

Откуда название и как считается

«Детерминация» здесь означает определённость: показатель говорит, насколько поведение результата определено моделью. Буква R пришла от коэффициента множественной корреляции, квадрат которого и даёт R² в линейной модели.

WebAsk · сервис опросов Так выглядит вопрос NPS · это демо

Насколько вероятно, что вы порекомендуете нас коллеге?

Вот и всё — такой опрос собирается за пару минут, а индекс WebAsk считает сам.

Выбрать шаблон

Считается он через суммы квадратов. Берут общий разброс результата вокруг среднего, берут остаточный разброс вокруг предсказаний модели и делят второе на первое, а результат вычитают из единицы. То есть R² = 1 − остаточная сумма квадратов / общая сумма квадратов. В этой записи хорошо видно, почему ноль означает «модель не лучше среднего», а единица «остатков не осталось».

Когда R² это просто квадрат корреляции

Для простой регрессии с одной переменной R² действительно равен квадрату коэффициента корреляции. Разбор этой связки с числами есть в статье про корреляцию Пирсона, поэтому повторять его здесь смысла нет.

А вот в модели с несколькими переменными этого равенства уже нет: R² считается по всей модели сразу, и никакого одного коэффициента корреляции, чей квадрат он бы повторял, там не существует. Путаница на этом месте частая, потому что название «квадрат» подсказывает неверную интуицию.

Одинаковый R², разные данные

Квартет Анскомба: четыре набора данных с одинаковым R² 0,67 и одной прямой, но совершенно разными картинами разброса
Квартет Анскомба, 1973 год: у всех четырёх наборов совпадают средние, прямая регрессии и R², но данные ведут себя по-разному.

Это классическая демонстрация того, почему нельзя судить о модели по одному числу. В первом наборе обычный разброс вокруг прямой. Во втором данные лежат на дуге, и линейная модель им не подходит принципиально. В третьем идеальная прямая плюс один выброс, который её и наклонил. В четвёртом почти все точки стоят в одном значении x, а всю связь создаёт единственное наблюдение сбоку.

R² у всех четырёх равен 0,67. Никакой из этих четырёх ситуаций он не различает, поэтому первым делом на данные надо смотреть, а не считать метрики.

Почему R² всегда растёт

Ключевое свойство, которое делает показатель уязвимым: добавление любой переменной в модель не может уменьшить R². Даже если переменная не имеет к делу никакого отношения, модель найдёт в ней случайное совпадение и подгонит немного лучше.

Средние по 2000 симуляций: обычный R² растёт с 0,435 до 0,530 при добавлении пяти мусорных переменных, а скорректированный остаётся около 0,41
Пять переменных из чистого шума: обычный R² подрос на 0,096, скорректированный не сдвинулся.

На диаграмме результат двух тысяч симуляций. Выборка из тридцати наблюдений, одна настоящая переменная и до пяти переменных, сгенерированных как случайный шум. Обычный R² уверенно растёт с 0,435 до 0,530, хотя объяснять там нечего. Скорректированный R² остаётся на месте, 0,414 против 0,408.

Скорректированный R² вводит плату за каждую переменную: 1 − (1 − R²) × (n − 1) / (n − k − 1), где k это число предикторов. Если переменная объясняет меньше, чем стоит её добавление, показатель падает. Поэтому модели с разным числом переменных сравнивают по скорректированному R², а не по обычному.

Тот же смысл в дисперсионном анализе

Если сравниваются не числа, а группы, роль R² играет эта-квадрат: доля межгрупповой дисперсии в общей. Смысл ровно тот же, только вместо предсказаний модели выступает принадлежность к группе.

В карточке про дисперсию есть готовый пример: оценки в трёх отделах, общая дисперсия 0,693, из неё межгрупповая часть 0,323. Отношение даёт 0,47, то есть отдел объясняет 47% разброса оценок. Это и есть эта-квадрат, и в отчёте его читают так же, как R²: почти половина различий связана с тем, где человек работает, остальное с чем-то другим. Проверяет значимость такого разложения дисперсионный анализ.

Высокий R² не означает хорошую модель

  • Проверьте, что данные не временной ряд: у показателей, которые просто растут во времени, R² легко получается выше 0,9 без всякой содержательной связи
  • Посмотрите на число переменных против числа наблюдений: на тридцати ответах и десяти предикторах высокий R² почти гарантирован и почти ничего не значит
  • Не сравнивайте R² моделей, построенных на разных наборах данных или на разных зависимых переменных, это несравнимые числа
  • Не выбирайте модель по максимуму R², так вы выберете самую перегруженную из них

Есть и обратная ошибка: считать низкий R² приговором. В поведенческих данных значения 0,1 и 0,2 это норма, потому что поступки людей зависят от десятков факторов, которых в анкете нет. Модель с R² = 0,15 может быть полезной, если коэффициенты значимы и величина эффекта осмысленна для решения.

R² может оказаться отрицательным. Такое бывает, когда модель проверяют на новых данных, которых она не видела: если предсказания хуже простого среднего, доля объяснённой дисперсии уходит в минус. На тех же данных, на которых модель обучалась, отрицательным он быть не может.

Чего R² не показывает

  • Причинность. Высокая объяснённая доля не означает, что переменные влияют на результат. Причинность обеспечивается дизайном исследования, а не подгонкой.
  • Правильность формы связи. Второй набор Анскомба это дуга, а R² у него такой же, как у честной прямой.
  • Точность конкретного предсказания. Для этого смотрят на ошибку в единицах данных, например среднюю абсолютную ошибку.
  • Значимость. Модель с приличным R² на маленькой выборке может не иметь ни одного значимого коэффициента, и наоборот. Значимость проверяется отдельно, см. карточку про статистическую значимость.
  • Силу связи категориальных признаков. Когда обе переменные категориальные, регрессии не возникает вовсе, и связь измеряют хи-квадратом вместе с V Крамера.

R² и соседние показатели

ПоказательЧто измеряетДиапазон
Коэффициент корреляции rтесноту и направление линейной связи двух переменныхот минус 1 до 1
долю объяснённой дисперсии в моделиот 0 до 1, вне выборки бывает и меньше нуля
Скорректированный R²то же с платой за число переменныхменьше R², может быть отрицательным
Ро Спирменасогласованность порядка, а не значенийот минус 1 до 1
V Крамеранасколько жёстко связаны две категориальные переменныеот 0 до 1
Корреляция Пирсона: как измерить связь двух переменных

Общая логика того, зачем рядом с значимостью смотреть на величину эффекта, описана в карточке про размер эффекта. R² в этой логике играет роль меры эффекта для регрессии.

Где показатель нужен в опросах

  • Поиск драйверов удовлетворённости. Строите модель, где итоговая оценка зависит от оценок отдельных этапов. R² покажет, насколько эти этапы вообще объясняют общее впечатление. Значение около 0,5 говорит, что вы поймали главное, значение 0,1 что решающий фактор в анкету не попал.
  • Проверка длины анкеты. Модель, где доля брошенных анкет зависит от числа вопросов и времени прохождения, обычно даёт высокий R², и это тот редкий случай, когда высокое значение осмысленно: связь механическая.
  • Отсев лишних вопросов. Если добавление блока вопросов не поднимает скорректированный R², блок не несёт информации о результате, и его можно убрать из анкеты. Это прямой способ сократить опрос, не потеряв объясняющую силу.

Во всех трёх сценариях полезно помнить главное ограничение: R² описывает данные, которые у вас уже есть. Он ничего не говорит о том, как модель поведёт себя на следующей волне опроса, и именно поэтому её стоит проверять на новых ответах.

Как это сделано в WebAsk

Для регрессии нужны числовые и шкальные вопросы, а рядом с ними годятся метрики из вашей системы, если вы сопоставляете их с ответами. Выгрузка идёт в Excel или CSV, сама регрессия считается функцией ЛИНЕЙН или статпакетом, и R² приходит в её выдаче без отдельных действий.

Если переменных всего две, начните с простого: посчитайте связь калькулятором корреляции Пирсона и возведите r в квадрат, это и будет R² для такой модели. Смысл раскладки на объяснённую и необъяснённую часть подробно разобран в карточке про дисперсию.

Собрать данные можно бесплатно: заведите в конструкторе WebAsk пару числовых вопросов, выгрузите столбцы и посмотрите, сколько разброса объясняется, а сколько остаётся за пределами модели.

Частые вопросы

Что показывает R² простыми словами?

Какую часть разброса в ответах модель сумела объяснить. При R² = 0,4 объяснено 40% разброса, а 60% приходится на факторы, которых в модели нет. Нулевое значение означает, что модель предсказывает не лучше обычного среднего.

Какой R² считается хорошим?

Зависит от области. В физических измерениях ждут значений выше 0,9, в поведенческих и опросных данных нормой считаются 0,1 и 0,2, потому что поступки людей зависят от множества неучтённых причин. Универсального порога нет, и гнаться за высоким значением ради него самого вредно.

Чем скорректированный R² отличается от обычного?

Он вычитает плату за число переменных в модели. Обычный R² от добавления любой переменной только растёт, даже если переменная это шум: в нашей симуляции пять случайных предикторов подняли его с 0,435 до 0,530. Скорректированный в той же ситуации остался около 0,41, поэтому именно он годится для сравнения моделей.

R² это то же самое, что квадрат корреляции?

Только для регрессии с одной переменной: там R² = r². В модели с несколькими предикторами такого равенства нет, R² описывает модель целиком, а не какую-то одну пару переменных.

Может ли R² быть отрицательным?

На обучающих данных нет, там минимум это ноль. А при проверке на новых данных запросто: если предсказания модели хуже, чем простое среднее, доля объяснённой дисперсии уходит в минус. Это надёжный признак переобучения.

Можно ли по R² выбрать модель?

По обычному нельзя: он всегда выберет самую перегруженную. Сравнивать надо по скорректированному R², а ещё лучше по качеству предсказаний на данных, которые модель не видела. И в любом случае перед выбором стоит посмотреть на график остатков.

Почему у одинакового R² бывают совсем разные данные?

Потому что R² сжимает всю картину в одно число. Классический пример это квартет Анскомба: четыре набора с одинаковыми средними, одной прямой и R² = 0,67, но в одном честный разброс, в другом дуга, в третьем выброс, в четвёртом всю связь создаёт одна точка. Поэтому метрику всегда смотрят вместе с графиком.

1

Не с чистого листа

Возьмите готовую анкету и поправьте под себя

Выбрать шаблон