Коэффициент детерминации (R², R-squared)
28 августа 2026 Время чтения ≈ 11 мин.
R² показывает, какую долю разброса зависимой переменной объясняет модель. Значение 0,4 означает, что модель забрала на себя 40% дисперсии, а остальные 60% остались необъяснёнными.
Показатель удобный и потому опасный: он выглядит как оценка качества модели, но качеством не является. Ниже разберём, что он считает, почему растёт сам по себе и в каких случаях ему нельзя верить.
Что именно означает доля объяснённой дисперсии
Возьмите разброс ответов вокруг их среднего, то есть дисперсию. Это то, что нужно объяснить. Теперь постройте модель и посчитайте, какой разброс остался вокруг её предсказаний. R² это доля, на которую второе меньше первого.
Отсюда сразу два вывода. Первый: R² всегда сравнивает вашу модель с одной и той же отправной точкой, со средним. Второй: показатель безразмерный, поэтому его нельзя перевести в рубли, секунды или баллы, и «объяснено 40%» не означает «предсказываем с точностью 40%».
Откуда название и как считается
«Детерминация» здесь означает определённость: показатель говорит, насколько поведение результата определено моделью. Буква R пришла от коэффициента множественной корреляции, квадрат которого и даёт R² в линейной модели.
Насколько вероятно, что вы порекомендуете нас коллеге?
Вот и всё — такой опрос собирается за пару минут, а индекс WebAsk считает сам.
Выбрать шаблонСчитается он через суммы квадратов. Берут общий разброс результата вокруг среднего, берут остаточный разброс вокруг предсказаний модели и делят второе на первое, а результат вычитают из единицы. То есть R² = 1 − остаточная сумма квадратов / общая сумма квадратов. В этой записи хорошо видно, почему ноль означает «модель не лучше среднего», а единица «остатков не осталось».
Когда R² это просто квадрат корреляции
Для простой регрессии с одной переменной R² действительно равен квадрату коэффициента корреляции. Разбор этой связки с числами есть в статье про корреляцию Пирсона, поэтому повторять его здесь смысла нет.
А вот в модели с несколькими переменными этого равенства уже нет: R² считается по всей модели сразу, и никакого одного коэффициента корреляции, чей квадрат он бы повторял, там не существует. Путаница на этом месте частая, потому что название «квадрат» подсказывает неверную интуицию.
Одинаковый R², разные данные
Это классическая демонстрация того, почему нельзя судить о модели по одному числу. В первом наборе обычный разброс вокруг прямой. Во втором данные лежат на дуге, и линейная модель им не подходит принципиально. В третьем идеальная прямая плюс один выброс, который её и наклонил. В четвёртом почти все точки стоят в одном значении x, а всю связь создаёт единственное наблюдение сбоку.
R² у всех четырёх равен 0,67. Никакой из этих четырёх ситуаций он не различает, поэтому первым делом на данные надо смотреть, а не считать метрики.
Почему R² всегда растёт
Ключевое свойство, которое делает показатель уязвимым: добавление любой переменной в модель не может уменьшить R². Даже если переменная не имеет к делу никакого отношения, модель найдёт в ней случайное совпадение и подгонит немного лучше.
На диаграмме результат двух тысяч симуляций. Выборка из тридцати наблюдений, одна настоящая переменная и до пяти переменных, сгенерированных как случайный шум. Обычный R² уверенно растёт с 0,435 до 0,530, хотя объяснять там нечего. Скорректированный R² остаётся на месте, 0,414 против 0,408.
Тот же смысл в дисперсионном анализе
Если сравниваются не числа, а группы, роль R² играет эта-квадрат: доля межгрупповой дисперсии в общей. Смысл ровно тот же, только вместо предсказаний модели выступает принадлежность к группе.
В карточке про дисперсию есть готовый пример: оценки в трёх отделах, общая дисперсия 0,693, из неё межгрупповая часть 0,323. Отношение даёт 0,47, то есть отдел объясняет 47% разброса оценок. Это и есть эта-квадрат, и в отчёте его читают так же, как R²: почти половина различий связана с тем, где человек работает, остальное с чем-то другим. Проверяет значимость такого разложения дисперсионный анализ.
Высокий R² не означает хорошую модель
- Проверьте, что данные не временной ряд: у показателей, которые просто растут во времени, R² легко получается выше 0,9 без всякой содержательной связи
- Посмотрите на число переменных против числа наблюдений: на тридцати ответах и десяти предикторах высокий R² почти гарантирован и почти ничего не значит
- Не сравнивайте R² моделей, построенных на разных наборах данных или на разных зависимых переменных, это несравнимые числа
- Не выбирайте модель по максимуму R², так вы выберете самую перегруженную из них
Есть и обратная ошибка: считать низкий R² приговором. В поведенческих данных значения 0,1 и 0,2 это норма, потому что поступки людей зависят от десятков факторов, которых в анкете нет. Модель с R² = 0,15 может быть полезной, если коэффициенты значимы и величина эффекта осмысленна для решения.
Чего R² не показывает
- Причинность. Высокая объяснённая доля не означает, что переменные влияют на результат. Причинность обеспечивается дизайном исследования, а не подгонкой.
- Правильность формы связи. Второй набор Анскомба это дуга, а R² у него такой же, как у честной прямой.
- Точность конкретного предсказания. Для этого смотрят на ошибку в единицах данных, например среднюю абсолютную ошибку.
- Значимость. Модель с приличным R² на маленькой выборке может не иметь ни одного значимого коэффициента, и наоборот. Значимость проверяется отдельно, см. карточку про статистическую значимость.
- Силу связи категориальных признаков. Когда обе переменные категориальные, регрессии не возникает вовсе, и связь измеряют хи-квадратом вместе с V Крамера.
R² и соседние показатели
| Показатель | Что измеряет | Диапазон |
|---|---|---|
| Коэффициент корреляции r | тесноту и направление линейной связи двух переменных | от минус 1 до 1 |
| R² | долю объяснённой дисперсии в модели | от 0 до 1, вне выборки бывает и меньше нуля |
| Скорректированный R² | то же с платой за число переменных | меньше R², может быть отрицательным |
| Ро Спирмена | согласованность порядка, а не значений | от минус 1 до 1 |
| V Крамера | насколько жёстко связаны две категориальные переменные | от 0 до 1 |
Общая логика того, зачем рядом с значимостью смотреть на величину эффекта, описана в карточке про размер эффекта. R² в этой логике играет роль меры эффекта для регрессии.
Где показатель нужен в опросах
- Поиск драйверов удовлетворённости. Строите модель, где итоговая оценка зависит от оценок отдельных этапов. R² покажет, насколько эти этапы вообще объясняют общее впечатление. Значение около 0,5 говорит, что вы поймали главное, значение 0,1 что решающий фактор в анкету не попал.
- Проверка длины анкеты. Модель, где доля брошенных анкет зависит от числа вопросов и времени прохождения, обычно даёт высокий R², и это тот редкий случай, когда высокое значение осмысленно: связь механическая.
- Отсев лишних вопросов. Если добавление блока вопросов не поднимает скорректированный R², блок не несёт информации о результате, и его можно убрать из анкеты. Это прямой способ сократить опрос, не потеряв объясняющую силу.
Во всех трёх сценариях полезно помнить главное ограничение: R² описывает данные, которые у вас уже есть. Он ничего не говорит о том, как модель поведёт себя на следующей волне опроса, и именно поэтому её стоит проверять на новых ответах.
Как это сделано в WebAsk
Для регрессии нужны числовые и шкальные вопросы, а рядом с ними годятся метрики из вашей системы, если вы сопоставляете их с ответами. Выгрузка идёт в Excel или CSV, сама регрессия считается функцией ЛИНЕЙН или статпакетом, и R² приходит в её выдаче без отдельных действий.
Если переменных всего две, начните с простого: посчитайте связь калькулятором корреляции Пирсона и возведите r в квадрат, это и будет R² для такой модели. Смысл раскладки на объяснённую и необъяснённую часть подробно разобран в карточке про дисперсию.
Собрать данные можно бесплатно: заведите в конструкторе WebAsk пару числовых вопросов, выгрузите столбцы и посмотрите, сколько разброса объясняется, а сколько остаётся за пределами модели.
Частые вопросы
Что показывает R² простыми словами?
Какую часть разброса в ответах модель сумела объяснить. При R² = 0,4 объяснено 40% разброса, а 60% приходится на факторы, которых в модели нет. Нулевое значение означает, что модель предсказывает не лучше обычного среднего.
Какой R² считается хорошим?
Зависит от области. В физических измерениях ждут значений выше 0,9, в поведенческих и опросных данных нормой считаются 0,1 и 0,2, потому что поступки людей зависят от множества неучтённых причин. Универсального порога нет, и гнаться за высоким значением ради него самого вредно.
Чем скорректированный R² отличается от обычного?
Он вычитает плату за число переменных в модели. Обычный R² от добавления любой переменной только растёт, даже если переменная это шум: в нашей симуляции пять случайных предикторов подняли его с 0,435 до 0,530. Скорректированный в той же ситуации остался около 0,41, поэтому именно он годится для сравнения моделей.
R² это то же самое, что квадрат корреляции?
Только для регрессии с одной переменной: там R² = r². В модели с несколькими предикторами такого равенства нет, R² описывает модель целиком, а не какую-то одну пару переменных.
Может ли R² быть отрицательным?
На обучающих данных нет, там минимум это ноль. А при проверке на новых данных запросто: если предсказания модели хуже, чем простое среднее, доля объяснённой дисперсии уходит в минус. Это надёжный признак переобучения.
Можно ли по R² выбрать модель?
По обычному нельзя: он всегда выберет самую перегруженную. Сравнивать надо по скорректированному R², а ещё лучше по качеству предсказаний на данных, которые модель не видела. И в любом случае перед выбором стоит посмотреть на график остатков.
Почему у одинакового R² бывают совсем разные данные?
Потому что R² сжимает всю картину в одно число. Классический пример это квартет Анскомба: четыре набора с одинаковыми средними, одной прямой и R² = 0,67, но в одном честный разброс, в другом дуга, в третьем выброс, в четвёртом всю связь создаёт одна точка. Поэтому метрику всегда смотрят вместе с графиком.
Опубликовано 28 августа 2026
Алексей Логинов