Факторный анализ (Factor Analysis)
Обновлено 3 сентября 2026 Время чтения ≈ 8 мин.
Факторный анализ ищет за десятками вопросов анкеты несколько скрытых свойств, которые эти ответы порождают. Полезный результат он даёт только при трёх верных решениях. И в каждом привычный выбор по умолчанию оказывается не лучшим.
Что такое факторный анализ
Представьте анкету на тридцать утверждений об удобстве сервиса. Ответы на многие из них связаны между собой: кто хвалит скорость, обычно хвалит и отзывчивость поддержки. Факторный анализ предполагает, что за такими группами стоит несколько ненаблюдаемых свойств, и оценивает, насколько сильно каждое утверждение связано с каждым из них.
Ненаблюдаемые свойства называются факторами, а сила связи утверждения с фактором это факторная нагрузка. Долю дисперсии переменной, объяснённую факторами, называют общностью, и она пригодится дальше.
Разведочный и подтверждающий анализ решают разные задачи. Разведочный ищет структуру, когда гипотезы о ней нет: сколько факторов и какие. Подтверждающий проверяет заранее заданную структуру, и это уже другой аппарат, ближе к моделям структурных уравнений.
Главные компоненты это не факторный анализ
Самая частая и самая дорогая путаница в этой теме, и поддерживают её сами программы: в меню факторного анализа метод главных компонент нередко стоит выбором по умолчанию.
Насколько вероятно, что вы порекомендуете нас коллеге?
Вот и всё — такой опрос собирается за пару минут, а индекс WebAsk считает сам.
Создать свой опросРазница не в вычислениях. Она в модели. Главные компоненты сжимают переменные: компонента собирается из них как взвешенная сумма, и в неё входит вся дисперсия, включая шум. Факторный анализ идёт в обратную сторону: фактор считается причиной ответов, а уникальная и случайная часть дисперсии из модели выносится.
Практическое следствие: у компонент нагрузки систематически выше, потому что в них попадает уникальная дисперсия. Если задача звучит как «понять, что стоит за ответами», нужен факторный анализ. Если как «свести тридцать переменных к пяти показателям для регрессии», подойдут главные компоненты.
Что проверить до анализа
Два теста отвечают на один вопрос: годятся ли данные для факторного анализа вообще. Оба считаются автоматически.
Тест Бартлетта на сферичность проверяет, отличается ли корреляционная матрица от единичной. Если не отличается, переменные между собой не связаны, и раскладывать нечего. Тест должен эту гипотезу отвергнуть.
Мера Кайзера, Мейера и Олкина, сокращённо КМО, показывает, какая доля дисперсии в переменных может быть общей. Значение ниже 0,5 принято считать неприемлемым: связи в данных слишком слабые. Считать её можно и по каждой переменной отдельно, и так видно, какая из них выбивается.
Есть и третий инструмент, график собственных значений, он же scree plot. На нём ищут излом, после которого кривая выравнивается. Инструмент полезный, но решение по нему принимает глаз, поэтому опираться стоит на параллельный анализ, а график смотреть как подсказку.
Три решения, где ломается анализ
Сколько факторов оставить
Привычное правило: оставить столько факторов, сколько собственных значений больше единицы. Оно удобно и стоит по умолчанию во многих программах, но методисты рекомендуют его не использовать. Причина в том, что это лишь теоретическая нижняя граница числа компонент, и к общим факторам она отношения не имеет. Вдобавок собственные значения в выборке завышены случайной ошибкой, поэтому правило склонно оставлять лишние факторы.
Замена называется параллельным анализом. Джон Хорн предложил его в 1965 году именно как поправку к правилу единицы. Идея простая: рядом с вашими данными генерируется случайная матрица того же размера, и оставляются только те факторы, чьи собственные значения выше, чем у случайных данных. То есть порог берётся не из общего правила, а из вашей же задачи.
Какое вращение выбрать
Вращение не меняет качество решения. Оно перераспределяет нагрузки, чтобы факторы стало легче назвать словами. Выбор идёт между ортогональным, где факторы принудительно не связаны, и косоугольным, где они могут коррелировать.
Общая рекомендация такая: если про связь факторов заранее ничего не известно, берите косоугольное. Довод железный: если факторы на самом деле не связаны, косоугольное вращение само придёт к ортогональному решению. А вот обратное неверно, ортогональное вращение навяжет независимость там, где её нет.
Для установок, мнений и оценок удобства независимость факторов обычно неправдоподобна: довольный человек склонен ставить высокие оценки всему. Поэтому по умолчанию ортогональное вращение здесь неудачный выбор.
Сколько нужно респондентов
Правила вида «десять наблюдений на переменную» или «не меньше трёхсот» звучат уверенно, но эмпирической поддержки под ними нет. Маккаллум с соавторами показали, что нужный размер зависит не от числа переменных, а от двух других вещей.
- общности: насколько сильно переменные вообще связаны с факторами. При высоких общностях структура восстанавливается и на небольших выборках
- определённость факторов: сколько переменных приходится на каждый фактор. Фактор, за который отвечают две переменные, устойчивым не будет ни при каком размере выборки
Порядок величин у них такой: при общностях около 0,5 и хорошо определённых факторах хватает 100 до 200 наблюдений. При низких общностях структура не восстанавливается даже на очень больших выборках, и увеличение выборки тут не спасает.
Что делать с результатом
На выходе получается таблица нагрузок: строки это вопросы, столбцы факторы. Читают её так.
- Смотрят, какие вопросы сильно нагружены на каждый фактор, и по их смыслу дают фактору название.
- Отмечают вопросы, которые заметно нагружены сразу на несколько факторов. Такие формулировки обычно измеряют две вещи одновременно, и их стоит переписать.
- Отмечают вопросы, не нагруженные ни на что. Они либо лишние в анкете, либо измеряют что-то своё, для чего не хватило родственных вопросов.
- Проверяют, устойчива ли структура: на другой половине выборки или на новом замере факторы должны собираться так же.
Название фактора это ваша интерпретация. Вычисления его не дают. Метод показывает, что эти вопросы связаны, но не говорит, чем именно. Отсюда правило: если фактору не удаётся дать понятное имя, скорее всего решение переизвлечено и факторов стоит взять меньше.
Где он нужен в опросах
Ролей у метода две.
Сокращение анкеты. Если тридцать вопросов складываются в четыре фактора, а внутри каждого вопросы почти дублируют друг друга, анкету можно сократить без потери информации. Короткая анкета доходит до конца чаще, а это уже влияет на данные сильнее, чем точность измерения.
Проверка шкалы. Прежде чем считать по группе вопросов один индекс, полезно убедиться, что они действительно измеряют одно. Если они распадаются на два фактора, средний балл по ним смешивает два разных свойства, и его динамику будет невозможно объяснить.
Чего метод не делает, так это не проверяет причинность и не работает на маленьких анкетах. Пять вопросов на фактор это минимум, при трёх результат неустойчив, а на двух факторный анализ бессмысленен.
Как это сделано в WebAsk
Сам факторный анализ считается во внешних программах, поэтому от сервиса опросов нужны две вещи: собрать матрицу ответов и отдать её в удобном виде.
Ответы на шкальные вопросы выгружаются в Excel или CSV одной таблицей, где строка это респондент, а столбец вопрос. Это ровно тот формат, который ждут статистические пакеты, так что данные можно считать без предварительной перекладки. Подробнее об этом в карточке про экспорт данных.
Для самого анализа удобнее матричный вопрос: он даёт набор утверждений с одинаковой шкалой, а именно такие наборы и раскладываются на факторы. Разнородные вопросы с разными шкалами перед анализом придётся приводить к одному виду.
Факторные исследования: что это Кластерный анализ (Cluster Analysis)Коротко
- Факторный анализ ищет скрытые свойства за группами связанных ответов.
- Метод главных компонент решает другую задачу и завышает нагрузки, потому что включает уникальную дисперсию.
- Правило «собственные значения больше единицы» оставляет лишние факторы, вместо него берут параллельный анализ.
- При неизвестной связи факторов выбирают косоугольное вращение: при независимых факторах оно само даст ортогональное решение.
- Размер выборки определяется общностями и числом переменных на фактор, а не правилом «N на переменную».
- Если фактору нельзя дать понятное имя, факторов взято слишком много.
Вопросы и ответы
Чем факторный анализ отличается от метода главных компонент?
Моделью. Компонента собирается из переменных как взвешенная сумма и включает всю дисперсию, включая шум. Фактор считается причиной ответов, а уникальная часть дисперсии из модели исключается. Поэтому у компонент нагрузки систематически выше.
Сколько факторов оставлять?
Столько, сколько показал параллельный анализ, а не столько, сколько собственных значений превысило единицу. Правило единицы склонно оставлять лишние факторы. Дополнительная проверка простая: если фактору не удаётся дать понятное название, его лучше убрать.
Ортогональное или косоугольное вращение?
Косоугольное, если про связь факторов заранее ничего не известно. При независимых факторах оно само придёт к ортогональному решению, а ортогональное навяжет независимость там, где её нет. Для мнений и оценок независимость факторов обычно неправдоподобна.
Сколько респондентов нужно?
Правила «десять на переменную» эмпирически не подтверждены. Смотреть надо на общности и на число переменных на фактор: при общностях около 0,5 и хорошо определённых факторах хватает 100 до 200 наблюдений, а при низких общностях не хватит и очень большой выборки.
Что делать с вопросом, нагруженным на два фактора?
Скорее всего он измеряет две вещи одновременно. Такую формулировку стоит разделить на две или убрать из анкеты. Оставлять её в индексе не надо: она будет тянуть за собой оба свойства сразу.
Обновлено 3 сентября 2026 Опубликовано 19 апреля 2024
Дарья Лисовенко 
