Содержание

Каждое мнение важно

Создайте опрос и превратите обратную связь в источник роста

Создать сейчас
Лого WebAsk

Оценка эффективности персонала: от критериев до итогового балла

Оценка и развитие сотрудников
Оценка эффективности персонала: от критериев до итогового балла

Про оценку эффективности персонала написано много, но почти всегда это перечень методов, после которого непонятно, что делать в понедельник. Здесь другой разговор: как собрать работающую конструкцию и посчитать результат.

Разберём один цикл насквозь: от отбора критериев до цифры, на которую можно опереться в решении о премии или плане развития. Формулы будут с подставленными числами, шкала с расшифровкой каждого деления, а веса источников с обоснованием, почему именно такие. Отдельный разговор будет про границы: опрос закрывает не всё, и честнее сказать об этом заранее, чем выдать среднюю оценку коллег за измерение выработки.

Если вам нужен не расчёт, а перебор подходов, посмотрите каталог методов деловой оценки персонала: там разобраны ассесмент-центр, матрица потенциала, интервью по компетенциям и остальные десять способов. Место оценки в общей картине показано в разборе этапов HR-цикла.

Что именно вы собираетесь измерить

Слово «эффективность» в HR склеивает три разные вещи, и первый шаг это их развести. Результат это то, что человек произвёл: выручка, закрытые задачи, обработанные обращения. Поведение это то, как он это делал: качество разбора инцидента, помощь коллегам, работа со смежниками. Соблюдение стандартов это дисциплина процесса: оформление сделки по регламенту, ведение документации, реакция в срок.

Разводить их приходится потому, что берутся они из разных мест. Результат живёт в CRM, трекере и финансовом учёте, и спрашивать про него у коллег бессмысленно. Поведение в логах не лежит вообще, его видят только люди вокруг, и здесь опрос единственный источник. Мета-анализ Bommer и коллег показал, что объективные показатели и субъективные оценки по одним и тем же людям связаны на уровне 0,39. Это не «примерно одно и то же с погрешностью», это два разных измерения, и подменять одно другим нельзя ни в какую сторону.

Три типа критериев оценки эффективности персонала и источники данных для каждого

Отсюда практическое правило: сначала для каждого критерия назовите источник данных, потом решайте, попадёт ли он в анкету. Если критерий закрывается выгрузкой, тащить его в опрос не надо, оценка руководителя «обычно отвечает быстро» хуже, чем реальное время реакции из сервис-деска.

Тип критерияПримерОткуда берётсяМесто в анкетеКак часто обновляется
РезультатВыполнение плана, число закрытых задачCRM, трекер, финансовый учётНе спрашивать, подставлять цифройНепрерывно
ПоведениеРазбор ошибок, наставничество, коммуникацияОпрос руководителя и коллегЯдро анкетыРаз в цикл
Соблюдение стандартовОформление по регламенту, срок реакцииЛоги систем, аудитНе спрашивать, подставлять цифройНепрерывно
Восприятие системыПонятность критериев, ощущение справедливостиОпрос сотрудниковОтдельный короткий замерПосле цикла

Четвёртая строка часто выпадает, а зря. Насколько сотрудники считают саму оценку справедливой, не покажет никакая выгрузка, и это единственная зона, где опрос вообще не имеет альтернатив. Данные Gallup по этому месту невесёлые: только 29 процентов работников полностью согласны, что оценка справедлива, 26 процентов, что она точна, и 14 процентов, что она мотивирует работать лучше. Если не мерить восприятие, вы не узнаете, что цикл превратился в ритуал.

Как отобрать пять критериев из двадцати

Список кандидатов у любого руководителя разрастается сам: клиентоориентированность, инициативность, ответственность, командность, и так до бесконечности. Рабочий диапазон это пять-семь критериев, и не потому, что так красивее, а потому, что оценщик физически не удерживает больше. Форма из двадцати пяти пунктов заполняется по диагонали, и вы получаете не оценку, а шум с ровными четвёрками.

WebAsk · сервис опросов Спросите свою аудиторию Готовые шаблоны, ветвления по ответам и отчёты — опрос собирается за пару минут Создать опрос

Сокращать помогают три фильтра. Первый: критерий должен быть в зоне контроля сотрудника. Если продажи упали из-за смены линейки, а не из-за менеджера, критерий «выполнение плана» с весом 40 процентов измеряет решения маркетинга, а не человека. Второй: критерий должен быть наблюдаем тем, кого вы спрашиваете. Коллега из соседней команды не видел, как человек разбирает инциденты, и его оценка по этому пункту это догадка. Третий: два критерия не должны быть одним и тем же под разными именами, иначе вес удваивается незаметно. Проверить это можно калькулятором альфы Кронбаха: если пункты дают очень высокую согласованность, они дублируют друг друга и один надо убрать.

Самая частая поломка на этом шаге это расплывчатая формулировка. «Клиентоориентированность» не оценивается, оценивается наблюдаемое действие. Переведите критерий в конкретное поведение, которое можно было увидеть: «в течение рабочего дня отвечает на запрос клиента, даже если ответ промежуточный», «после жалобы возвращается к клиенту с результатом разбора». Правило простое: один пункт это одно действие. Если в формулировке появилось «и», пункт надо делить, иначе оценщик не знает, что ставить, когда первая половина выполнена, а вторая нет.

Шкала: сколько делений и что означает каждое

Российская практика тут разнородная. По исследованию ЭКОПСИ, охватившему 249 организаций, четырёхбалльную шкалу используют 29 процентов компаний, пятибалльную 23 процента, трёхбалльную 16 процентов, дальше идут проценты от нуля до ста, бинарная и десятибалльная, а у 12 процентов формализованной шкалы нет вообще.

Что говорят измерения. Preston и Colman показали, что ретестовая надёжность минимальна на двух-четырёх градациях и выходит на максимум в диапазоне от семи до десяти, а после десяти снова падает. Bandalos и Enders получили максимум на пяти-семи. Пересечение этих результатов и есть ответ: пять или семь делений. Трёхбалльная шкала теряет различия, десятибалльная создаёт иллюзию точности, которой у оценщика нет. Подробнее про устройство шкал в карточке шкалы Лайкерта.

Гораздо важнее числа делений то, подписаны ли они словами. Голая шкала от 1 до 5 у разных руководителей означает разное, и сравнивать их оценки нельзя. Поведенческие якоря снимают эту проблему: вместо цифры оценщик выбирает описание, которое ближе к тому, что он видел.

Сравнение голой числовой шкалы и шкалы с поведенческими якорями при оценке сотрудника
БаллЯкорь для критерия «разбор обращения клиента»Что видит оценщикТипичная ошибка без якоряДоля таких оценок в норме
1Обращение теряется, клиент напоминает самПовторные жалобы по одному поводуСтавят 3 из жалостиЕдиницы
3Отвечает по существу, но к первопричине не возвращаетсяПроблема закрыта, но повторяетсяСтавят 4 «в целом нормально»Основная масса
5Разбирает причину и меняет процесс, чтобы не повторилосьКласс обращений исчезаетСтавят 5 за один яркий случайЕдиницы
N/AНе наблюдал такие ситуации в этом периодеОценщик не пересекался по задачамСтавят среднее вместо пропускаЗависит от роли

Вариант «не наблюдал» обязателен. Без него оценщик, который просто не видел поведения, поставит середину, и вы получите чистый шум, замаскированный под данные. Пустой ответ честнее выдуманного. Как распределение по шкале превращается в цифры, показывает калькулятор шкалы Лайкерта: средний балл сглаживает края, а доля верхних двух делений показывает реальную долю сильных оценок.

Кто оценивает и сколько весит каждый источник

Здесь лежит факт, который меняет отношение ко всей конструкции. Scullen, Mount и Goff разобрали дисперсию оценок на двух выборках менеджеров, где каждого оценивали по семь человек, и получили, что от 53 до 62 процентов разброса объясняется особенностями конкретного оценщика, а не оцениваемого. Больше половины того, что вы считаете оценкой человека, это на самом деле почерк того, кто ставил балл.

Доля дисперсии оценок, которую объясняет сам оценщик, по данным Scullen, Mount и Goff

Отсюда прямое следствие: один оценщик это не измерение, а мнение. Даже два руководителя по общей результативности сходятся на уровне 0,56, по данным мета-анализа 219 выборок общим объёмом почти 42 тысячи человек. Greguras и Robie посчитали, сколько оценщиков нужно, чтобы надёжность дошла до приемлемых 0,70, и цифры отрезвляют: четыре руководителя, восемь коллег или девять подчинённых. Двумя оценщиками такой надёжности не достичь в принципе, и это не повод отказаться от оценки, а повод не выдавать её за точное измерение.

Второе следствие касается цели. В том же мета-анализе согласованность падает до 0,45, когда оценка идёт под кадровое решение, и держится на 0,61, когда она исследовательская. Как только от балла зависит премия, оценщики начинают ставить не то, что видят. Тот же эффект в 360: обзор Nowack и Mashihi даёт средний размер эффекта 0,25 при развивающей цели против 0,08 там, где результаты использовали для кадровых решений, то есть втрое хуже. Практический вывод жёсткий: оценку 360 градусов не стоит привязывать к премии, её ценность в развитии.

Самооценка это отдельный инструмент с отдельной задачей. Heidemeier и Moser по 128 выборкам получили корреляцию самооценки с оценкой руководителя 0,22 в наблюдаемом виде и 0,34 с поправкой на погрешность измерения, причём систематическое завышение подтверждено для западных выборок и его величина зависит от культурного контекста. Самооценка не измеряет результат, она нужна ровно для одного: увидеть разрыв. Расхождение в два деления между тем, как человек видит себя, и тем, как его видит руководитель, это готовая повестка для разговора один на один.

ИсточникЧто оцениваетВес в итогеСколько оценщиковЧего от него не ждать
РуководительРезультат и поведение целиком50%1, при матричной структуре 2Независимости от личного отношения
КоллегиВзаимодействие, помощь, наставничество30%3 и больше, иначе анонимность не держитсяОценки результата, они его не видят
СамооценкаРазрыв с внешним взглядом20% или 0%1Точности, завышение системно
ПодчинённыеУправленческое поведениеТолько для руководителейОт 5, ниже не анонимноОценки экспертизы

Вес самооценки в 20 процентов это компромисс, и он спорный: многие компании ставят 0 и используют самооценку исключительно для гэп-анализа. Оба варианта рабочие, главное решить заранее и не менять по ходу цикла. Сходятся ли два источника, проверяется ранговой корреляцией Спирмена, она подходит для порядковых шкал лучше обычной. Как собрать несколько углов оценки технически, разобрано в материале про опросы сотрудников, а готовая заготовка есть в шаблоне оценки 360.

Расчёт итогового балла

Теперь арифметика, которой почти нигде нет. Проблема в том, что критерии измерены в разных единицах: выполнение плана в процентах, поведение в делениях от 1 до 5, соблюдение регламента снова в процентах. Складывать их напрямую нельзя, сначала всё переводится в одну шкалу от 0 до 100.

Правила перевода простые. Процент выполнения плана переносится как есть, но с потолком, иначе один перевыполненный показатель вытянет весь итог. Шкальная оценка переводится формулой (оценка минус 1), делённая на 4, умноженная на 100, так пятёрка даёт 100 баллов, а единица ноль. Процент соблюдения переносится как есть. Механику можно не считать руками, для этого есть калькулятор нормализации баллов.

Возьмём условного менеджера по работе с клиентами за квартал.

КритерийИсточникФактБалл 0–100ВесВклад в итог
Выполнение плана по выручкеCRM92% плана92,030%27,6
Доля продлённых договоровCRM78% при цели 70%111,020%22,2
Качество разбора обращенийРуководитель3 из 550,020%10,0
Помощь коллегамТрое коллег4,3 из 582,515%12,4
Соблюдение регламента в CRMЛоги88% сделок88,015%13,2
Итог100%85,4
Сквозной расчёт итогового балла сотрудника: нормализация показателей и взвешивание

Итог 85,4 из 100 выглядит отличным результатом, и вот тут ловушка, ради которой этот пример и собран. Критерий «качество разбора обращений» стоит на 50 баллах, ровно на половине шкалы, а итоговая цифра его полностью прячет. Взвешенный балл сглаживает провалы по определению, это его свойство, а не дефект. Поэтому в правилах цикла нужна вторая строка: итог принимается только если ни один критерий не опустился ниже порога, скажем 60 баллов. Иначе разговор идёт не про премию, а про конкретную зону.

Заметьте и второе: продления дали 111 баллов, потому что цель перевыполнена. Без потолка этот критерий подарил итогу лишние 2,2 балла и частично компенсировал провал по поведению. Потолок в 100 или 120 баллов надо задать до старта цикла, а не после того, как увидели результаты. Сама свёртка с весами считается калькулятором взвешенного балла.

Искажения, которые ломают расчёт

Аккуратная формула не спасает от того, что происходит в голове оценщика. Гало-эффект заставляет один яркий проект тянуть вверх все баллы разом, и человек, который спас квартал, получает пятёрки в том числе по критериям, где ничем не отличился. Подробности механики в карточке гало-эффекта. Эффект недавности сжимает период оценки до последних трёх недель, потому что остальное забылось. Центральная тенденция сгоняет всё к середине, когда оценщик не хочет объясняться за крайние баллы.

Масштаб снисходительности лучше всего виден на большой популяции. Счётная палата США разобрала оценки 1,2 миллиона федеральных служащих за 2013 год: 99 процентов получили «полностью успешно» или выше, из них около 61 процента высшую оценку. Шкала, на которой почти все отличники, не различает никого, и решения на её основе принимать невозможно.

Против этого работают три приёма. Якорные формулировки, о которых говорили выше, снимают часть произвола. Относительная формулировка пункта, «в сравнении с другими на этой роли», эмпирически сбивает снисходительность лучше абсолютной. И калибровка: руководители разных отделов до финализации сверяют, что четвёрка в продажах означает то же, что четвёрка в разработке. Без калибровки итоговые баллы разных подразделений просто несопоставимы, и общий рейтинг превращается в рейтинг мягкости начальников.

Диагностика тут простая и считается на коленке. Посмотрите разброс оценок внутри каждого оценщика через стандартное отклонение: руководитель, у которого разброс близок к нулю, поставил всем одно и то же и ничего не измерил. Отсечки для решений удобнее строить не на среднем, а на квартилях, для этого есть калькулятор медианы и перцентилей. А если сравниваете отделы между собой, проверьте, что различие вообще не случайно: автопоиск различий покажет и значимость, и размер эффекта, а калькулятор размера выборки ответит, хватает ли ответов, чтобы срез по отделу что-то значил.

Что делать с результатом

Цикл, который заканчивается таблицей баллов, не заканчивается ничем. Диапазоны решений задаются до начала оценки, иначе пороги подгоняются под уже известные результаты и вся конструкция теряет смысл.

Итоговый баллЧто это значитРешениеКто принимаетСрок
Ниже 60Систематическое отставаниеПлан исправления на 60–90 дней с промежуточной точкойРуководитель и HRBPДве недели после цикла
60–79Норма с зонами ростаИндивидуальный план развития по слабейшему критериюРуководительМесяц
80–89Уверенно выше нормыПремия по вилке, расширение зоны ответственностиРуководительБлижайший расчёт
90 и вышеВерхний квартильКадровый резерв, пересмотр вилкиКомитет по вознаграждениюКвартал

Отдельно про обратную связь, потому что это место, где цикл чаще всего наносит вред. Мета-анализ Kluger и DeNisi по 607 размерам эффекта и почти 24 тысячам наблюдений даёт средний положительный эффект обратной связи 0,41, но более чем в трети случаев результат после обратной связи ухудшался. Механизм известен: вред возникает, когда внимание уходит с задачи на самого человека. Разговор про то, какое поведение изменить и как, работает. Разговор про то, какой человек в целом, разрушает.

Поэтому в разговоре по итогам полезнее опираться не на итоговую цифру, а на профиль по критериям и на разрыв самооценки с оценкой руководителя. У нашего условного менеджера повестка очевидна: 85,4 общий балл при 50 по разбору обращений, и если сам он поставил себе по этому пункту пятёрку, обсуждать надо именно это расхождение. Оформить итоги цикла для руководства помогает сборка отчёта из CSV.

Наконец, проверьте, что цикл не ломает то, ради чего затевался. После оценки имеет смысл замерить фон: eNPS и вовлечённость покажут, не превратился ли review в источник тревоги, а выходные интервью дадут понять, не выталкивает ли система людей. По данным Gallup, 48 процентов сотрудников оцениваются раз в год, а ещё 26 процентов реже, и годовая периодичность заметно запаздывает под любое управленческое решение.

Когда опрос не тот инструмент

Честная граница полезнее универсального обещания. Опрос закрывает ровно то, чего нет в логах, и попытка натянуть его на остальное портит и оценку, и доверие к ней.

ЗадачаОпросомЧем на самом делеПочему так
Выработка, объём закрытых задачНетТрекер, CRM, сервис-дескМнение о скорости не равно скорости
Выручка, маржа, выполнение планаНетФинансовый учётСвязь субъективного с объективным около 0,39
Соблюдение SLA, время реакцииНетЛоги системТочная величина уже измерена
Наблюдаемое поведение, взаимодействиеДаОпрос руководителя и коллегДругих источников не существует
Восприятие справедливости оценкиДаКороткий замер после циклаАльтернатив нет вообще
Причина падения результатаНетРазбор процессаРейтинг человека маскирует системную причину

Последняя строка важнее остальных. Когда результат просел из-за процесса, ресурсов или смежников, оценка человека переводит системную проблему в личную и закрывает возможность её увидеть. Прежде чем ставить низкий балл, стоит проверить, был ли критерий вообще в зоне контроля сотрудника.

Собрать анкету под цикл, развести доступы оценщиков и получить срезы по ролям и командам можно на странице опросов для performance review. Если задача уже переросла конструктор и нужна полноценная HR-платформа с историей сотрудника, ориентиры есть в подборке сервисов оценки 360. А про то, как оценка знаний и квалификации устроена отдельно от оценки поведения, написано в материале об аттестации персонала.

Частые вопросы

Сколько критериев брать в оценку эффективности персонала?

Пять-семь. Это не эстетическое предпочтение, а предел внимания оценщика: длинную форму заполняют по диагонали, и вместо различий вы получаете ровные средние баллы. Если критериев набралось двадцать, уберите те, что вне зоны контроля сотрудника, ненаблюдаемы для конкретного оценщика или дублируют друг друга.

Какую шкалу выбрать, пятибалльную или десятибалльную?

Пять или семь делений. Ретестовая надёжность минимальна на двух-четырёх градациях, а десятибалльная шкала создаёт видимость точности, которой у оценщика нет. Важнее числа делений то, подписано ли каждое словами: без поведенческих якорей четвёрка у разных руководителей означает разное, и их оценки несопоставимы.

Можно ли привязывать результаты 360 к премии?

Лучше не стоит. Когда от оценки зависит кадровое решение, согласованность оценщиков падает с 0,61 до 0,45, а измеренный эффект 360 на изменение поведения снижается с 0,25 до 0,08, то есть примерно втрое. Для решений о вознаграждении надёжнее оценка руководителя вместе с показателями из учётных систем, а 360 оставить развивающим инструментом.

Как свести показатели в разных единицах в один балл?

Сначала перевести всё в общую шкалу от 0 до 100: проценты выполнения переносятся как есть с заранее заданным потолком, шкальные оценки по формуле (оценка минус 1) делить на 4 и умножить на 100. Затем умножить каждый нормированный балл на вес критерия и сложить. Веса в сумме должны давать 100 процентов.

Что делать, если самооценка сильно расходится с оценкой руководителя?

Это не ошибка данных, а сам результат. Корреляция самооценки с оценкой руководителя около 0,22, расхождение это норма, и ценность самооценки именно в нём. Разрыв в два деления и больше по конкретному критерию задаёт повестку разговора один на один: обсуждать надо не итоговую цифру, а то, почему видение разошлось.

Как часто проводить оценку?

Годовой цикл, по которому работает почти половина компаний, запаздывает под любое решение: к моменту разговора половина периода забыта, а исправлять уже поздно. Разумный компромисс это квартальный или полугодовой цикл по неизменному ядру критериев, чтобы волны оставались сравнимыми, плюс короткий замер восприятия самой системы после каждого цикла.

1

Каждое мнение важно

Создайте опрос и превратите обратную связь в источник роста

Создать сейчас
Еще больше интересного в нашем Telegram канале!

Никакого спама, только самое актуальное