О попарном ранжировании
Наука лучших решений.
Попарное сравнение — не новая идея. Его изучали, проверяли и подтверждали почти столетие исследований в психологии, экономике и науке о принятии решений.
От психофизики до залов заседаний
Метод, формализованный в 1927 году, — и с тех пор многократно подтверждённый.

Интеллектуальная история попарного сравнения начинается с практической задачи: как измерить то, у чего нет естественной единицы измерения?
Ответ предложил психолог Луис Леон Терстоун из Чикагского университета: сравнивать вещи напрямую, попарно. Его статья 1927 года A Law of Comparative Judgment («Закон сравнительного суждения») облекла эту идею в точную математическую модель.
Идея Терстоуна опиралась на эмпирическое наблюдение: людям гораздо легче ответить на вопрос «какой из этих двух звуков громче?», чем «насколько громок этот звук по шкале от одного до десяти?»
Почему пары работают лучше шкал
Когнитивная нагрузка при оценивании выше, чем кажется.
Когда вы просите человека оценить важность стратегического приоритета по шкале от одного до десяти, вы просите его выполнить сразу несколько когнитивных операций. На каждом шаге этот процесс вносит систематическую ошибку.
Самая вредная из этих ошибок — эффект привязки. Первый оцененный элемент обычно влияет на все последующие оценки; исследование Тверски и Канемана (1974) показало, что эффект привязки одновременно велик и удивительно устойчив к коррекции.
Второй источник ошибок — сжатие шкалы. На практике большинство респондентов избегают крайних значений шкалы и группируют ответы в середине — поэтому опрос о двенадцати приоритетах так часто возвращает двенадцать пунктов, и все «очень важные».
Всё взаимодействие, которое повторяется снова и снова, пока каждый элемент не будет сравнён со всеми остальными.
Попросите кого угодно оценить эти варианты по десятибалльной шкале — и оба получат девятку. Попросите выбрать — и человек ответит за секунду, причём всерьёз.
Как предпочтения превращаются в рейтинг
Метод агрегирования прост, прозрачен и математически обоснован.
Если нужно ранжировать n элементов, каждый элемент сравнивается с каждым другим ровно один раз. Общее число необходимых сравнений равно n(n−1)/2.
Агрегирование индивидуальных ответов
Оценка каждого элемента — это доля его побед: часть сравнений, которые он выиграл, причём ничья или пропуск засчитываются как половина. Упорядочивание элементов по числу побед простое и прозрачное, и исследования показывают, что оно хорошо выдерживает сравнение с более сложными статистическими моделями (Shah & Wainwright, 2018).
Агрегирование групповых ответов
В групповых сессиях сравнения каждого участника агрегируются до расчёта итогового рейтинга. Групповой итог по любому сравнению — это сумма индивидуальных голосов всех участников.
Важно, что агрегированный результат показывает и структуру разногласий. Элементы, которые разделяют группу, видны в данных — и зачастую это самый ценный итог групповой сессии.
Групповая сессия как инструмент диагностики
Упорядоченный список — не единственный итог. Структура разногласий не менее важна.
У традиционных методов группового принятия решений есть общий фундаментальный недостаток: они чувствительны к порядку, в котором высказываются мнения. Тот, кто говорит первым, задаёт точку отсчёта для всей группы.
Группы склонны обсуждать то, что уже знают все, и недостаточно использовать то, что знает лишь один участник. Это называется проблемой скрытого профиля (Stasser & Titus, 1985). Если собрать выбор каждого человека конфиденциально, до любого обсуждения, на столе окажется каждая точка зрения.
Где он используется
От психоакустики до обучения ИИ — метод масштабируется.
Стратегическое планирование и управление
Метод анализа иерархий применялся при принятии ответственных стратегических решений в обороне, инфраструктуре, здравоохранении и государственном управлении. Обзор 2008 года выявил более 900 опубликованных применений в 19 различных областях.
Машинное обучение и ИИ
Обучение с подкреплением на основе обратной связи от человека (RLHF) — метод, с помощью которого обучают современные большие языковые модели, — целиком опирается на попарное сравнение. Оценщикам показывают два ответа модели и просят выбрать лучший.
Спорт и соревновательные рейтинги
Рейтинговая система Эло, применяемая в шахматах, футболе и десятках других соревновательных областей, тесно связана с моделью парных сравнений Брэдли — Терри.
Что почитать
Первоисточники и ключевые тексты.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
Настройте индивидуальную или групповую сессию меньше чем за две минуты. Чтобы начать, учётная запись не нужна.