Про попарне ранжування
Наука кращих рішень.
Попарне порівняння — не нова ідея. Його вивчали, перевіряли й підтверджували впродовж майже століття досліджень у психології, економіці та науці про ухвалення рішень.
Від психофізики до залів засідань
Метод, формалізований 1927 року й відтоді багаторазово відтворений.

Інтелектуальна історія попарного порівняння починається з практичної проблеми: як виміряти те, що не має природної одиниці виміру?
Відповідь, запропонована психологом Луїсом Леоном Терстоуном із Чиказького університету, полягала в тому, щоб порівнювати речі безпосередньо, попарно. Його стаття 1927 року A Law of Comparative Judgment перетворила цю ідею на точну математичну модель.
Ідея Терстоуна ґрунтувалася на емпіричному спостереженні: люди значно краще відповідають на запитання «який із цих двох звуків гучніший?», ніж «наскільки гучний цей звук за шкалою від одного до десяти?»
Чому пари працюють краще за шкали
Когнітивне навантаження під час оцінювання вище, ніж здається.
Коли ви просите когось оцінити важливість стратегічного пріоритету за шкалою від одного до десяти, ви просите людину виконати кілька когнітивних операцій одночасно. Цей процес вносить систематичну похибку на кожному кроці.
Найшкідливіша з цих похибок — ефект якоря. Перший оцінений елемент зазвичай впливає на всі наступні оцінки; дослідження Тверскі й Канемана (1974) показало, що ефект якоря великий і напрочуд стійкий до виправлення.
Друге джерело похибки — стиснення шкали. На практиці більшість респондентів уникає крайніх значень шкали й зосереджує відповіді посередині — саме тому опитування про дванадцять пріоритетів так часто повертає дванадцять пунктів, і всі вони «дуже важливі».
Уся взаємодія, яка повторюється знову і знову, доки кожен елемент не буде порівняно з кожним іншим.
Попросіть будь-кого оцінити це за десятибальною шкалою — і обидва варіанти отримають дев’ятку. Попросіть вибрати — і людина відповість за секунду, причому щиро.
Як уподобання стають рейтингом
Метод агрегування простий, прозорий і математично обґрунтований.
Якщо потрібно ранжувати n елементів, кожен елемент порівнюється з кожним іншим рівно один раз. Загальна кількість потрібних порівнянь становить n(n−1)/2.
Агрегування індивідуальних відповідей
Оцінка кожного елемента — це частка його перемог: частина порівнянь, які він виграв, причому нічия або пропуск зараховуються як половина. Упорядкування елементів за кількістю перемог просте й прозоре, і дослідження показують, що воно добре витримує порівняння зі складнішими статистичними моделями (Shah & Wainwright, 2018).
Агрегування групових відповідей
У групових сесіях порівняння кожного учасника агрегуються до обчислення підсумкового рейтингу. Груповий підсумок перемог для будь-якого порівняння — це сума індивідуальних голосів усіх учасників.
Важливо, що агрегований результат також показує форму розбіжностей. Елементи, які розділяють групу, видно в даних — і часто саме це є найціннішим результатом групової сесії.
Групова сесія як діагностичний інструмент
Упорядкований список — не єдиний результат. Форма розбіжностей не менш важлива.
Традиційні методи групового ухвалення рішень мають спільну фундаментальну ваду: вони чутливі до порядку, у якому висловлюються думки. Той, хто говорить першим, задає якір для всієї групи.
Групи схильні обговорювати те, що вже знають усі, і недостатньо використовувати те, що знає лише один учасник. Це називають проблемою прихованого профілю (Stasser & Titus, 1985). Якщо зібрати вибір кожної людини приватно, до будь-якого обговорення, на столі опиниться кожна думка.
Де це використовують
Від психоакустики до навчання ШІ — метод масштабується.
Стратегічне планування й управління
Метод аналізу ієрархій (AHP) використовували для стратегічних рішень із високими ставками в обороні, інфраструктурі, охороні здоров’я та державному управлінні. Огляд 2008 року виявив понад 900 опублікованих застосувань у 19 різних галузях.
Машинне навчання та ШІ
Навчання з підкріпленням на основі людського зворотного зв’язку (RLHF) — техніка, за якою навчають сучасні великі мовні моделі, — повністю спирається на попарне порівняння. Оцінювачам показують дві відповіді моделі й просять вибрати кращу.
Спорт і змагальні рейтинги
Рейтингова система Ело, що використовується в шахах, футболі та десятках інших змагальних сфер, тісно пов’язана з моделлю попарного порівняння Бредлі — Террі.
Додаткова література
Першоджерела й ключові тексти.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
Налаштуйте індивідуальну або групову сесію менш ніж за дві хвилини. Щоб почати, обліковий запис не потрібен.