За класирането по двойки

Науката за по-добрите решения.

Сравнението по двойки не е нова идея. То е изучавано, тествано и потвърждавано в продължение на почти век изследвания в психологията, икономиката и науката за решенията.

1927 Търстоун формализира метода
900+ публикувани приложения в 19 области
14 независими изследвания, в които двойките надминават скалите
Пишеща машина, бележник и молив

От психофизиката до заседателните зали

Метод, формализиран през 1927 г. — и потвърждаван оттогава отново и отново.

Търстоун, A Law of Comparative Judgment, Чикагски университет, 1927 г.

Интелектуалната история на сравнението по двойки започва с практически проблем: как да измериш неща, които нямат естествена мерна единица?

Отговорът, предложен от психолога Луис Леон Търстоун от Чикагския университет, бил нещата да се сравняват пряко, по двойки. Статията му от 1927 г., A Law of Comparative Judgment, превръща тази идея в точен математически модел.

„Методът на сравненията по двойки дава скала на психологическите стойности, по-надеждна от всеки друг метод за скалиране.“

Louis Leon Thurstone · Psychological Review · 1927

Прозрението на Търстоун се основава на емпирично наблюдение: хората отговарят много по-добре на въпроса „кое от тези две е по-силно?“, отколкото на „колко силно е това по скала от едно до десет?“

Защо двойките работят по-добре от скалите

Когнитивното натоварване при оценяване е по-голямо, отколкото изглежда.

Когато помолите някого да оцени важността на стратегически приоритет по скала от едно до десет, го молите да извърши няколко когнитивни операции едновременно. Този процес внася систематична грешка на всяка стъпка.

Най-вредната от тези грешки е ефектът на котвата. Първият оценен елемент обикновено влияе на всички следващи оценки; изследване на Тверски и Канеман (1974) показва, че ефектите на котвата са големи и забележително устойчиви на корекция.

Втори източник на грешка е свиването на скалата. На практика повечето респонденти избягват крайните стойности и групират отговорите в средата — затова анкета с дванадесет приоритета толкова често връща дванадесет неща, които са до едно „много важни“.

Цялото взаимодействие, повтаряно отново и отново, докато всеки елемент бъде сравнен с всеки друг.

Повишение на заплатата
ИЛИ
Една седмица допълнителен отпуск
По-ниска цена
ИЛИ
По-бърза доставка
Един старши служител
ИЛИ
Двама младши

Помолете когото и да е да ги оцени от едно до десет и двете получават девет. Помолете го да избере и той отговаря за секунда — и го мисли.

Бележка от изследванията
Превъзходството на сравнението по двойки над скалите за оценка е доказано многократно в четиринадесет независими изследвания (Dillon, Frederick & Tangpanichdee, 1985).

Как предпочитанията стават класиране

Методът на обобщаване е прост, прозрачен и математически обоснован.

При n елемента за класиране всеки елемент се сравнява с всеки друг точно веднъж. Общият брой необходими сравнения е n(n−1)/2.

Обобщаване на индивидуалните отговори

При индивидуалните сесии резултатът произтича пряко от броя победи: всеки елемент получава една точка за всяко спечелено сравнение. Крайният списък подрежда елементите от най-много към най-малко победи.

Обобщаване на груповите отговори

При груповите сесии сравненията на всеки участник се обобщават преди изчисляването на крайното класиране. Общият брой победи на групата при всяко сравнение е сборът от индивидуалните гласове на всички участници.

Решаващото е, че обобщеният резултат показва и формата на несъгласието. Елементите, които разделят групата, личат в данните — и това често е най-ценният резултат от груповата сесия.

За нетранзитивността
В редки случаи сравнението по двойки може да даде нетранзитивни резултати — A побеждава B, B побеждава C, но C побеждава A. Това е известно като парадокс на Кондорсе.

Груповата сесия като диагностичен инструмент

Подреденият списък не е единственият резултат. Формата на несъгласието е също толкова важна.

Обичайните методи за групово вземане на решения имат общ основен недостатък: зависят от реда, в който се изказват мненията. Който говори пръв, закотвя групата.

Това не е провал на отделните хора — а предвидимо следствие от груповата динамика. Изследванията последователно показват, че груповите дискусии дават по-неточни колективни преценки от обобщаването на независими лични преценки. Този ефект понякога се нарича проблем на скрития профил.

„Групите постоянно не успяват да споделят информация, която притежават само отделни членове, и този провал е систематичен, а не случаен.“

Stasser & Titus · Journal of Personality and Social Psychology · 1985
Бележка за модератора
Най-ефективно е груповата сесия да покаже резултата преди началото на дискусията, а не след нея. Когато покажете на групата какво мисли колективно — преди някой да е проговорил — се променя качеството на разговора, който следва.

Къде се използва

От психоакустиката до обучението на ИИ — методът се мащабира.

Стратегическо планиране и управление

Аналитичният йерархичен процес (AHP) е използван при стратегически решения с висок залог в отбраната, инфраструктурата, здравеопазването и държавното управление. Преглед от 2008 г. установява над 900 публикувани приложения в 19 различни области.

Машинно обучение и ИИ

Обучението с подкрепление от човешка обратна връзка (RLHF), техниката, с която се обучават съвременните големи езикови модели, разчита изцяло на сравнението по двойки. На оценителите се показват два отговора на модела и те избират по-добрия.

Спорт и състезателни класирания

Системата Ело, използвана в шаха, футбола и десетки други състезателни области, е пряко приложение на модела на Брадли–Тери за двойки.

Допълнителна литература

Първоизточници и основни текстове.

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Готови ли сте да опитате метода?

Настройте индивидуална или групова сесия за по-малко от две минути. Не е нужен профил, за да започнете.

Създай ново класиране →