O rankingu parami
Nauka o lepszych decyzjach.
Porównywanie parami to nie nowy pomysł. Badano je, testowano i potwierdzano przez blisko sto lat badań w psychologii, ekonomii i naukach o decyzjach.
Od psychofizyki do sal zarządu
Metoda sformalizowana w 1927 roku — i od tamtej pory wielokrotnie potwierdzana.

Historia porównywania parami zaczyna się od praktycznego problemu: jak mierzyć rzeczy, które nie mają naturalnej jednostki?
Odpowiedzią, zaproponowaną przez psychologa Louisa Leona Thurstone’a z University of Chicago, było bezpośrednie porównywanie rzeczy w parach. Jego artykuł z 1927 roku, A Law of Comparative Judgment, ujął tę myśl w precyzyjny model matematyczny.
„Metoda porównań parami daje skalę wartości psychologicznych bardziej wiarygodną niż jakakolwiek inna metoda skalowania”.
Louis Leon Thurstone · Psychological Review · 1927Spostrzeżenie Thurstone’a opierało się na obserwacji empirycznej: ludzie znacznie lepiej odpowiadają na pytanie „który z tych dwóch dźwięków jest głośniejszy?” niż „jak głośny jest ten dźwięk w skali od jednego do dziesięciu?”
Dlaczego pary działają lepiej niż skale
Obciążenie poznawcze oceniania jest większe, niż się wydaje.
Gdy prosisz kogoś o ocenę ważności priorytetu strategicznego w skali od jednego do dziesięciu, prosisz go o wykonanie kilku operacji poznawczych jednocześnie. Ten proces na każdym kroku wprowadza błąd systematyczny.
Najbardziej szkodliwym z tych błędów jest efekt zakotwiczenia. Pierwszy oceniany element wpływa na wszystkie kolejne oceny; badania Tversky’ego i Kahnemana (1974) wykazały, że efekty zakotwiczenia są zarówno silne, jak i wyjątkowo odporne na korektę.
Drugim źródłem błędu jest kompresja skali. W praktyce większość respondentów unika krańców skali i skupia odpowiedzi pośrodku — dlatego ankieta o dwunastu priorytetach tak często zwraca dwanaście rzeczy, z których wszystkie są „bardzo ważne”.
Cała interakcja, powtarzana raz za razem, aż każdy element zostanie porównany z każdym innym.
Poproś kogokolwiek o ocenę w skali do dziesięciu, a obie opcje dostaną dziewiątkę. Poproś o wybór, a odpowie w sekundę — i będzie tak myśleć naprawdę.
Jak preferencje stają się rankingiem
Metoda agregacji jest prosta, przejrzysta i ugruntowana matematycznie.
Mając n elementów do uszeregowania, każdy element jest porównywany z każdym innym dokładnie raz. Łączna liczba wymaganych porównań wynosi n(n−1)/2.
Agregacja odpowiedzi indywidualnych
W indywidualnych sesjach rankingowych wynik wynika bezpośrednio z liczby wygranych: każdy element otrzymuje jeden punkt za każde wygrane porównanie. Końcowa lista porządkuje elementy od największej do najmniejszej liczby wygranych.
Agregacja odpowiedzi grupowych
W sesjach grupowych porównania każdego uczestnika są agregowane przed obliczeniem końcowego rankingu. Grupowa suma wygranych dla danego porównania to suma indywidualnych głosów wszystkich uczestników.
Co kluczowe, zagregowany wynik pokazuje też kształt niezgody. Elementy, które dzielą grupę, są widoczne w danych — i często jest to najcenniejszy wynik sesji grupowej.
Sesja grupowa jako narzędzie diagnostyczne
Uszeregowana lista nie jest jedynym wynikiem. Kształt niezgody jest równie ważny.
Konwencjonalne metody grupowego podejmowania decyzji mają wspólną podstawową wadę: są wrażliwe na kolejność, w jakiej wyrażane są opinie. Pierwsza osoba, która zabiera głos, zakotwicza grupę.
To nie błąd jednostek — to przewidywalna konsekwencja dynamiki grupy. Badania konsekwentnie pokazują, że dyskusje grupowe dają mniej trafne zbiorowe oceny niż agregacja niezależnych, prywatnych ocen. Efekt ten nazywa się czasem problemem ukrytego profilu.
„Grupy konsekwentnie nie dzielą się informacjami, które posiadają tylko pojedyncze osoby, a ta porażka jest systematyczna, a nie przypadkowa”.
Stasser & Titus · Journal of Personality and Social Psychology · 1985Gdzie się jej używa
Od psychoakustyki po trenowanie AI — metoda się skaluje.
Planowanie strategiczne i zarządzanie
Analityczny proces hierarchiczny (AHP) stosowano przy strategicznych decyzjach o wysokiej stawce w obronności, infrastrukturze, ochronie zdrowia i administracji. Przegląd z 2008 roku wskazał ponad 900 opublikowanych zastosowań w 19 różnych dziedzinach.
Uczenie maszynowe i AI
Uczenie ze wzmocnieniem na podstawie informacji zwrotnej od ludzi (RLHF), technika używana do trenowania współczesnych dużych modeli językowych, opiera się w całości na porównywaniu parami. Oceniającym pokazuje się dwie odpowiedzi modelu i prosi o wybranie lepszej.
Sport i rankingi rywalizacyjne
System rankingowy Elo, używany w szachach, piłce nożnej i dziesiątkach innych dziedzin rywalizacji, jest bezpośrednim zastosowaniem modelu porównań parami Bradleya–Terry’ego.
Dalsza lektura
Źródła pierwotne i kluczowe teksty.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Skonfiguruj sesję indywidualną lub grupową w niecałe dwie minuty. Na start nie potrzebujesz konta.