Om parvis rangering
Videnskaben bag bedre beslutninger.
Parvis sammenligning er ikke en ny idé. Den er blevet undersøgt, afprøvet og valideret gennem næsten et århundredes forskning i psykologi, økonomi og beslutningsvidenskab.
Fra psykofysik til bestyrelseslokaler
En metode formaliseret i 1927 — og gentaget lige siden.

Den parvise sammenlignings idéhistorie begynder med et praktisk problem: hvordan måler man ting, der ikke har nogen naturlig enhed?
Svaret, som psykologen Louis Leon Thurstone fra University of Chicago foreslog, var at sammenligne tingene direkte, to og to. Hans artikel fra 1927, A Law of Comparative Judgment, formaliserede denne indsigt i en præcis matematisk model.
Thurstones indsigt byggede på en empirisk iagttagelse: folk er markant bedre til at svare på „hvilken af disse to er højest?“ end på „hvor højt er dette på en skala fra et til ti?“
Hvorfor par virker bedre end skalaer
Den kognitive belastning ved at vurdere er større, end den ser ud.
Når du beder nogen om at vurdere vigtigheden af en strategisk prioritet på en skala fra et til ti, beder du dem om at udføre flere kognitive operationer på én gang. Den proces introducerer systematiske fejl i hvert trin.
Den mest skadelige af disse fejl er forankringsbias. Det første element, der vurderes, har en tendens til at påvirke alle efterfølgende vurderinger; forskning af Tversky og Kahneman (1974) viste, at forankringseffekter både er store og bemærkelsesværdigt svære at korrigere.
En anden fejlkilde er skalakomprimering. I praksis undgår de fleste respondenter skalaernes yderpunkter og samler svarene i midten — og derfor ender en undersøgelse af tolv prioriteter så ofte med tolv ting, der alle er „meget vigtige“.
Hele interaktionen, gentaget igen og igen, indtil hvert element er blevet sammenlignet med hvert andet element.
Bed nogen om at give disse karakter ud af ti, og begge får et ni-tal. Bed dem om at vælge, og de svarer på et sekund — og mener det.
Hvordan præferencer bliver til en rangering
Aggregeringsmetoden er enkel, gennemsigtig og matematisk funderet.
Med n elementer, der skal rangeres, sammenlignes hvert element med hvert andet element præcis én gang. Det samlede antal nødvendige sammenligninger er n(n−1)/2.
Aggregering af individuelle svar
Hvert elements score er dets vinderandel: den del af dets sammenligninger, det vandt, hvor uafgjort eller spring over tæller som en halv. At ordne elementer efter sejre er enkelt og gennemsigtigt, og forskning viser, at det klarer sig godt over for mere komplekse statistiske modeller (Shah & Wainwright, 2018).
Aggregering af gruppesvar
I gruppesessioner aggregeres hver deltagers sammenligninger, før den endelige rangering beregnes. Gruppens samlede sejre for en sammenligning er summen af de individuelle stemmer på tværs af alle deltagere.
Afgørende er det, at det aggregerede resultat også viser uenighedens form. Elementer, der deler gruppen, er synlige i dataene — og det er ofte det mest værdifulde resultat af en gruppesession.
Gruppesessionen som diagnostisk værktøj
Den rangerede liste er ikke det eneste resultat. Uenighedens form er lige så vigtig.
Traditionelle metoder til beslutningstagning i grupper har en grundlæggende fejl til fælles: de er følsomme over for den rækkefølge, meningerne kommer frem i. Den første, der taler, forankrer gruppen.
Grupper har en tendens til at diskutere det, alle allerede ved, og udnytte for lidt det, kun ét medlem ved. Det er problemet med den skjulte profil (Stasser & Titus, 1985). Når hver persons valg indsamles privat, før enhver diskussion, kommer alle synspunkter på bordet.
Hvor den bruges
Fra psykoakustik til AI-træning — metoden skalerer.
Strategisk planlægning og ledelse
Analytic Hierarchy Process er blevet brugt til strategiske beslutninger med meget på spil inden for forsvar, infrastruktur, sundhed og offentlig forvaltning. En gennemgang fra 2008 fandt over 900 publicerede anvendelser på tværs af 19 forskellige fagområder.
Maskinlæring og AI
Forstærkningslæring fra menneskelig feedback (RLHF), den teknik, der bruges til at træne moderne store sprogmodeller, bygger udelukkende på parvis sammenligning. Menneskelige bedømmere får vist to modelsvar og bliver bedt om at vælge det bedste.
Sport og konkurrencerangering
Elo-ratingsystemet, der bruges i skak, fodbold og snesevis af andre konkurrenceområder, er nært beslægtet med Bradley–Terrys parvise model.
Yderligere læsning
Primærkilder og centrale tekster.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
Opsæt en individuel session eller en gruppesession på under to minutter. Ingen konto påkrævet for at komme i gang.