Om parvis rangering
Vitenskapen bak bedre beslutninger.
Parvis sammenligning er ingen ny idé. Den er studert, testet og validert gjennom nesten et århundre med forskning i psykologi, økonomi og beslutningsvitenskap.
Fra psykofysikk til styrerom
En metode formalisert i 1927 — og gjentatt siden.

Den intellektuelle historien til parvis sammenligning begynner med et praktisk problem: Hvordan måler man ting som ikke har noen naturlig enhet?
Svaret, foreslått av psykologen Louis Leon Thurstone ved University of Chicago, var å sammenligne ting direkte, i par. Artikkelen hans fra 1927, A Law of Comparative Judgment, formaliserte denne innsikten i en presis matematisk modell.
Thurstones innsikt bygde på en empirisk observasjon: Folk er betydelig bedre til å svare på «hvilken av disse to er høyest?» enn «hvor høy er denne, på en skala fra én til ti?»
Hvorfor par fungerer bedre enn skalaer
Den kognitive belastningen ved å vurdere er høyere enn den ser ut.
Når du ber noen vurdere hvor viktig en strategisk prioritering er på en skala fra én til ti, ber du dem utføre flere kognitive operasjoner samtidig. Denne prosessen introduserer systematiske feil i hvert steg.
Den mest skadelige av disse feilene er forankringseffekten. Det første elementet som vurderes, påvirker gjerne alle senere vurderinger; forskning av Tversky og Kahneman (1974) viste at forankringseffekter er både store og bemerkelsesverdig motstandsdyktige mot korrigering.
En annen feilkilde er skalakomprimering. I praksis unngår de fleste respondenter ytterpunktene på skalaer og samler svarene i midten — og det er derfor en spørreundersøkelse om tolv prioriteringer så ofte gir tolv ting som alle er «svært viktige».
Hele samspillet, gjentatt om og om igjen til hvert element er sammenlignet med alle de andre.
Be hvem som helst gi disse en karakter av ti, og begge får en nier. Be dem velge, og de svarer på et sekund — og mener det.
Hvordan preferanser blir til en rangering
Aggregeringsmetoden er enkel, gjennomsiktig og matematisk forankret.
Gitt n elementer som skal rangeres, sammenlignes hvert element med hvert av de andre nøyaktig én gang. Det totale antallet sammenligninger som trengs, er n(n−1)/2.
Aggregering av individuelle svar
Hvert elements poengsum er vinnerandelen: andelen av sammenligningene det vant, der uavgjort eller hoppet over teller som en halv. Å ordne elementer etter seire er enkelt og oversiktlig, og forskning viser at det holder godt mål mot mer komplekse statistiske modeller (Shah & Wainwright, 2018).
Aggregering av gruppesvar
I gruppeøkter aggregeres hver deltakers sammenligninger før den endelige rangeringen beregnes. Gruppens totale antall seire for en sammenligning er summen av de individuelle stemmene fra alle deltakerne.
Avgjørende er at det aggregerte resultatet også viser formen på uenigheten. Elementer som splitter gruppen, er synlige i dataene — og dette er ofte det mest verdifulle utbyttet av en gruppeøkt.
Gruppeøkten som diagnoseverktøy
Den rangerte listen er ikke det eneste resultatet. Formen på uenigheten er like viktig.
Tradisjonelle metoder for beslutningstaking i grupper har en grunnleggende svakhet: de er følsomme for rekkefølgen meninger kommer frem i. Den første som snakker, forankrer gruppen.
Grupper har en tendens til å diskutere det alle allerede vet, og bruke for lite av det bare ett medlem vet. Dette er problemet med skjulte profiler (Stasser & Titus, 1985). Når hver persons valg samles inn privat, før noen diskusjon, kommer alle synspunkter på bordet.
Hvor den brukes
Fra psykoakustikk til KI-trening — metoden skalerer.
Strategisk planlegging og ledelse
Analytic Hierarchy Process (AHP) er brukt i strategiske beslutninger med mye på spill innen forsvar, infrastruktur, helse og offentlig forvaltning. En gjennomgang fra 2008 fant over 900 publiserte anvendelser innen 19 ulike fagfelt.
Maskinlæring og KI
Forsterkende læring fra menneskelig tilbakemelding (RLHF), teknikken som brukes til å trene moderne store språkmodeller, bygger helt på parvis sammenligning. Menneskelige evaluatorer får se to svar fra modellen og blir bedt om å velge det beste.
Sport og konkurranserangering
Elo-ratingsystemet, som brukes i sjakk, fotball og dusinvis av andre konkurranseområder, er nært beslektet med Bradley–Terrys parvise modell.
Videre lesning
Primærkilder og sentrale tekster.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
Sett opp en individuell økt eller en gruppeøkt på under to minutter. Ingen konto nødvendig for å starte.