Om parvis rangering

Vitenskapen bak bedre beslutninger.

Parvis sammenligning er ingen ny idé. Den er studert, testet og validert gjennom nesten et århundre med forskning i psykologi, økonomi og beslutningsvitenskap.

1927 Thurstone formaliserer metoden
1952 Bradley og Terry modellerer parvise valg
En skrivemaskin, en notatblokk og en blyant

Fra psykofysikk til styrerom

En metode formalisert i 1927 — og gjentatt siden.

Thurstones A Law of Comparative Judgment, University of Chicago, 1927.

Den intellektuelle historien til parvis sammenligning begynner med et praktisk problem: Hvordan måler man ting som ikke har noen naturlig enhet?

Svaret, foreslått av psykologen Louis Leon Thurstone ved University of Chicago, var å sammenligne ting direkte, i par. Artikkelen hans fra 1927, A Law of Comparative Judgment, formaliserte denne innsikten i en presis matematisk modell.

Thurstones innsikt bygde på en empirisk observasjon: Folk er betydelig bedre til å svare på «hvilken av disse to er høyest?» enn «hvor høy er denne, på en skala fra én til ti?»

Hvorfor par fungerer bedre enn skalaer

Den kognitive belastningen ved å vurdere er høyere enn den ser ut.

Når du ber noen vurdere hvor viktig en strategisk prioritering er på en skala fra én til ti, ber du dem utføre flere kognitive operasjoner samtidig. Denne prosessen introduserer systematiske feil i hvert steg.

Den mest skadelige av disse feilene er forankringseffekten. Det første elementet som vurderes, påvirker gjerne alle senere vurderinger; forskning av Tversky og Kahneman (1974) viste at forankringseffekter er både store og bemerkelsesverdig motstandsdyktige mot korrigering.

En annen feilkilde er skalakomprimering. I praksis unngår de fleste respondenter ytterpunktene på skalaer og samler svarene i midten — og det er derfor en spørreundersøkelse om tolv prioriteringer så ofte gir tolv ting som alle er «svært viktige».

Hele samspillet, gjentatt om og om igjen til hvert element er sammenlignet med alle de andre.

Lønnsøkning
ELLER
En ekstra uke fri
Lavere pris
ELLER
Raskere levering
Én senioransettelse
ELLER
To juniorer

Be hvem som helst gi disse en karakter av ti, og begge får en nier. Be dem velge, og de svarer på et sekund — og mener det.

Hvordan preferanser blir til en rangering

Aggregeringsmetoden er enkel, gjennomsiktig og matematisk forankret.

Gitt n elementer som skal rangeres, sammenlignes hvert element med hvert av de andre nøyaktig én gang. Det totale antallet sammenligninger som trengs, er n(n−1)/2.

Aggregering av individuelle svar

Hvert elements poengsum er vinnerandelen: andelen av sammenligningene det vant, der uavgjort eller hoppet over teller som en halv. Å ordne elementer etter seire er enkelt og oversiktlig, og forskning viser at det holder godt mål mot mer komplekse statistiske modeller (Shah & Wainwright, 2018).

Aggregering av gruppesvar

I gruppeøkter aggregeres hver deltakers sammenligninger før den endelige rangeringen beregnes. Gruppens totale antall seire for en sammenligning er summen av de individuelle stemmene fra alle deltakerne.

Avgjørende er at det aggregerte resultatet også viser formen på uenigheten. Elementer som splitter gruppen, er synlige i dataene — og dette er ofte det mest verdifulle utbyttet av en gruppeøkt.

Om intransitivitet
I sjeldne tilfeller kan parvis sammenligning gi intransitive resultater — der A slår B, B slår C, men C slår A. Dette er kjent som Condorcets paradoks.

Gruppeøkten som diagnoseverktøy

Den rangerte listen er ikke det eneste resultatet. Formen på uenigheten er like viktig.

Tradisjonelle metoder for beslutningstaking i grupper har en grunnleggende svakhet: de er følsomme for rekkefølgen meninger kommer frem i. Den første som snakker, forankrer gruppen.

Grupper har en tendens til å diskutere det alle allerede vet, og bruke for lite av det bare ett medlem vet. Dette er problemet med skjulte profiler (Stasser & Titus, 1985). Når hver persons valg samles inn privat, før noen diskusjon, kommer alle synspunkter på bordet.

Merknad til fasilitatoren
Den mest effektive bruken av en gruppeøkt er å vise resultatet før diskusjonen begynner, ikke etterpå. Å vise gruppen hva de samlet mener — før noen har sagt noe — endrer kvaliteten på samtalen som følger.

Hvor den brukes

Fra psykoakustikk til KI-trening — metoden skalerer.

Strategisk planlegging og ledelse

Analytic Hierarchy Process (AHP) er brukt i strategiske beslutninger med mye på spill innen forsvar, infrastruktur, helse og offentlig forvaltning. En gjennomgang fra 2008 fant over 900 publiserte anvendelser innen 19 ulike fagfelt.

Maskinlæring og KI

Forsterkende læring fra menneskelig tilbakemelding (RLHF), teknikken som brukes til å trene moderne store språkmodeller, bygger helt på parvis sammenligning. Menneskelige evaluatorer får se to svar fra modellen og blir bedt om å velge det beste.

Sport og konkurranserangering

Elo-ratingsystemet, som brukes i sjakk, fotball og dusinvis av andre konkurranseområder, er nært beslektet med Bradley–Terrys parvise modell.

Videre lesning

Primærkilder og sentrale tekster.

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
07
Shah, N. B. & Wainwright, M. J. (2018)
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
Klar til å prøve metoden?

Sett opp en individuell økt eller en gruppeøkt på under to minutter. Ingen konto nødvendig for å starte.

Lag ny rangering →