Over paarsgewijs rangschikken

De wetenschap van betere beslissingen.

Paarsgewijs vergelijken is geen nieuw idee. Het is in bijna een eeuw onderzoek in psychologie, economie en beslissingswetenschap bestudeerd, getest en gevalideerd.

1927 Thurstone formaliseert de methode
900+ gepubliceerde toepassingen in 19 vakgebieden
14 onafhankelijke studies waarin paren beter scoren dan schalen
Een typemachine, een notitieblok en een potlood

Van psychofysica tot bestuurskamer

Een methode die in 1927 werd geformaliseerd — en sindsdien steeds opnieuw is bevestigd.

Thurstones A Law of Comparative Judgment, University of Chicago, 1927.

De intellectuele geschiedenis van paarsgewijs vergelijken begint met een praktisch probleem: hoe meet je dingen die geen natuurlijke eenheid hebben?

Het antwoord van de psycholoog Louis Leon Thurstone aan de University of Chicago was: vergelijk dingen rechtstreeks, in paren. Zijn artikel uit 1927, A Law of Comparative Judgment, legde dit inzicht vast in een precies wiskundig model.

‘De methode van paarsgewijze vergelijkingen levert een schaal van psychologische waarden op die betrouwbaarder is dan elke andere schaalmethode.’

Louis Leon Thurstone · Psychological Review · 1927

Thurstones inzicht berustte op een empirische waarneming: mensen kunnen veel beter antwoord geven op ‘welke van deze twee is harder?’ dan op ‘hoe hard is dit, op een schaal van één tot tien?’

Waarom paren beter werken dan schalen

Beoordelen op een schaal is cognitief zwaarder dan het lijkt.

Als je iemand vraagt het belang van een strategische prioriteit te beoordelen op een schaal van één tot tien, vraag je hem meerdere denkstappen tegelijk te zetten. Bij elke stap sluipt er een systematische fout in.

De schadelijkste van die fouten is het ankereffect. Het eerste beoordeelde item beïnvloedt meestal alle volgende beoordelingen; onderzoek van Tversky en Kahneman (1974) liet zien dat ankereffecten groot zijn en opvallend moeilijk te corrigeren.

Een tweede foutbron is schaalcompressie. In de praktijk vermijden de meeste respondenten de uitersten van een schaal en clusteren hun antwoorden in het midden — en daarom levert een enquête over twaalf prioriteiten zo vaak twaalf dingen op die allemaal ‘heel belangrijk’ zijn.

De hele interactie, steeds opnieuw herhaald tot elk item met elk ander item is vergeleken.

Een loonsverhoging
OF
Een extra week vrij
Lagere prijs
OF
Snellere levering
Eén senior aannemen
OF
Twee junioren

Vraag iemand deze een cijfer van één tot tien te geven en beide krijgen een negen. Vraag diegene te kiezen en het antwoord komt binnen een seconde — en is gemeend.

Onderzoeksnotitie
Dat paarsgewijs vergelijken beter werkt dan beoordelingsschalen, is herhaaldelijk aangetoond in veertien onafhankelijke studies (Dillon, Frederick & Tangpanichdee, 1985).

Hoe voorkeuren een ranking worden

De aggregatiemethode is eenvoudig, transparant en wiskundig onderbouwd.

Bij n te rangschikken items wordt elk item precies één keer met elk ander item vergeleken. Het totale aantal benodigde vergelijkingen is n(n−1)/2.

Individuele antwoorden samenvoegen

Bij individuele rankingsessies volgt het resultaat rechtstreeks uit het aantal overwinningen: elk item krijgt één punt voor elke vergelijking die het wint. De eindranking zet de items van meeste naar minste overwinningen.

Groepsantwoorden samenvoegen

Bij groepssessies worden de vergelijkingen van alle deelnemers samengevoegd voordat de eindranking wordt berekend. Het groepstotaal voor een vergelijking is de som van de individuele stemmen van alle deelnemers.

Belangrijk is dat het samengevoegde resultaat ook de vorm van het meningsverschil laat zien. Items die de groep verdelen, zijn zichtbaar in de gegevens — en dat is vaak de waardevolste uitkomst van een groepssessie.

Over intransitiviteit
In zeldzame gevallen kan paarsgewijs vergelijken intransitieve resultaten opleveren — A verslaat B, B verslaat C, maar C verslaat A. Dit heet de Condorcet-paradox.

De groepssessie als diagnostisch instrument

De gerangschikte lijst is niet de enige uitkomst. De vorm van het meningsverschil is net zo belangrijk.

Gangbare methoden voor groepsbesluitvorming hebben een fundamentele zwakte: ze zijn gevoelig voor de volgorde waarin meningen worden geuit. Wie als eerste spreekt, zet het anker voor de groep.

Dat is geen falen van individuen — het is een voorspelbaar gevolg van groepsdynamiek. Onderzoek laat steeds weer zien dat groepsdiscussies minder nauwkeurige collectieve oordelen opleveren dan het samenvoegen van onafhankelijke, persoonlijke oordelen. Dit effect wordt soms het hidden-profileprobleem genoemd.

‘Groepen slagen er steeds niet in informatie te delen die maar één lid heeft, en dat falen is systematisch, niet willekeurig.’

Stasser & Titus · Journal of Personality and Social Psychology · 1985
Notitie voor de facilitator
Een groepssessie werkt het best als je het resultaat laat zien voordat de discussie begint, niet erna. De groep laten zien wat ze samen vinden — voordat iemand iets heeft gezegd — verandert de kwaliteit van het gesprek dat volgt.

Waar het wordt gebruikt

Van psychoakoestiek tot AI-training — de methode schaalt mee.

Strategische planning en management

Het Analytic Hierarchy Process is gebruikt bij strategische beslissingen met grote belangen op het gebied van defensie, infrastructuur, zorg en overheid. Een overzichtsstudie uit 2008 vond meer dan 900 gepubliceerde toepassingen in 19 verschillende vakgebieden.

Machine learning en AI

Reinforcement learning from human feedback (RLHF), de techniek waarmee moderne grote taalmodellen worden getraind, draait volledig op paarsgewijs vergelijken. Menselijke beoordelaars krijgen twee uitkomsten van een model te zien en kiezen de betere.

Sport en competitieve ranglijsten

Het Elo-ratingsysteem, gebruikt in schaken, voetbal en tientallen andere competitieve domeinen, is een directe toepassing van het paarsgewijze Bradley–Terry-model.

Verder lezen

Primaire bronnen en kernteksten.

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Klaar om de methode te proberen?

Stel in minder dan twee minuten een individuele of groepssessie in. Je hebt geen account nodig om te beginnen.

Nieuwe ranking maken →