Over paarsgewijs rangschikken
De wetenschap van betere beslissingen.
Paarsgewijs vergelijken is geen nieuw idee. Het is in bijna een eeuw onderzoek in psychologie, economie en beslissingswetenschap bestudeerd, getest en gevalideerd.
Van psychofysica tot bestuurskamer
Een methode die in 1927 werd geformaliseerd — en sindsdien steeds opnieuw is bevestigd.

De intellectuele geschiedenis van paarsgewijs vergelijken begint met een praktisch probleem: hoe meet je dingen die geen natuurlijke eenheid hebben?
Het antwoord van de psycholoog Louis Leon Thurstone aan de University of Chicago was: vergelijk dingen rechtstreeks, in paren. Zijn artikel uit 1927, A Law of Comparative Judgment, legde dit inzicht vast in een precies wiskundig model.
‘De methode van paarsgewijze vergelijkingen levert een schaal van psychologische waarden op die betrouwbaarder is dan elke andere schaalmethode.’
Louis Leon Thurstone · Psychological Review · 1927Thurstones inzicht berustte op een empirische waarneming: mensen kunnen veel beter antwoord geven op ‘welke van deze twee is harder?’ dan op ‘hoe hard is dit, op een schaal van één tot tien?’
Waarom paren beter werken dan schalen
Beoordelen op een schaal is cognitief zwaarder dan het lijkt.
Als je iemand vraagt het belang van een strategische prioriteit te beoordelen op een schaal van één tot tien, vraag je hem meerdere denkstappen tegelijk te zetten. Bij elke stap sluipt er een systematische fout in.
De schadelijkste van die fouten is het ankereffect. Het eerste beoordeelde item beïnvloedt meestal alle volgende beoordelingen; onderzoek van Tversky en Kahneman (1974) liet zien dat ankereffecten groot zijn en opvallend moeilijk te corrigeren.
Een tweede foutbron is schaalcompressie. In de praktijk vermijden de meeste respondenten de uitersten van een schaal en clusteren hun antwoorden in het midden — en daarom levert een enquête over twaalf prioriteiten zo vaak twaalf dingen op die allemaal ‘heel belangrijk’ zijn.
De hele interactie, steeds opnieuw herhaald tot elk item met elk ander item is vergeleken.
Vraag iemand deze een cijfer van één tot tien te geven en beide krijgen een negen. Vraag diegene te kiezen en het antwoord komt binnen een seconde — en is gemeend.
Hoe voorkeuren een ranking worden
De aggregatiemethode is eenvoudig, transparant en wiskundig onderbouwd.
Bij n te rangschikken items wordt elk item precies één keer met elk ander item vergeleken. Het totale aantal benodigde vergelijkingen is n(n−1)/2.
Individuele antwoorden samenvoegen
Bij individuele rankingsessies volgt het resultaat rechtstreeks uit het aantal overwinningen: elk item krijgt één punt voor elke vergelijking die het wint. De eindranking zet de items van meeste naar minste overwinningen.
Groepsantwoorden samenvoegen
Bij groepssessies worden de vergelijkingen van alle deelnemers samengevoegd voordat de eindranking wordt berekend. Het groepstotaal voor een vergelijking is de som van de individuele stemmen van alle deelnemers.
Belangrijk is dat het samengevoegde resultaat ook de vorm van het meningsverschil laat zien. Items die de groep verdelen, zijn zichtbaar in de gegevens — en dat is vaak de waardevolste uitkomst van een groepssessie.
De groepssessie als diagnostisch instrument
De gerangschikte lijst is niet de enige uitkomst. De vorm van het meningsverschil is net zo belangrijk.
Gangbare methoden voor groepsbesluitvorming hebben een fundamentele zwakte: ze zijn gevoelig voor de volgorde waarin meningen worden geuit. Wie als eerste spreekt, zet het anker voor de groep.
Dat is geen falen van individuen — het is een voorspelbaar gevolg van groepsdynamiek. Onderzoek laat steeds weer zien dat groepsdiscussies minder nauwkeurige collectieve oordelen opleveren dan het samenvoegen van onafhankelijke, persoonlijke oordelen. Dit effect wordt soms het hidden-profileprobleem genoemd.
‘Groepen slagen er steeds niet in informatie te delen die maar één lid heeft, en dat falen is systematisch, niet willekeurig.’
Stasser & Titus · Journal of Personality and Social Psychology · 1985Waar het wordt gebruikt
Van psychoakoestiek tot AI-training — de methode schaalt mee.
Strategische planning en management
Het Analytic Hierarchy Process is gebruikt bij strategische beslissingen met grote belangen op het gebied van defensie, infrastructuur, zorg en overheid. Een overzichtsstudie uit 2008 vond meer dan 900 gepubliceerde toepassingen in 19 verschillende vakgebieden.
Machine learning en AI
Reinforcement learning from human feedback (RLHF), de techniek waarmee moderne grote taalmodellen worden getraind, draait volledig op paarsgewijs vergelijken. Menselijke beoordelaars krijgen twee uitkomsten van een model te zien en kiezen de betere.
Sport en competitieve ranglijsten
Het Elo-ratingsysteem, gebruikt in schaken, voetbal en tientallen andere competitieve domeinen, is een directe toepassing van het paarsgewijze Bradley–Terry-model.
Verder lezen
Primaire bronnen en kernteksten.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Stel in minder dan twee minuten een individuele of groepssessie in. Je hebt geen account nodig om te beginnen.