Über das paarweise Ranking
Die Wissenschaft besserer Entscheidungen.
Der Paarvergleich ist keine neue Idee. Er wurde in fast einem Jahrhundert Forschung in Psychologie, Wirtschaftswissenschaft und Entscheidungswissenschaft untersucht, getestet und bestätigt.
Von der Psychophysik in die Vorstandsetage
Eine 1927 formalisierte Methode — und seitdem immer wieder bestätigt.

Die Ideengeschichte des Paarvergleichs beginnt mit einem praktischen Problem: Wie misst man Dinge, die keine natürliche Einheit haben?
Die Antwort, vorgeschlagen vom Psychologen Louis Leon Thurstone an der University of Chicago, lautete, Dinge direkt zu vergleichen, paarweise. Sein Aufsatz von 1927, A Law of Comparative Judgment, fasste diese Erkenntnis in ein präzises mathematisches Modell.
„Die Methode der Paarvergleiche liefert eine Skala psychologischer Werte, die zuverlässiger ist als jede andere Skalierungsmethode.“
Louis Leon Thurstone · Psychological Review · 1927Thurstones Erkenntnis beruhte auf einer empirischen Beobachtung: Menschen beantworten „Welches von beiden ist lauter?“ deutlich besser als „Wie laut ist das auf einer Skala von eins bis zehn?“
Warum Paare besser funktionieren als Skalen
Die kognitive Last einer Bewertung ist höher, als es scheint.
Wenn Sie jemanden bitten, die Bedeutung einer strategischen Priorität auf einer Skala von eins bis zehn zu bewerten, verlangen Sie mehrere kognitive Operationen gleichzeitig. Dieser Prozess bringt bei jedem Schritt systematische Fehler ein.
Der schädlichste dieser Fehler ist der Ankereffekt. Das zuerst bewertete Element beeinflusst tendenziell alle folgenden Bewertungen; Forschungen von Tversky und Kahneman (1974) zeigten, dass Ankereffekte groß und bemerkenswert resistent gegen Korrektur sind.
Eine zweite Fehlerquelle ist die Skalenkompression. In der Praxis meiden die meisten Befragten die Enden einer Skala und häufen ihre Antworten in der Mitte — deshalb liefert eine Umfrage zu zwölf Prioritäten so oft zwölf Dinge, die alle „sehr wichtig“ sind.
Die ganze Interaktion, immer wieder wiederholt, bis jedes Element mit jedem anderen verglichen wurde.
Bitten Sie jemanden, diese mit Punkten von eins bis zehn zu bewerten, und beide bekommen eine Neun. Bitten Sie um eine Wahl, und die Antwort kommt in einer Sekunde — und ist ernst gemeint.
Wie aus Präferenzen ein Ranking wird
Die Aggregationsmethode ist einfach, transparent und mathematisch fundiert.
Bei n zu rankenden Elementen wird jedes Element genau einmal mit jedem anderen verglichen. Insgesamt sind n(n−1)/2 Vergleiche nötig.
Aggregation einzelner Antworten
Bei Einzelsitzungen ergibt sich das Ergebnis direkt aus der Zahl der Siege: Jedes Element erhält einen Punkt für jeden gewonnenen Vergleich. Die endgültige Rangliste ordnet die Elemente von den meisten zu den wenigsten Siegen.
Aggregation von Gruppenantworten
Bei Gruppensitzungen werden die Vergleiche aller Teilnehmer aggregiert, bevor das endgültige Ranking berechnet wird. Die Gruppensumme der Siege für einen Vergleich ist die Summe der einzelnen Stimmen aller Teilnehmer.
Entscheidend ist, dass das aggregierte Ergebnis auch die Form der Uneinigkeit sichtbar macht. Elemente, die die Gruppe spalten, sind in den Daten erkennbar — und das ist oft das wertvollste Ergebnis einer Gruppensitzung.
Die Gruppensitzung als Diagnosewerkzeug
Die Rangliste ist nicht das einzige Ergebnis. Die Form der Uneinigkeit ist genauso wichtig.
Herkömmliche Methoden der Gruppenentscheidung teilen einen grundlegenden Fehler: Sie hängen von der Reihenfolge ab, in der Meinungen geäußert werden. Wer zuerst spricht, setzt den Anker für die Gruppe.
Das ist kein Versagen Einzelner — es ist eine vorhersehbare Folge der Gruppendynamik. Die Forschung hat immer wieder gezeigt, dass Gruppendiskussionen weniger genaue kollektive Urteile hervorbringen als die Zusammenführung unabhängiger, privater Urteile. Dieser Effekt wird manchmal als Hidden-Profile-Problem bezeichnet.
„Gruppen versäumen es regelmäßig, Informationen zu teilen, über die nur einzelne Mitglieder verfügen, und dieses Versäumnis ist systematisch, nicht zufällig.“
Stasser & Titus · Journal of Personality and Social Psychology · 1985Wo sie eingesetzt wird
Von der Psychoakustik bis zum KI-Training — die Methode skaliert.
Strategische Planung und Management
Der Analytic Hierarchy Process wird bei folgenreichen strategischen Entscheidungen in Verteidigung, Infrastruktur, Gesundheitswesen und Verwaltung eingesetzt. Eine Übersichtsarbeit von 2008 zählte über 900 veröffentlichte Anwendungen in 19 verschiedenen Fachgebieten.
Maschinelles Lernen und KI
Reinforcement Learning from Human Feedback (RLHF), die Technik, mit der moderne große Sprachmodelle trainiert werden, beruht vollständig auf Paarvergleichen. Menschlichen Bewertern werden zwei Modellausgaben gezeigt, und sie wählen die bessere aus.
Sport und Wettkampf-Rankings
Das Elo-System, das im Schach, im Fußball und in Dutzenden anderen Wettkampfbereichen genutzt wird, ist eine direkte Anwendung des paarweisen Bradley-Terry-Modells.
Weiterführende Literatur
Primärquellen und Schlüsseltexte.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Richten Sie in unter zwei Minuten eine Einzel- oder Gruppensitzung ein. Zum Starten ist kein Konto nötig.