Über das paarweise Ranking

Die Wissenschaft besserer Entscheidungen.

Der Paarvergleich ist keine neue Idee. Er wurde in fast einem Jahrhundert Forschung in Psychologie, Wirtschaftswissenschaft und Entscheidungswissenschaft untersucht, getestet und bestätigt.

1927 Thurstone formalisiert die Methode
900+ veröffentlichte Anwendungen in 19 Fachgebieten
14 unabhängige Studien zeigen: Paare schlagen Skalen
Eine Schreibmaschine, ein Notizblock und ein Bleistift

Von der Psychophysik in die Vorstandsetage

Eine 1927 formalisierte Methode — und seitdem immer wieder bestätigt.

Thurstones A Law of Comparative Judgment, University of Chicago, 1927.

Die Ideengeschichte des Paarvergleichs beginnt mit einem praktischen Problem: Wie misst man Dinge, die keine natürliche Einheit haben?

Die Antwort, vorgeschlagen vom Psychologen Louis Leon Thurstone an der University of Chicago, lautete, Dinge direkt zu vergleichen, paarweise. Sein Aufsatz von 1927, A Law of Comparative Judgment, fasste diese Erkenntnis in ein präzises mathematisches Modell.

„Die Methode der Paarvergleiche liefert eine Skala psychologischer Werte, die zuverlässiger ist als jede andere Skalierungsmethode.“

Louis Leon Thurstone · Psychological Review · 1927

Thurstones Erkenntnis beruhte auf einer empirischen Beobachtung: Menschen beantworten „Welches von beiden ist lauter?“ deutlich besser als „Wie laut ist das auf einer Skala von eins bis zehn?“

Warum Paare besser funktionieren als Skalen

Die kognitive Last einer Bewertung ist höher, als es scheint.

Wenn Sie jemanden bitten, die Bedeutung einer strategischen Priorität auf einer Skala von eins bis zehn zu bewerten, verlangen Sie mehrere kognitive Operationen gleichzeitig. Dieser Prozess bringt bei jedem Schritt systematische Fehler ein.

Der schädlichste dieser Fehler ist der Ankereffekt. Das zuerst bewertete Element beeinflusst tendenziell alle folgenden Bewertungen; Forschungen von Tversky und Kahneman (1974) zeigten, dass Ankereffekte groß und bemerkenswert resistent gegen Korrektur sind.

Eine zweite Fehlerquelle ist die Skalenkompression. In der Praxis meiden die meisten Befragten die Enden einer Skala und häufen ihre Antworten in der Mitte — deshalb liefert eine Umfrage zu zwölf Prioritäten so oft zwölf Dinge, die alle „sehr wichtig“ sind.

Die ganze Interaktion, immer wieder wiederholt, bis jedes Element mit jedem anderen verglichen wurde.

Eine Gehaltserhöhung
ODER
Eine Woche mehr Urlaub
Niedrigerer Preis
ODER
Schnellere Lieferung
Eine erfahrene Fachkraft
ODER
Zwei Berufseinsteiger

Bitten Sie jemanden, diese mit Punkten von eins bis zehn zu bewerten, und beide bekommen eine Neun. Bitten Sie um eine Wahl, und die Antwort kommt in einer Sekunde — und ist ernst gemeint.

Forschungshinweis
Die Überlegenheit des Paarvergleichs gegenüber Bewertungsskalen wurde in vierzehn unabhängigen Studien wiederholt nachgewiesen (Dillon, Frederick & Tangpanichdee, 1985).

Wie aus Präferenzen ein Ranking wird

Die Aggregationsmethode ist einfach, transparent und mathematisch fundiert.

Bei n zu rankenden Elementen wird jedes Element genau einmal mit jedem anderen verglichen. Insgesamt sind n(n−1)/2 Vergleiche nötig.

Aggregation einzelner Antworten

Bei Einzelsitzungen ergibt sich das Ergebnis direkt aus der Zahl der Siege: Jedes Element erhält einen Punkt für jeden gewonnenen Vergleich. Die endgültige Rangliste ordnet die Elemente von den meisten zu den wenigsten Siegen.

Aggregation von Gruppenantworten

Bei Gruppensitzungen werden die Vergleiche aller Teilnehmer aggregiert, bevor das endgültige Ranking berechnet wird. Die Gruppensumme der Siege für einen Vergleich ist die Summe der einzelnen Stimmen aller Teilnehmer.

Entscheidend ist, dass das aggregierte Ergebnis auch die Form der Uneinigkeit sichtbar macht. Elemente, die die Gruppe spalten, sind in den Daten erkennbar — und das ist oft das wertvollste Ergebnis einer Gruppensitzung.

Zur Intransitivität
In seltenen Fällen kann der Paarvergleich intransitive Ergebnisse liefern — A schlägt B, B schlägt C, aber C schlägt A. Das ist als Condorcet-Paradoxon bekannt.

Die Gruppensitzung als Diagnosewerkzeug

Die Rangliste ist nicht das einzige Ergebnis. Die Form der Uneinigkeit ist genauso wichtig.

Herkömmliche Methoden der Gruppenentscheidung teilen einen grundlegenden Fehler: Sie hängen von der Reihenfolge ab, in der Meinungen geäußert werden. Wer zuerst spricht, setzt den Anker für die Gruppe.

Das ist kein Versagen Einzelner — es ist eine vorhersehbare Folge der Gruppendynamik. Die Forschung hat immer wieder gezeigt, dass Gruppendiskussionen weniger genaue kollektive Urteile hervorbringen als die Zusammenführung unabhängiger, privater Urteile. Dieser Effekt wird manchmal als Hidden-Profile-Problem bezeichnet.

„Gruppen versäumen es regelmäßig, Informationen zu teilen, über die nur einzelne Mitglieder verfügen, und dieses Versäumnis ist systematisch, nicht zufällig.“

Stasser & Titus · Journal of Personality and Social Psychology · 1985
Hinweis für Moderatoren
Am wirksamsten ist eine Gruppensitzung, wenn das Ergebnis vor der Diskussion aufgedeckt wird, nicht danach. Der Gruppe zu zeigen, was sie gemeinsam denkt — bevor jemand gesprochen hat —, verändert die Qualität des folgenden Gesprächs.

Wo sie eingesetzt wird

Von der Psychoakustik bis zum KI-Training — die Methode skaliert.

Strategische Planung und Management

Der Analytic Hierarchy Process wird bei folgenreichen strategischen Entscheidungen in Verteidigung, Infrastruktur, Gesundheitswesen und Verwaltung eingesetzt. Eine Übersichtsarbeit von 2008 zählte über 900 veröffentlichte Anwendungen in 19 verschiedenen Fachgebieten.

Maschinelles Lernen und KI

Reinforcement Learning from Human Feedback (RLHF), die Technik, mit der moderne große Sprachmodelle trainiert werden, beruht vollständig auf Paarvergleichen. Menschlichen Bewertern werden zwei Modellausgaben gezeigt, und sie wählen die bessere aus.

Sport und Wettkampf-Rankings

Das Elo-System, das im Schach, im Fußball und in Dutzenden anderen Wettkampfbereichen genutzt wird, ist eine direkte Anwendung des paarweisen Bradley-Terry-Modells.

Weiterführende Literatur

Primärquellen und Schlüsseltexte.

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Bereit, die Methode auszuprobieren?

Richten Sie in unter zwei Minuten eine Einzel- oder Gruppensitzung ein. Zum Starten ist kein Konto nötig.

Neues Ranking erstellen →