Sulla classifica a coppie

La scienza delle decisioni migliori.

Il confronto a coppie non è un'idea nuova. È stato studiato, sperimentato e convalidato in quasi un secolo di ricerca in psicologia, economia e scienza delle decisioni.

1927 Thurstone formalizza il metodo
900+ applicazioni pubblicate in 19 campi
14 studi indipendenti secondo cui le coppie battono le scale
Una macchina da scrivere, un blocco note e una matita

Dalla psicofisica alle sale riunioni

Un metodo formalizzato nel 1927 — e replicato da allora.

A Law of Comparative Judgment di Thurstone, University of Chicago, 1927.

La storia intellettuale del confronto a coppie inizia con un problema pratico: come si misurano cose che non hanno un'unità di misura naturale?

La risposta, proposta dallo psicologo Louis Leon Thurstone della University of Chicago, fu confrontare le cose direttamente, a coppie. Il suo articolo del 1927, A Law of Comparative Judgment, formalizzò questa intuizione in un modello matematico preciso.

«Il metodo dei confronti a coppie produce una scala di valori psicologici più affidabile di qualsiasi altro metodo di scalatura.»

Louis Leon Thurstone · Psychological Review · 1927

L'intuizione di Thurstone si basava su un'osservazione empirica: le persone sono molto più brave a rispondere a «quale di questi due è più forte?» che a «quanto è forte questo, su una scala da uno a dieci?»

Perché le coppie funzionano meglio delle scale

Il carico cognitivo di una valutazione è più alto di quanto sembri.

Quando chiedi a qualcuno di valutare l'importanza di una priorità strategica su una scala da uno a dieci, gli chiedi di svolgere contemporaneamente diverse operazioni cognitive. Questo processo introduce un errore sistematico a ogni passaggio.

Il più dannoso di questi errori è il bias di ancoraggio. Il primo elemento valutato tende a influenzare tutte le valutazioni successive; le ricerche di Tversky e Kahneman (1974) hanno dimostrato che gli effetti di ancoraggio sono sia ampi sia notevolmente resistenti alla correzione.

Una seconda fonte di errore è la compressione della scala. In pratica, la maggior parte dei rispondenti evita gli estremi delle scale e concentra le risposte al centro — ed è per questo che un sondaggio su dodici priorità restituisce così spesso dodici cose tutte «molto importanti».

L'intera interazione, ripetuta più e più volte finché ogni elemento non è stato confrontato con tutti gli altri.

Un aumento di stipendio
O
Una settimana di ferie in più
Prezzo più basso
O
Consegna più rapida
Un'assunzione senior
O
Due junior

Chiedi a chiunque di dare un voto su dieci e tornano entrambi con un nove. Chiedigli di scegliere e risponde in un secondo — e ne è convinto.

Nota di ricerca
La superiorità del confronto a coppie rispetto alle scale di valutazione è stata dimostrata ripetutamente in quattordici studi indipendenti (Dillon, Frederick & Tangpanichdee, 1985).

Come le preferenze diventano una classifica

Il metodo di aggregazione è semplice, trasparente e matematicamente fondato.

Dati n elementi da classificare, ogni elemento viene confrontato con ogni altro esattamente una volta. Il numero totale di confronti necessari è n(n−1)/2.

Aggregare le risposte individuali

Nelle sessioni di classifica individuale, il risultato deriva direttamente dal numero di vittorie: ogni elemento riceve un punto per ogni confronto che vince. La classifica finale ordina gli elementi da quello con più vittorie a quello con meno.

Aggregare le risposte di gruppo

Nelle sessioni di gruppo, i confronti di ogni partecipante vengono aggregati prima di calcolare la classifica finale. Il totale delle vittorie di gruppo per un confronto è la somma dei voti individuali di tutti i partecipanti.

Soprattutto, il risultato aggregato mostra anche la forma del disaccordo. Gli elementi che dividono il gruppo sono visibili nei dati — e questo è spesso il risultato più prezioso di una sessione di gruppo.

Sull'intransitività
In rari casi, il confronto a coppie può produrre risultati intransitivi — in cui A batte B, B batte C, ma C batte A. È noto come paradosso di Condorcet.

La sessione di gruppo come strumento diagnostico

La classifica non è l'unico risultato. La forma del disaccordo è altrettanto importante.

I metodi convenzionali di decisione di gruppo hanno un difetto fondamentale in comune: sono sensibili all'ordine in cui vengono espresse le opinioni. La prima persona che parla fa da ancora per il gruppo.

Non è un fallimento dei singoli — è una conseguenza prevedibile delle dinamiche di gruppo. Le ricerche hanno costantemente rilevato che le discussioni di gruppo producono giudizi collettivi meno accurati dell'aggregazione di giudizi privati indipendenti. Questo effetto è talvolta chiamato problema del profilo nascosto.

«I gruppi non riescono costantemente a condividere le informazioni possedute da singoli membri, e questo fallimento è sistematico, non casuale.»

Stasser & Titus · Journal of Personality and Social Psychology · 1985
Nota per il facilitatore
L'uso più efficace di una sessione di gruppo è mostrare il risultato prima che inizi la discussione, non dopo. Mostrare al gruppo ciò che pensa collettivamente — prima che qualcuno abbia parlato — cambia la qualità della conversazione che segue.

Dove si usa

Dalla psicoacustica all'addestramento dell'IA — il metodo è scalabile.

Pianificazione strategica e management

L'Analytic Hierarchy Process è stato usato in decisioni strategiche ad alto rischio nella difesa, nelle infrastrutture, nella sanità e nella pubblica amministrazione. Una rassegna del 2008 ha individuato oltre 900 applicazioni pubblicate in 19 campi diversi.

Machine learning e IA

Il reinforcement learning from human feedback (RLHF), la tecnica usata per addestrare i moderni modelli linguistici di grandi dimensioni, si basa interamente sul confronto a coppie. Ai valutatori umani vengono mostrati due output del modello e viene chiesto di scegliere il migliore.

Sport e classifiche competitive

Il sistema di punteggio Elo, usato negli scacchi, nel calcio e in decine di altri ambiti competitivi, è un'applicazione diretta del modello a coppie di Bradley–Terry.

Letture consigliate

Fonti primarie e testi chiave.

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Pronto a provare il metodo?

Configura una sessione individuale o di gruppo in meno di due minuti. Non serve un account per iniziare.

Crea nuova classifica →