À propos du classement par paires

La science des meilleures décisions.

La comparaison par paires n'est pas une idée nouvelle. Elle a été étudiée, testée et validée pendant près d'un siècle de recherche en psychologie, en économie et en science de la décision.

1927 Thurstone formalise la méthode
900+ applications publiées dans 19 domaines
14 études indépendantes concluant que les paires battent les échelles
Une machine à écrire, un bloc-notes et un crayon

De la psychophysique aux conseils d'administration

Une méthode formalisée en 1927 — et reproduite depuis.

A Law of Comparative Judgment de Thurstone, Université de Chicago, 1927.

L'histoire intellectuelle de la comparaison par paires commence par un problème pratique : comment mesurer des choses qui n'ont pas d'unité naturelle ?

La réponse, proposée par le psychologue Louis Leon Thurstone à l'Université de Chicago, fut de comparer les choses directement, par paires. Son article de 1927, A Law of Comparative Judgment, a formalisé cette intuition en un modèle mathématique précis.

« La méthode des comparaisons par paires produit une échelle de valeurs psychologiques plus fiable que toute autre méthode de mise à l'échelle. »

Louis Leon Thurstone · Psychological Review · 1927

L'intuition de Thurstone reposait sur une observation empirique : les gens répondent nettement mieux à « lequel de ces deux sons est le plus fort ? » qu'à « quelle est l'intensité de ce son, sur une échelle de un à dix ? »

Pourquoi les paires fonctionnent mieux que les échelles

La charge cognitive de la notation est plus élevée qu'il n'y paraît.

Quand vous demandez à quelqu'un de noter l'importance d'une priorité stratégique sur une échelle de un à dix, vous lui demandez d'effectuer plusieurs opérations cognitives simultanément. Ce processus introduit une erreur systématique à chaque étape.

La plus dommageable de ces erreurs est le biais d'ancrage. Le premier élément noté tend à influencer toutes les notes suivantes ; les travaux de Tversky et Kahneman (1974) ont montré que les effets d'ancrage sont à la fois importants et remarquablement résistants à la correction.

Une deuxième source d'erreur est la compression de l'échelle. En pratique, la plupart des répondants évitent les extrémités des échelles et regroupent leurs réponses au milieu — c'est pourquoi une enquête sur douze priorités renvoie si souvent douze choses toutes « très importantes ».

Toute l'interaction, répétée encore et encore jusqu'à ce que chaque élément ait été comparé à tous les autres.

Une augmentation
OU
Une semaine de congé en plus
Un prix plus bas
OU
Une livraison plus rapide
Un recrutement senior
OU
Deux juniors

Demandez à quelqu'un de les noter sur dix et les deux obtiennent neuf. Demandez-lui de choisir et il répond en une seconde — et il le pense.

Note de recherche
La supériorité de la comparaison par paires sur les échelles de notation a été démontrée à maintes reprises dans quatorze études indépendantes (Dillon, Frederick & Tangpanichdee, 1985).

Comment les préférences deviennent un classement

La méthode d'agrégation est simple, transparente et mathématiquement fondée.

Pour n éléments à classer, chaque élément est comparé exactement une fois à chacun des autres. Le nombre total de comparaisons nécessaires est n(n−1)/2.

Agréger les réponses individuelles

Pour les sessions de classement individuelles, le résultat découle directement du nombre de victoires : chaque élément reçoit un point pour chaque comparaison qu'il remporte. La liste finale ordonne les éléments du plus grand au plus petit nombre de victoires.

Agréger les réponses d'un groupe

Pour les sessions de groupe, les comparaisons de chaque participant sont agrégées avant le calcul du classement final. Le total des victoires du groupe pour une comparaison est la somme des votes individuels de tous les participants.

Point essentiel, le résultat agrégé révèle aussi la forme du désaccord. Les éléments qui divisent le groupe sont visibles dans les données — et c'est souvent le résultat le plus précieux d'une session de groupe.

Sur l'intransitivité
Dans de rares cas, la comparaison par paires peut produire des résultats intransitifs — A bat B, B bat C, mais C bat A. C'est ce qu'on appelle le paradoxe de Condorcet.

La session de groupe comme outil de diagnostic

La liste classée n'est pas le seul résultat. La forme du désaccord compte tout autant.

Les méthodes classiques de décision en groupe partagent un défaut fondamental : elles sont sensibles à l'ordre dans lequel les opinions s'expriment. La première personne qui parle ancre le groupe.

Ce n'est pas un échec des individus — c'est une conséquence prévisible de la dynamique de groupe. La recherche a constamment montré que les discussions de groupe produisent des jugements collectifs moins exacts que l'agrégation de jugements privés indépendants. Cet effet est parfois appelé le problème du profil caché.

« Les groupes échouent systématiquement à partager les informations détenues par un seul de leurs membres, et cet échec est systématique plutôt qu'aléatoire. »

Stasser & Titus · Journal of Personality and Social Psychology · 1985
Note pour l'animateur
L'usage le plus efficace d'une session de groupe est de révéler le résultat avant le début de la discussion, pas après. Montrer au groupe ce qu'il pense collectivement — avant que quiconque ait parlé — change la qualité de la conversation qui suit.

Où elle est utilisée

De la psychoacoustique à l'entraînement de l'IA — la méthode passe à l'échelle.

Planification stratégique et management

L'Analytic Hierarchy Process (AHP) a été utilisé pour des décisions stratégiques à fort enjeu dans la défense, les infrastructures, la santé et l'administration publique. Une revue de 2008 a recensé plus de 900 applications publiées dans 19 domaines différents.

Apprentissage automatique et IA

L'apprentissage par renforcement à partir de retours humains (RLHF), la technique utilisée pour entraîner les grands modèles de langage modernes, repose entièrement sur la comparaison par paires. Des évaluateurs humains voient deux réponses du modèle et doivent choisir la meilleure.

Sport et classements compétitifs

Le système de classement Elo, utilisé aux échecs, au football et dans des dizaines d'autres domaines compétitifs, est une application directe du modèle par paires de Bradley–Terry.

Pour aller plus loin

Sources primaires et textes clés.

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Prêt à essayer la méthode ?

Configurez une session individuelle ou de groupe en moins de deux minutes. Aucun compte requis pour commencer.

Créer un classement →