À propos du classement par paires
La science des meilleures décisions.
La comparaison par paires n'est pas une idée nouvelle. Elle a été étudiée, testée et validée pendant près d'un siècle de recherche en psychologie, en économie et en science de la décision.
- 01Origines
- 02Fondement cognitif
- 03Les mathématiques
- 04Dynamique de groupe
- 05Applications
- 06Références
De la psychophysique aux conseils d'administration
Une méthode formalisée en 1927 — et reproduite depuis.

L'histoire intellectuelle de la comparaison par paires commence par un problème pratique : comment mesurer des choses qui n'ont pas d'unité naturelle ?
La réponse, proposée par le psychologue Louis Leon Thurstone à l'Université de Chicago, fut de comparer les choses directement, par paires. Son article de 1927, A Law of Comparative Judgment, a formalisé cette intuition en un modèle mathématique précis.
« La méthode des comparaisons par paires produit une échelle de valeurs psychologiques plus fiable que toute autre méthode de mise à l'échelle. »
Louis Leon Thurstone · Psychological Review · 1927L'intuition de Thurstone reposait sur une observation empirique : les gens répondent nettement mieux à « lequel de ces deux sons est le plus fort ? » qu'à « quelle est l'intensité de ce son, sur une échelle de un à dix ? »
Pourquoi les paires fonctionnent mieux que les échelles
La charge cognitive de la notation est plus élevée qu'il n'y paraît.
Quand vous demandez à quelqu'un de noter l'importance d'une priorité stratégique sur une échelle de un à dix, vous lui demandez d'effectuer plusieurs opérations cognitives simultanément. Ce processus introduit une erreur systématique à chaque étape.
La plus dommageable de ces erreurs est le biais d'ancrage. Le premier élément noté tend à influencer toutes les notes suivantes ; les travaux de Tversky et Kahneman (1974) ont montré que les effets d'ancrage sont à la fois importants et remarquablement résistants à la correction.
Une deuxième source d'erreur est la compression de l'échelle. En pratique, la plupart des répondants évitent les extrémités des échelles et regroupent leurs réponses au milieu — c'est pourquoi une enquête sur douze priorités renvoie si souvent douze choses toutes « très importantes ».
Toute l'interaction, répétée encore et encore jusqu'à ce que chaque élément ait été comparé à tous les autres.
Demandez à quelqu'un de les noter sur dix et les deux obtiennent neuf. Demandez-lui de choisir et il répond en une seconde — et il le pense.
Comment les préférences deviennent un classement
La méthode d'agrégation est simple, transparente et mathématiquement fondée.
Pour n éléments à classer, chaque élément est comparé exactement une fois à chacun des autres. Le nombre total de comparaisons nécessaires est n(n−1)/2.
Agréger les réponses individuelles
Pour les sessions de classement individuelles, le résultat découle directement du nombre de victoires : chaque élément reçoit un point pour chaque comparaison qu'il remporte. La liste finale ordonne les éléments du plus grand au plus petit nombre de victoires.
Agréger les réponses d'un groupe
Pour les sessions de groupe, les comparaisons de chaque participant sont agrégées avant le calcul du classement final. Le total des victoires du groupe pour une comparaison est la somme des votes individuels de tous les participants.
Point essentiel, le résultat agrégé révèle aussi la forme du désaccord. Les éléments qui divisent le groupe sont visibles dans les données — et c'est souvent le résultat le plus précieux d'une session de groupe.
La session de groupe comme outil de diagnostic
La liste classée n'est pas le seul résultat. La forme du désaccord compte tout autant.
Les méthodes classiques de décision en groupe partagent un défaut fondamental : elles sont sensibles à l'ordre dans lequel les opinions s'expriment. La première personne qui parle ancre le groupe.
Ce n'est pas un échec des individus — c'est une conséquence prévisible de la dynamique de groupe. La recherche a constamment montré que les discussions de groupe produisent des jugements collectifs moins exacts que l'agrégation de jugements privés indépendants. Cet effet est parfois appelé le problème du profil caché.
« Les groupes échouent systématiquement à partager les informations détenues par un seul de leurs membres, et cet échec est systématique plutôt qu'aléatoire. »
Stasser & Titus · Journal of Personality and Social Psychology · 1985Où elle est utilisée
De la psychoacoustique à l'entraînement de l'IA — la méthode passe à l'échelle.
Planification stratégique et management
L'Analytic Hierarchy Process (AHP) a été utilisé pour des décisions stratégiques à fort enjeu dans la défense, les infrastructures, la santé et l'administration publique. Une revue de 2008 a recensé plus de 900 applications publiées dans 19 domaines différents.
Apprentissage automatique et IA
L'apprentissage par renforcement à partir de retours humains (RLHF), la technique utilisée pour entraîner les grands modèles de langage modernes, repose entièrement sur la comparaison par paires. Des évaluateurs humains voient deux réponses du modèle et doivent choisir la meilleure.
Sport et classements compétitifs
Le système de classement Elo, utilisé aux échecs, au football et dans des dizaines d'autres domaines compétitifs, est une application directe du modèle par paires de Bradley–Terry.
Pour aller plus loin
Sources primaires et textes clés.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Configurez une session individuelle ou de groupe en moins de deux minutes. Aucun compte requis pour commencer.