Sobre el ranking por pares
La ciencia de las mejores decisiones.
La comparación por pares no es una idea nueva. Se ha estudiado, probado y validado a lo largo de casi un siglo de investigación en psicología, economía y ciencia de la decisión.
De la psicofísica a los consejos de administración
Un método formalizado en 1927 y replicado desde entonces.

La historia intelectual de la comparación por pares empieza con un problema práctico: ¿cómo se miden cosas que no tienen una unidad natural?
La respuesta, propuesta por el psicólogo Louis Leon Thurstone en la Universidad de Chicago, fue comparar las cosas directamente, por pares. Su artículo de 1927, A Law of Comparative Judgment, formalizó esta idea en un modelo matemático preciso.
«El método de las comparaciones por pares produce una escala de valores psicológicos más fiable que cualquier otro método de escalamiento.»
Louis Leon Thurstone · Psychological Review · 1927La idea de Thurstone se basaba en una observación empírica: a la gente se le da mucho mejor responder «¿cuál de estos dos suena más fuerte?» que «¿cómo de fuerte suena esto, en una escala del uno al diez?»
Por qué los pares funcionan mejor que las escalas
La carga cognitiva de puntuar es mayor de lo que parece.
Cuando pides a alguien que puntúe la importancia de una prioridad estratégica en una escala del uno al diez, le pides que realice varias operaciones cognitivas a la vez. Este proceso introduce un error sistemático en cada paso.
El más dañino de estos errores es el sesgo de anclaje. El primer elemento puntuado tiende a influir en todas las puntuaciones posteriores; la investigación de Tversky y Kahneman (1974) demostró que los efectos de anclaje son grandes y notablemente resistentes a la corrección.
Una segunda fuente de error es la compresión de la escala. En la práctica, la mayoría de los encuestados evita los extremos de las escalas y concentra las respuestas en el centro, y por eso una encuesta sobre doce prioridades devuelve tan a menudo doce cosas que son todas «muy importantes».
Toda la interacción, repetida una y otra vez hasta que cada elemento se ha comparado con todos los demás.
Pide a cualquiera que puntúe estas opciones sobre diez y ambas sacan un nueve. Pídele que elija y responde en un segundo, y lo dice en serio.
Cómo las preferencias se convierten en un ranking
El método de agregación es sencillo, transparente y tiene una base matemática.
Dados n elementos que ordenar, cada elemento se compara con todos los demás exactamente una vez. El número total de comparaciones necesarias es n(n−1)/2.
Agregar respuestas individuales
En las sesiones de ranking individuales, el resultado se obtiene directamente del recuento de victorias: cada elemento recibe un punto por cada comparación que gana. La lista final ordena los elementos de más a menos victorias.
Agregar respuestas de grupo
En las sesiones de grupo, las comparaciones de cada participante se agregan antes de calcular el ranking final. El total de victorias del grupo en cualquier comparación es la suma de los votos individuales de todos los participantes.
Y lo más importante: el resultado agregado también deja ver la forma del desacuerdo. Los elementos que dividen al grupo se ven en los datos, y a menudo es el resultado más valioso de una sesión de grupo.
La sesión de grupo como herramienta de diagnóstico
La lista ordenada no es el único resultado. La forma del desacuerdo importa igual.
Los métodos convencionales de decisión en grupo comparten un defecto fundamental: son sensibles al orden en que se expresan las opiniones. La primera persona que habla ancla al grupo.
No es un fallo de las personas, sino una consecuencia previsible de la dinámica de grupo. La investigación ha encontrado una y otra vez que los debates en grupo producen juicios colectivos menos precisos que la agregación de juicios privados e independientes. Este efecto se conoce a veces como el problema del perfil oculto.
«Los grupos no comparten sistemáticamente la información que solo tiene uno de sus miembros, y este fallo es sistemático, no aleatorio.»
Stasser & Titus · Journal of Personality and Social Psychology · 1985Dónde se usa
De la psicoacústica al entrenamiento de IA: el método escala.
Planificación estratégica y gestión
El Proceso Analítico Jerárquico (AHP) se ha usado en decisiones estratégicas de gran calado en defensa, infraestructuras, sanidad y administración pública. Una revisión de 2008 identificó más de 900 aplicaciones publicadas en 19 campos distintos.
Aprendizaje automático e IA
El aprendizaje por refuerzo a partir de retroalimentación humana (RLHF), la técnica usada para entrenar los grandes modelos de lenguaje actuales, se basa por completo en la comparación por pares. A los evaluadores humanos se les muestran dos respuestas del modelo y se les pide que elijan la mejor.
Deporte y clasificaciones competitivas
El sistema de puntuación Elo, usado en el ajedrez, el fútbol y decenas de otros ámbitos competitivos, es una aplicación directa del modelo por pares de Bradley–Terry.
Lecturas recomendadas
Fuentes primarias y textos clave.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Configura una sesión individual o de grupo en menos de dos minutos. No necesitas cuenta para empezar.