Sobre o ranking por pares

A ciência das melhores decisões.

A comparação por pares não é uma ideia nova. Foi estudada, testada e validada ao longo de quase um século de investigação em psicologia, economia e ciência da decisão.

1927 Thurstone formaliza o método
1952 Bradley e Terry modelam escolhas em pares
Uma máquina de escrever, um bloco de notas e um lápis

Da psicofísica às salas de administração

Um método formalizado em 1927 — e replicado desde então.

A Law of Comparative Judgment, de Thurstone, Universidade de Chicago, 1927.

A história intelectual da comparação por pares começa com um problema prático: como medir coisas que não têm uma unidade natural?

A resposta, proposta pelo psicólogo Louis Leon Thurstone na Universidade de Chicago, foi comparar as coisas diretamente, aos pares. O seu artigo de 1927, A Law of Comparative Judgment, formalizou esta intuição num modelo matemático preciso.

A intuição de Thurstone assentava numa observação empírica: as pessoas respondem muito melhor a «qual destes dois é mais alto?» do que a «quão alto é isto, numa escala de um a dez?»

Porque é que os pares funcionam melhor do que as escalas

A carga cognitiva de classificar é maior do que parece.

Quando pede a alguém que classifique a importância de uma prioridade estratégica numa escala de um a dez, está a pedir-lhe que realize várias operações cognitivas em simultâneo. Este processo introduz erros sistemáticos em cada passo.

O mais prejudicial destes erros é o viés de ancoragem. O primeiro item classificado tende a influenciar todas as classificações seguintes; a investigação de Tversky e Kahneman (1974) demonstrou que os efeitos de ancoragem são grandes e notavelmente resistentes à correção.

Uma segunda fonte de erro é a compressão da escala. Na prática, a maioria dos inquiridos evita os extremos das escalas e concentra as respostas no meio — é por isso que um inquérito sobre doze prioridades devolve tantas vezes doze coisas todas «muito importantes».

Toda a interação, repetida vezes sem conta até cada item ter sido comparado com todos os outros.

Um aumento salarial
OU
Uma semana extra de férias
Preço mais baixo
OU
Entrega mais rápida
Uma contratação sénior
OU
Dois juniores

Peça a alguém que classifique estas opções de zero a dez e ambas recebem um nove. Peça-lhe que escolha e responde num segundo — e com convicção.

Como as preferências se tornam um ranking

O método de agregação é simples, transparente e tem fundamento matemático.

Dados n itens para classificar, cada item é comparado exatamente uma vez com todos os outros. O número total de comparações necessárias é n(n−1)/2.

Agregar respostas individuais

A pontuação de cada item é a sua taxa de vitórias: a proporção das suas comparações que venceu, em que um empate ou um salto contam como metade. Ordenar os itens por vitórias é simples e transparente, e a investigação mostra que o método se aguenta bem face a modelos estatísticos mais complexos (Shah & Wainwright, 2018).

Agregar respostas de grupo

Nas sessões em grupo, as comparações de cada participante são agregadas antes de se calcular o ranking final. O total de vitórias do grupo em qualquer comparação é a soma dos votos individuais de todos os participantes.

Fundamentalmente, o resultado agregado também revela a forma do desacordo. Os itens que dividem o grupo são visíveis nos dados — e este é muitas vezes o resultado mais valioso de uma sessão em grupo.

Sobre a intransitividade
Em casos raros, a comparação por pares pode produzir resultados intransitivos — em que A vence B, B vence C, mas C vence A. É o chamado paradoxo de Condorcet.

A sessão em grupo como ferramenta de diagnóstico

A lista ordenada não é o único resultado. A forma do desacordo é igualmente importante.

Os métodos convencionais de tomada de decisão em grupo partilham uma falha fundamental: são sensíveis à ordem pela qual as opiniões são expressas. A primeira pessoa a falar ancora o grupo.

Os grupos tendem a discutir o que todos já sabem e a aproveitar pouco o que só um membro sabe. É o problema do perfil oculto (Stasser & Titus, 1985). Recolher em privado as escolhas de cada pessoa, antes de qualquer discussão, põe todos os pontos de vista em cima da mesa.

Nota para o facilitador
A utilização mais eficaz de uma sessão em grupo é revelar o resultado antes de a discussão começar, e não depois. Mostrar ao grupo aquilo em que acredita coletivamente — antes de alguém ter falado — muda a qualidade da conversa que se segue.

Onde é utilizado

Da psicoacústica ao treino de IA — o método é escalável.

Planeamento estratégico e gestão

O Processo de Análise Hierárquica tem sido utilizado em decisões estratégicas de grande impacto nas áreas da defesa, infraestruturas, saúde e administração pública. Uma revisão de 2008 identificou mais de 900 aplicações publicadas em 19 áreas diferentes.

Aprendizagem automática e IA

A aprendizagem por reforço a partir de feedback humano (RLHF), a técnica utilizada para treinar os modernos grandes modelos de linguagem, assenta inteiramente na comparação por pares. São mostrados a avaliadores humanos dois resultados do modelo e é-lhes pedido que escolham o melhor.

Desporto e rankings competitivos

O sistema de classificação Elo, utilizado no xadrez, no futebol e em dezenas de outros domínios competitivos, está estreitamente relacionado com o modelo de comparação aos pares de Bradley-Terry.

Leituras complementares

Fontes primárias e textos fundamentais.

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
07
Shah, N. B. & Wainwright, M. J. (2018)
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
Pronto para experimentar o método?

Configure uma sessão individual ou em grupo em menos de dois minutos. Não é necessária conta para começar.

Criar novo ranking →