Sobre o ranking por pares
A ciência das decisões melhores.
A comparação por pares não é uma ideia nova. Ela foi estudada, testada e validada ao longo de quase um século de pesquisa em psicologia, economia e ciência da decisão.
Da psicofísica às salas de reunião
Um método formalizado em 1927 — e replicado desde então.

A história intelectual da comparação por pares começa com um problema prático: como medir coisas que não têm uma unidade natural?
A resposta, proposta pelo psicólogo Louis Leon Thurstone na Universidade de Chicago, foi comparar as coisas diretamente, aos pares. Seu artigo de 1927, A Law of Comparative Judgment, formalizou essa ideia em um modelo matemático preciso.
“O método das comparações pareadas produz uma escala de valores psicológicos mais confiável que qualquer outro método de escalonamento.”
Louis Leon Thurstone · Psychological Review · 1927A ideia de Thurstone se apoiava em uma observação empírica: as pessoas respondem muito melhor a “qual destes dois é mais alto?” do que a “quão alto é isto, numa escala de um a dez?”
Por que pares funcionam melhor que escalas
O esforço cognitivo de dar notas é maior do que parece.
Quando você pede a alguém que avalie a importância de uma prioridade estratégica numa escala de um a dez, está pedindo que essa pessoa faça várias operações cognitivas ao mesmo tempo. Esse processo introduz erro sistemático em cada etapa.
O mais prejudicial desses erros é o viés de ancoragem. O primeiro item avaliado tende a influenciar todas as notas seguintes; a pesquisa de Tversky e Kahneman (1974) mostrou que os efeitos de ancoragem são grandes e notavelmente resistentes à correção.
Uma segunda fonte de erro é a compressão da escala. Na prática, a maioria dos respondentes evita os extremos das escalas e concentra as respostas no meio — e é por isso que uma pesquisa com doze prioridades tantas vezes devolve doze coisas “muito importantes”.
A interação inteira, repetida várias e várias vezes até que cada item tenha sido comparado com todos os outros.
Peça para alguém dar nota de zero a dez e as duas opções voltam com nove. Peça para escolher e a pessoa responde em um segundo — e com convicção.
Como preferências viram um ranking
O método de agregação é simples, transparente e matematicamente fundamentado.
Dados n itens para ranquear, cada item é comparado com todos os outros exatamente uma vez. O número total de comparações necessárias é n(n−1)/2.
Agregando respostas individuais
Em sessões de ranking individual, o resultado vem direto da contagem de vitórias: cada item recebe um ponto por comparação que vence. A lista final ordena os itens do que tem mais vitórias para o que tem menos.
Agregando respostas do grupo
Em sessões em grupo, as comparações de cada participante são agregadas antes do cálculo do ranking final. O total de vitórias do grupo em qualquer comparação é a soma dos votos individuais de todos os participantes.
O ponto crucial é que o resultado agregado também revela o formato da discordância. Os itens que dividem o grupo ficam visíveis nos dados — e muitas vezes esse é o resultado mais valioso de uma sessão em grupo.
A sessão em grupo como ferramenta de diagnóstico
A lista ranqueada não é o único resultado. O formato da discordância é igualmente importante.
Os métodos convencionais de decisão em grupo têm uma falha fundamental em comum: são sensíveis à ordem em que as opiniões são expressas. A primeira pessoa a falar ancora o grupo.
Isso não é uma falha das pessoas — é uma consequência previsível da dinâmica de grupo. A pesquisa tem mostrado de forma consistente que discussões em grupo produzem julgamentos coletivos menos precisos do que a agregação de julgamentos privados e independentes. Esse efeito às vezes é chamado de problema do perfil oculto.
“Os grupos falham de forma consistente em compartilhar informações que só um membro tem, e essa falha é sistemática, não aleatória.”
Stasser & Titus · Journal of Personality and Social Psychology · 1985Onde é usado
Da psicoacústica ao treinamento de IA — o método escala.
Planejamento estratégico e gestão
O Analytic Hierarchy Process (AHP) tem sido usado em decisões estratégicas de alto risco em defesa, infraestrutura, saúde e governo. Uma revisão de 2008 identificou mais de 900 aplicações publicadas em 19 áreas diferentes.
Aprendizado de máquina e IA
O aprendizado por reforço com feedback humano (RLHF), técnica usada para treinar os grandes modelos de linguagem atuais, depende inteiramente da comparação por pares. Avaliadores humanos veem duas respostas do modelo e escolhem a melhor.
Esportes e rankings competitivos
O sistema de classificação Elo, usado no xadrez, no futebol e em dezenas de outras áreas competitivas, é uma aplicação direta do modelo de pares de Bradley–Terry.
Leituras complementares
Fontes primárias e textos-chave.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Configure uma sessão individual ou em grupo em menos de dois minutos. Não é preciso conta para começar.