关于两两比较排名
更好决策的科学。
两两比较并不是新想法。在近一个世纪的心理学、经济学和决策科学研究中,它已被反复研究、检验和验证。
从心理物理学到董事会
1927 年形式化的方法 — 此后被一再验证。

两两比较的思想史始于一个实际问题:如何衡量没有天然单位的事物?
芝加哥大学心理学家路易斯·利昂·瑟斯顿提出的答案是:直接把事物成对比较。他在 1927 年发表的论文 A Law of Comparative Judgment 将这一洞见形式化为精确的数学模型。
“配对比较法得出的心理值量表,比任何其他量表方法都更可靠。”
Louis Leon Thurstone · Psychological Review · 1927瑟斯顿的洞见源于一项实证观察:人们回答“这两个哪个更响?”远比回答“在一到十的量表上这个有多响?”要准确得多。
为什么两两比较比量表更有效
打分的认知负担比看上去更大。
当您请人用一到十分给某项战略优先事项的重要性打分时,就是在要求他同时完成多项认知操作。这个过程在每一步都会引入系统性误差。
其中危害最大的是锚定偏差。第一个被打分的项目往往会影响之后所有的评分;特沃斯基和卡尼曼(1974)的研究表明,锚定效应既大且极难纠正。
第二个误差来源是量表压缩。实际中,大多数答题者会避开量表两端,把回答集中在中间 — 这就是为什么一份包含十二项优先事项的调查,常常得出十二件“非常重要”的事。
整个交互就是这样,一遍又一遍,直到每个项目都与其他每个项目比较过。
让任何人用十分制打分,两项都得九分。让他二选一,他一秒钟就能回答 — 而且是真心的。
偏好如何变成排名
汇总方法简单、透明,并有数学依据。
若有 n 个项目需要排名,每个项目都与其他每个项目恰好比较一次。所需比较总数为 n(n−1)/2。
汇总个人回答
在个人排名会话中,结果直接来自胜出次数:每个项目每赢一次比较得一分。最终列表按胜出次数从多到少排序。
汇总小组回答
在小组会话中,先汇总每位参与者的比较,再计算最终排名。任一比较中小组的胜出总数,是所有参与者个人投票的总和。
关键在于,汇总结果还揭示了分歧的形态。让小组产生分歧的项目在数据中清晰可见 — 这往往是小组会话最有价值的产出。
作为诊断工具的小组会话
排好序的列表并不是唯一的产出。分歧的形态同样重要。
传统的群体决策方法有一个共同的根本缺陷:它们受观点表达顺序的影响。第一个发言的人会为整个小组定下锚点。
这并不是个人的失误 — 而是群体动力可预见的结果。研究一再发现,小组讨论得出的集体判断,不如独立的个人判断汇总后准确。这种效应有时被称为隐藏信息问题。
“群体总是无法分享只有部分成员掌握的信息,而且这种失败是系统性的,而非偶然。”
Stasser & Titus · Journal of Personality and Social Psychology · 1985应用领域
从心理声学到 AI 训练 — 这一方法可以扩展。
战略规划与管理
层次分析法(AHP)已被用于国防、基础设施、医疗和政府领域的高风险战略决策。2008 年的一篇综述在 19 个不同领域中找到了 900 多项已发表的应用。
机器学习与 AI
基于人类反馈的强化学习(RLHF)是训练当今大语言模型的技术,它完全依赖两两比较。人类评估者会看到模型的两个输出,并选出更好的一个。
体育与竞技排名
国际象棋、足球及数十种其他竞技领域使用的 Elo 等级分系统,正是 Bradley–Terry 成对模型的直接应用。
延伸阅读
原始资料与核心文献。
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
两分钟内即可设置个人或小组会话。无需账户即可开始。