关于两两比较排名

更好决策的科学。

两两比较并不是新想法。在近一个世纪的心理学、经济学和决策科学研究中,它已被反复研究、检验和验证。

1927 瑟斯顿将该方法形式化
900+ 在 19 个领域发表的应用
14 发现两两比较优于量表的独立研究
一台打字机、一本记事本和一支铅笔

从心理物理学到董事会

1927 年形式化的方法 — 此后被一再验证。

瑟斯顿,A Law of Comparative Judgment,芝加哥大学,1927 年。

两两比较的思想史始于一个实际问题:如何衡量没有天然单位的事物?

芝加哥大学心理学家路易斯·利昂·瑟斯顿提出的答案是:直接把事物成对比较。他在 1927 年发表的论文 A Law of Comparative Judgment 将这一洞见形式化为精确的数学模型。

“配对比较法得出的心理值量表,比任何其他量表方法都更可靠。”

Louis Leon Thurstone · Psychological Review · 1927

瑟斯顿的洞见源于一项实证观察:人们回答“这两个哪个更响?”远比回答“在一到十的量表上这个有多响?”要准确得多。

为什么两两比较比量表更有效

打分的认知负担比看上去更大。

当您请人用一到十分给某项战略优先事项的重要性打分时,就是在要求他同时完成多项认知操作。这个过程在每一步都会引入系统性误差。

其中危害最大的是锚定偏差。第一个被打分的项目往往会影响之后所有的评分;特沃斯基和卡尼曼(1974)的研究表明,锚定效应既大且极难纠正。

第二个误差来源是量表压缩。实际中,大多数答题者会避开量表两端,把回答集中在中间 — 这就是为什么一份包含十二项优先事项的调查,常常得出十二件“非常重要”的事。

整个交互就是这样,一遍又一遍,直到每个项目都与其他每个项目比较过。

加薪
或
多休一周假
更低的价格
或
更快的交付
招一名资深员工
或
招两名初级员工

让任何人用十分制打分,两项都得九分。让他二选一,他一秒钟就能回答 — 而且是真心的。

研究说明
两两比较优于评分量表,已在十四项独立研究中被反复证明(Dillon, Frederick & Tangpanichdee, 1985)。

偏好如何变成排名

汇总方法简单、透明,并有数学依据。

若有 n 个项目需要排名,每个项目都与其他每个项目恰好比较一次。所需比较总数为 n(n−1)/2。

汇总个人回答

在个人排名会话中,结果直接来自胜出次数:每个项目每赢一次比较得一分。最终列表按胜出次数从多到少排序。

汇总小组回答

在小组会话中,先汇总每位参与者的比较,再计算最终排名。任一比较中小组的胜出总数,是所有参与者个人投票的总和。

关键在于,汇总结果还揭示了分歧的形态。让小组产生分歧的项目在数据中清晰可见 — 这往往是小组会话最有价值的产出。

关于非传递性
在少数情况下,两两比较可能产生非传递性结果 — A 胜 B,B 胜 C,但 C 胜 A。这被称为孔多塞悖论。

作为诊断工具的小组会话

排好序的列表并不是唯一的产出。分歧的形态同样重要。

传统的群体决策方法有一个共同的根本缺陷:它们受观点表达顺序的影响。第一个发言的人会为整个小组定下锚点。

这并不是个人的失误 — 而是群体动力可预见的结果。研究一再发现,小组讨论得出的集体判断,不如独立的个人判断汇总后准确。这种效应有时被称为隐藏信息问题。

“群体总是无法分享只有部分成员掌握的信息,而且这种失败是系统性的,而非偶然。”

Stasser & Titus · Journal of Personality and Social Psychology · 1985
主持人提示
小组会话最有效的用法,是在讨论开始之前而不是之后揭晓结果。在任何人发言之前让小组看到他们的集体看法,会改变随后讨论的质量。

应用领域

从心理声学到 AI 训练 — 这一方法可以扩展。

战略规划与管理

层次分析法(AHP)已被用于国防、基础设施、医疗和政府领域的高风险战略决策。2008 年的一篇综述在 19 个不同领域中找到了 900 多项已发表的应用。

机器学习与 AI

基于人类反馈的强化学习(RLHF)是训练当今大语言模型的技术,它完全依赖两两比较。人类评估者会看到模型的两个输出,并选出更好的一个。

体育与竞技排名

国际象棋、足球及数十种其他竞技领域使用的 Elo 等级分系统,正是 Bradley–Terry 成对模型的直接应用。

延伸阅读

原始资料与核心文献。

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
准备好尝试这一方法了吗?

两分钟内即可设置个人或小组会话。无需账户即可开始。

创建新排名 →