關於兩兩比較排名
更好決策的科學。
兩兩比較並不是新點子。近一個世紀以來,心理學、經濟學與決策科學的研究一再對它進行探討、測試與驗證。
從心理物理學到董事會
一個在 1927 年正式化、之後不斷被重現驗證的方法。

兩兩比較的思想史始於一個實際問題:沒有天然單位的東西,要如何衡量?
芝加哥大學的心理學家 Louis Leon Thurstone 提出的答案是:直接成對比較。他在 1927 年發表的論文 A Law of Comparative Judgment,將這個洞見正式化為精確的數學模型。
Thurstone 的洞見建立在一項經驗觀察上:比起「以一到十分來說,這有多大聲?」,人們回答「這兩個哪一個比較大聲?」要準確得多。
為什麼成對比較勝過量表
評分的認知負擔比表面上看起來更高。
當您請某人以一到十分評估某項策略優先事項的重要性時,等於要求對方同時進行好幾項認知運作。這個過程的每一步都會引入系統性誤差。
其中危害最大的是錨定偏誤。第一個被評分的項目往往會影響之後所有的評分;Tversky 與 Kahneman(1974)的研究證明,錨定效應不僅強烈,而且極難修正。
第二個誤差來源是量表壓縮。實務上,大多數填答者會避開量表的兩端,把答案集中在中間 — 這正是為什麼一份列出十二項優先事項的問卷,結果往往是十二項全都「非常重要」。
整個互動就是這樣,一再重複,直到每個項目都與其他每個項目比較過為止。
請任何人以十分為滿分評分,兩者都會得到九分。請他們二選一,他們一秒就能回答 — 而且是真心的。
偏好如何變成排名
彙整方法簡單、透明,並有數學基礎。
若要為 n 個項目排名,每個項目都要與其他每個項目恰好比較一次。所需的比較總數為 n(n−1)/2。
彙整個人回答
每個項目的分數就是它的勝率:它贏得的比較所占的比例,平手或略過計為一半。依勝場排序項目簡單透明,研究顯示,與更複雜的統計模型相比,這種方法同樣表現良好(Shah & Wainwright, 2018)。
彙整小組回答
在小組場次中,會先彙整每位參與者的比較,再計算最終排名。任一比較的小組勝場總數,就是所有參與者個別票數的總和。
關鍵在於,彙整後的結果也揭露了分歧的樣貌。讓小組意見分歧的項目會在資料中清楚呈現 — 而這往往是小組場次最有價值的產出。
把小組場次當作診斷工具
排名清單不是唯一的產出,分歧的樣貌同樣重要。
傳統的群體決策方法有一個根本缺陷:它們對意見表達的先後順序很敏感。第一個發言的人會為整個小組定錨。
群體往往討論所有人都已知道的事,而很少運用只有一位成員知道的資訊。這就是隱藏資訊問題(Stasser & Titus, 1985)。在任何討論之前私下收集每個人的選擇,能讓每一種觀點都攤在桌面上。
應用領域
從心理聲學到 AI 訓練 — 這個方法都能擴展。
策略規劃與管理
層級分析法(Analytic Hierarchy Process)已被用於國防、基礎建設、醫療與政府等高風險的策略決策。2008 年的一篇回顧研究指出,已發表的應用超過 900 項,橫跨 19 個不同領域。
機器學習與 AI
基於人類回饋的強化學習(RLHF)是訓練現代大型語言模型的技術,完全仰賴兩兩比較。人類評估者會看到兩個模型輸出,並被要求選出較好的一個。
運動與競賽排名
Elo 等級分系統用於西洋棋、足球及其他數十個競技領域,它與 Bradley–Terry 兩兩比較模型密切相關。
延伸閱讀
原始文獻與重要著作。
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
兩分鐘內就能設定個人或小組場次。不需要帳戶即可開始。