ペア比較ランキングについて
より良い意思決定の科学。
ペア比較は新しい考えではありません。心理学、経済学、意思決定科学のほぼ 1 世紀にわたる研究で、検討され、検証され、裏付けられてきました。
心理物理学から役員会議室へ
1927 年に定式化され、その後何度も再現されてきた手法。

ペア比較の思想史は、ある実践的な問題から始まります。自然な単位をもたないものを、どう測るのか。
シカゴ大学の心理学者ルイス・レオン・サーストンが示した答えは、物事を直接ペアで比べることでした。1927 年の論文『A Law of Comparative Judgment』は、この洞察を精密な数学モデルにまとめました。
「一対比較法は、他のどの尺度構成法よりも信頼性の高い心理的価値の尺度をもたらす。」
Louis Leon Thurstone · Psychological Review · 1927サーストンの洞察は経験的な観察に基づいていました。人は「1 から 10 で言うと、これはどれくらいうるさいか」よりも「この 2 つのうちどちらがうるさいか」のほうが、はるかに正確に答えられるのです。
ペアがスケールより優れている理由
評価する際の認知的負荷は、見かけより大きいものです。
戦略上の優先事項の重要度を 1 から 10 で評価してもらうとき、相手には複数の認知作業を同時に求めています。この過程は、各段階で系統的な誤差を生みます。
中でも最も有害なのがアンカリング・バイアスです。最初に評価した項目は、その後の評価すべてに影響しがちです。トヴェルスキーとカーネマン(1974)の研究は、アンカリング効果が大きく、修正しにくいことを示しました。
もう 1 つの誤差の原因はスケールの圧縮です。実際には、多くの回答者がスケールの両端を避けて中央に回答を集めます。だからこそ、12 項目の優先順位を尋ねたアンケートが、12 項目すべて「とても重要」という結果になりがちなのです。
やり取りはこれだけ。すべての項目が他のすべての項目と比べられるまで繰り返します。
10 点満点で評価してもらうと、どちらも 9 点になります。どちらか選んでもらうと、1 秒で答えが返ってきます — しかも本心で。
好みが順位になるまで
集計方法はシンプルで透明性があり、数学的な裏付けがあります。
順位付けする項目が n 個あるとき、各項目は他のすべての項目とちょうど 1 回ずつ比較されます。必要な比較の総数は n(n−1)/2 です。
個人の回答の集計
個人のランキングセッションでは、結果は勝ち数から直接決まります。各項目は比較に 1 回勝つごとに 1 点を得ます。最終的なリストは勝ち数の多い順に並びます。
グループの回答の集計
グループセッションでは、各参加者の比較を集計してから最終順位を計算します。どの比較でも、グループの勝ち数はすべての参加者の個別投票の合計です。
重要なのは、集計結果から意見の分かれ方も見えることです。グループの意見が割れる項目はデータに現れます — そしてそれこそが、グループセッションで最も価値ある成果であることが少なくありません。
診断ツールとしてのグループセッション
順位付きリストだけが成果ではありません。意見の分かれ方も同じくらい重要です。
従来のグループ意思決定の手法には、共通の根本的な欠陥があります。意見が述べられる順番に左右されるのです。最初に発言した人がグループの基準を作ってしまいます。
これは個人の失敗ではなく、グループダイナミクスから予測できる帰結です。研究では一貫して、グループ討議は独立した個人の判断を集計するよりも不正確な集団判断を生むことが示されています。この効果は隠れたプロフィール問題と呼ばれることもあります。
「グループは一部のメンバーだけが持つ情報を共有することに一貫して失敗し、その失敗は偶然ではなく系統的である。」
Stasser & Titus · Journal of Personality and Social Psychology · 1985使われている場面
心理音響学から AI の学習まで — この手法は応用が利きます。
戦略立案とマネジメント
階層分析法(AHP)は、防衛、インフラ、医療、行政などで重大な戦略的意思決定に使われてきました。2008 年のレビューでは、19 の分野で 900 件を超える応用例が発表されていると報告されています。
機械学習と AI
現在の大規模言語モデルの学習に使われる人間のフィードバックによる強化学習(RLHF)は、完全にペア比較に基づいています。評価者はモデルの 2 つの出力を見て、より良いほうを選びます。
スポーツと競技のランキング
チェスやサッカーなど数多くの競技で使われるイロレーティングは、ブラッドリー–テリーのペア比較モデルを直接応用したものです。
さらに読む
一次資料と主要文献。
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
個人またはグループのセッションを 2 分以内に設定できます。始めるのにアカウントは不要です。