İkili karşılaştırmalı sıralama hakkında
Daha iyi kararların bilimi.
İkili karşılaştırma yeni bir fikir değildir. Psikoloji, ekonomi ve karar biliminde yaklaşık bir asırlık araştırma boyunca incelenmiş, test edilmiş ve doğrulanmıştır.
Psikofizikten yönetim kurullarına
1927'de biçimselleştirilen — ve o günden beri tekrar tekrar doğrulanan bir yöntem.

İkili karşılaştırmanın düşünsel tarihi pratik bir sorunla başlar: Doğal bir birimi olmayan şeyleri nasıl ölçersiniz?
Chicago Üniversitesi'nden psikolog Louis Leon Thurstone'un önerdiği yanıt, şeyleri doğrudan, ikişer ikişer karşılaştırmaktı. 1927 tarihli makalesi A Law of Comparative Judgment, bu kavrayışı kesin bir matematiksel modele dönüştürdü.
“İkili karşılaştırmalar yöntemi, diğer tüm ölçekleme yöntemlerinden daha güvenilir bir psikolojik değerler ölçeği verir.”
Louis Leon Thurstone · Psychological Review · 1927Thurstone'un kavrayışı deneysel bir gözleme dayanıyordu: İnsanlar “bu ikisinden hangisi daha yüksek sesli?” sorusunu, “bu ne kadar yüksek sesli, birden ona kadar bir ölçekte?” sorusundan çok daha iyi yanıtlar.
İkililer neden ölçeklerden daha iyi çalışır
Puanlamanın bilişsel yükü göründüğünden daha fazladır.
Birinden stratejik bir önceliğin önemini birden ona kadar bir ölçekte puanlamasını istediğinizde, aynı anda birkaç bilişsel işlem yapmasını istersiniz. Bu süreç her adımda sistematik hata üretir.
Bu hataların en zararlısı çapalama yanlılığıdır. İlk puanlanan öğe sonraki tüm puanları etkileme eğilimindedir; Tversky ve Kahneman'ın (1974) araştırması, çapalama etkilerinin hem büyük hem de düzeltmeye şaşırtıcı derecede dirençli olduğunu gösterdi.
İkinci bir hata kaynağı ölçek sıkışmasıdır. Uygulamada yanıtlayanların çoğu ölçeklerin uç noktalarından kaçınır ve yanıtları ortada toplar — on iki önceliği soran bir anketin bu kadar sık on iki “çok önemli” şey döndürmesinin nedeni budur.
Tüm etkileşim budur; her öğe diğer tüm öğelerle karşılaştırılana kadar tekrar tekrar sürer.
Birinden bunları ona kadar puanlamasını isteyin, ikisi de dokuz alır. Seçmesini isteyin, bir saniyede yanıt verir — ve kastettiği de budur.
Tercihler nasıl sıralamaya dönüşür
Toplama yöntemi basit, şeffaf ve matematiksel olarak sağlamdır.
Sıralanacak n öğe verildiğinde, her öğe diğer her öğeyle tam olarak bir kez karşılaştırılır. Gereken toplam karşılaştırma sayısı n(n−1)/2'dir.
Bireysel yanıtları toplama
Bireysel sıralama oturumlarında sonuç doğrudan kazanma sayısından çıkar: Her öğe kazandığı her karşılaştırma için bir puan alır. Nihai sıralı liste, öğeleri en çok kazanandan en az kazanana doğru dizer.
Grup yanıtlarını toplama
Grup oturumlarında, nihai sıralama hesaplanmadan önce her katılımcının karşılaştırmaları toplanır. Herhangi bir karşılaştırmada grubun toplam kazanımı, tüm katılımcıların bireysel oylarının toplamıdır.
En önemlisi, toplanan sonuç anlaşmazlığın biçimini de ortaya koyar. Grubu bölen öğeler verilerde görünür — ve bu çoğu zaman bir grup oturumunun en değerli çıktısıdır.
Bir teşhis aracı olarak grup oturumu
Sıralı liste tek çıktı değildir. Anlaşmazlığın biçimi de aynı derecede önemlidir.
Geleneksel grup karar verme yöntemlerinin ortak ve temel bir kusuru vardır: Görüşlerin dile getirilme sırasına duyarlıdırlar. İlk konuşan kişi grubu çapalar.
Bu bireylerin bir başarısızlığı değildir — grup dinamiklerinin öngörülebilir bir sonucudur. Araştırmalar, grup tartışmalarının bağımsız özel yargıların toplanmasından daha az isabetli ortak yargılar ürettiğini tutarlı biçimde ortaya koymuştur. Bu etki bazen gizli profil sorunu olarak adlandırılır.
“Gruplar, yalnızca bazı üyelerin sahip olduğu bilgiyi paylaşmakta sürekli başarısız olur ve bu başarısızlık rastlantısal değil, sistematiktir.”
Stasser & Titus · Journal of Personality and Social Psychology · 1985Nerede kullanılır
Psikoakustikten yapay zekâ eğitimine — yöntem ölçeklenir.
Stratejik planlama ve yönetim
Analitik Hiyerarşi Süreci savunma, altyapı, sağlık ve kamu yönetiminde yüksek riskli stratejik kararlarda kullanılmıştır. 2008 tarihli bir derleme, 19 farklı alanda 900'ü aşkın yayımlanmış uygulama belirlemiştir.
Makine öğrenmesi ve yapay zekâ
Günümüzün büyük dil modellerini eğitmek için kullanılan insan geri bildirimiyle pekiştirmeli öğrenme (RLHF) tamamen ikili karşılaştırmaya dayanır. İnsan değerlendiricilere iki model çıktısı gösterilir ve daha iyi olanı seçmeleri istenir.
Spor ve rekabetçi sıralama
Satrançta, futbolda ve onlarca başka rekabet alanında kullanılan Elo derecelendirme sistemi, Bradley–Terry ikili karşılaştırma modelinin doğrudan bir uygulamasıdır.
Ek okumalar
Birincil kaynaklar ve temel metinler.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
İki dakikadan kısa sürede bireysel veya grup oturumu kurun. Başlamak için hesap gerekmez.