Tentang pemeringkatan berpasangan
Ilmu tentang keputusan yang lebih baik.
Perbandingan berpasangan bukanlah gagasan baru. Metode ini telah dipelajari, diuji, dan divalidasi selama hampir satu abad riset di bidang psikologi, ekonomi, dan ilmu keputusan.
Dari psikofisika ke ruang rapat direksi
Metode yang dirumuskan pada 1927 — dan direplikasi sejak saat itu.

Sejarah intelektual perbandingan berpasangan berawal dari masalah praktis: bagaimana mengukur hal-hal yang tidak memiliki satuan alami?
Jawabannya, yang diajukan oleh psikolog Louis Leon Thurstone di University of Chicago, adalah membandingkan hal-hal secara langsung, berpasangan. Makalahnya pada 1927, A Law of Comparative Judgment, merumuskan wawasan ini menjadi model matematika yang presisi.
Wawasan Thurstone berlandaskan pengamatan empiris: orang jauh lebih baik dalam menjawab “mana dari dua ini yang lebih keras?” daripada “seberapa keras ini, pada skala satu sampai sepuluh?”
Mengapa pasangan lebih efektif daripada skala
Beban kognitif dalam memberi nilai lebih tinggi daripada kelihatannya.
Saat Anda meminta seseorang menilai pentingnya sebuah prioritas strategis pada skala satu sampai sepuluh, Anda memintanya melakukan beberapa operasi kognitif sekaligus. Proses ini memunculkan galat sistematis di setiap langkah.
Galat yang paling merusak adalah bias jangkar. Item pertama yang dinilai cenderung memengaruhi semua penilaian berikutnya; riset Tversky dan Kahneman (1974) menunjukkan bahwa efek jangkar itu besar dan sangat sulit dikoreksi.
Sumber galat kedua adalah pemampatan skala. Dalam praktiknya, sebagian besar responden menghindari ujung ekstrem skala dan mengumpulkan jawaban di tengah — itulah sebabnya survei tentang dua belas prioritas sering kali menghasilkan dua belas hal yang semuanya “sangat penting”.
Seluruh interaksinya, diulang terus-menerus sampai setiap item telah dibandingkan dengan setiap item lainnya.
Minta siapa pun memberi nilai dari sepuluh, dan keduanya mendapat sembilan. Minta mereka memilih, dan mereka menjawab dalam sedetik — dan bersungguh-sungguh.
Bagaimana preferensi menjadi peringkat
Metode agregasinya sederhana, transparan, dan berlandaskan matematika.
Jika ada n item untuk diperingkat, setiap item dibandingkan dengan setiap item lainnya tepat satu kali. Jumlah total perbandingan yang diperlukan adalah n(n−1)/2.
Mengagregasi respons individu
Skor setiap item adalah tingkat kemenangannya: bagian dari perbandingan yang dimenangkannya, dengan seri atau lewati dihitung setengah. Mengurutkan item berdasarkan kemenangan itu sederhana dan transparan, dan penelitian menunjukkan cara ini bertahan baik dibandingkan model statistik yang lebih rumit (Shah & Wainwright, 2018).
Mengagregasi respons kelompok
Untuk sesi kelompok, perbandingan setiap peserta diagregasi sebelum peringkat akhir dihitung. Total kemenangan kelompok untuk setiap perbandingan adalah jumlah suara individu dari semua peserta.
Yang terpenting, hasil agregasi juga memperlihatkan bentuk ketidaksepakatan. Item yang memecah kelompok terlihat dalam data — dan sering kali inilah keluaran paling berharga dari sesi kelompok.
Sesi kelompok sebagai alat diagnostik
Daftar peringkat bukan satu-satunya keluaran. Bentuk ketidaksepakatan sama pentingnya.
Metode pengambilan keputusan kelompok konvensional memiliki kelemahan mendasar yang sama: metode tersebut peka terhadap urutan pendapat disampaikan. Orang pertama yang berbicara menjadi jangkar bagi kelompok.
Kelompok cenderung membahas apa yang sudah diketahui semua orang dan kurang memanfaatkan apa yang hanya diketahui satu anggota. Inilah masalah profil tersembunyi (Stasser & Titus, 1985). Mengumpulkan pilihan setiap orang secara pribadi, sebelum diskusi apa pun, membuat setiap pandangan tersampaikan.
Di mana metode ini digunakan
Dari psikoakustik hingga pelatihan AI — metode ini dapat diterapkan dalam skala apa pun.
Perencanaan strategis dan manajemen
Analytic Hierarchy Process telah digunakan dalam keputusan strategis berisiko tinggi di bidang pertahanan, infrastruktur, kesehatan, dan pemerintahan. Sebuah tinjauan pada 2008 mengidentifikasi lebih dari 900 penerapan yang dipublikasikan di 19 bidang berbeda.
Pembelajaran mesin dan AI
Pembelajaran penguatan dari umpan balik manusia (RLHF), teknik yang digunakan untuk melatih model bahasa besar modern, sepenuhnya bergantung pada perbandingan berpasangan. Penilai manusia diperlihatkan dua keluaran model dan diminta memilih yang lebih baik.
Olahraga dan pemeringkatan kompetitif
Sistem peringkat Elo, yang digunakan dalam catur, sepak bola, dan puluhan bidang kompetitif lainnya, berkaitan erat dengan model perbandingan berpasangan Bradley–Terry.
Bacaan lanjutan
Sumber primer dan teks utama.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
Siapkan sesi individu atau kelompok dalam waktu kurang dari dua menit. Tidak perlu akun untuk memulai.