Tentang pemeringkatan berpasangan

Ilmu tentang keputusan yang lebih baik.

Perbandingan berpasangan bukanlah gagasan baru. Metode ini telah dipelajari, diuji, dan divalidasi selama hampir satu abad riset di bidang psikologi, ekonomi, dan ilmu keputusan.

1927 Thurstone merumuskan metodenya
1952 Bradley dan Terry memodelkan pilihan berpasangan
Mesin tik, buku catatan, dan pensil

Dari psikofisika ke ruang rapat direksi

Metode yang dirumuskan pada 1927 — dan direplikasi sejak saat itu.

A Law of Comparative Judgment karya Thurstone, University of Chicago, 1927.

Sejarah intelektual perbandingan berpasangan berawal dari masalah praktis: bagaimana mengukur hal-hal yang tidak memiliki satuan alami?

Jawabannya, yang diajukan oleh psikolog Louis Leon Thurstone di University of Chicago, adalah membandingkan hal-hal secara langsung, berpasangan. Makalahnya pada 1927, A Law of Comparative Judgment, merumuskan wawasan ini menjadi model matematika yang presisi.

Wawasan Thurstone berlandaskan pengamatan empiris: orang jauh lebih baik dalam menjawab “mana dari dua ini yang lebih keras?” daripada “seberapa keras ini, pada skala satu sampai sepuluh?”

Mengapa pasangan lebih efektif daripada skala

Beban kognitif dalam memberi nilai lebih tinggi daripada kelihatannya.

Saat Anda meminta seseorang menilai pentingnya sebuah prioritas strategis pada skala satu sampai sepuluh, Anda memintanya melakukan beberapa operasi kognitif sekaligus. Proses ini memunculkan galat sistematis di setiap langkah.

Galat yang paling merusak adalah bias jangkar. Item pertama yang dinilai cenderung memengaruhi semua penilaian berikutnya; riset Tversky dan Kahneman (1974) menunjukkan bahwa efek jangkar itu besar dan sangat sulit dikoreksi.

Sumber galat kedua adalah pemampatan skala. Dalam praktiknya, sebagian besar responden menghindari ujung ekstrem skala dan mengumpulkan jawaban di tengah — itulah sebabnya survei tentang dua belas prioritas sering kali menghasilkan dua belas hal yang semuanya “sangat penting”.

Seluruh interaksinya, diulang terus-menerus sampai setiap item telah dibandingkan dengan setiap item lainnya.

Kenaikan gaji
ATAU
Libur seminggu ekstra
Harga lebih murah
ATAU
Pengiriman lebih cepat
Satu karyawan senior
ATAU
Dua karyawan junior

Minta siapa pun memberi nilai dari sepuluh, dan keduanya mendapat sembilan. Minta mereka memilih, dan mereka menjawab dalam sedetik — dan bersungguh-sungguh.

Bagaimana preferensi menjadi peringkat

Metode agregasinya sederhana, transparan, dan berlandaskan matematika.

Jika ada n item untuk diperingkat, setiap item dibandingkan dengan setiap item lainnya tepat satu kali. Jumlah total perbandingan yang diperlukan adalah n(n−1)/2.

Mengagregasi respons individu

Skor setiap item adalah tingkat kemenangannya: bagian dari perbandingan yang dimenangkannya, dengan seri atau lewati dihitung setengah. Mengurutkan item berdasarkan kemenangan itu sederhana dan transparan, dan penelitian menunjukkan cara ini bertahan baik dibandingkan model statistik yang lebih rumit (Shah & Wainwright, 2018).

Mengagregasi respons kelompok

Untuk sesi kelompok, perbandingan setiap peserta diagregasi sebelum peringkat akhir dihitung. Total kemenangan kelompok untuk setiap perbandingan adalah jumlah suara individu dari semua peserta.

Yang terpenting, hasil agregasi juga memperlihatkan bentuk ketidaksepakatan. Item yang memecah kelompok terlihat dalam data — dan sering kali inilah keluaran paling berharga dari sesi kelompok.

Tentang intransitivitas
Dalam kasus yang jarang, perbandingan berpasangan dapat menghasilkan hasil intransitif — A mengalahkan B, B mengalahkan C, tetapi C mengalahkan A. Ini dikenal sebagai paradoks Condorcet.

Sesi kelompok sebagai alat diagnostik

Daftar peringkat bukan satu-satunya keluaran. Bentuk ketidaksepakatan sama pentingnya.

Metode pengambilan keputusan kelompok konvensional memiliki kelemahan mendasar yang sama: metode tersebut peka terhadap urutan pendapat disampaikan. Orang pertama yang berbicara menjadi jangkar bagi kelompok.

Kelompok cenderung membahas apa yang sudah diketahui semua orang dan kurang memanfaatkan apa yang hanya diketahui satu anggota. Inilah masalah profil tersembunyi (Stasser & Titus, 1985). Mengumpulkan pilihan setiap orang secara pribadi, sebelum diskusi apa pun, membuat setiap pandangan tersampaikan.

Catatan fasilitator
Cara paling efektif menggunakan sesi kelompok adalah menampilkan hasilnya sebelum diskusi dimulai, bukan sesudahnya. Memperlihatkan kepada kelompok apa yang mereka yakini bersama — sebelum ada yang berbicara — mengubah kualitas percakapan yang menyusul.

Di mana metode ini digunakan

Dari psikoakustik hingga pelatihan AI — metode ini dapat diterapkan dalam skala apa pun.

Perencanaan strategis dan manajemen

Analytic Hierarchy Process telah digunakan dalam keputusan strategis berisiko tinggi di bidang pertahanan, infrastruktur, kesehatan, dan pemerintahan. Sebuah tinjauan pada 2008 mengidentifikasi lebih dari 900 penerapan yang dipublikasikan di 19 bidang berbeda.

Pembelajaran mesin dan AI

Pembelajaran penguatan dari umpan balik manusia (RLHF), teknik yang digunakan untuk melatih model bahasa besar modern, sepenuhnya bergantung pada perbandingan berpasangan. Penilai manusia diperlihatkan dua keluaran model dan diminta memilih yang lebih baik.

Olahraga dan pemeringkatan kompetitif

Sistem peringkat Elo, yang digunakan dalam catur, sepak bola, dan puluhan bidang kompetitif lainnya, berkaitan erat dengan model perbandingan berpasangan Bradley–Terry.

Bacaan lanjutan

Sumber primer dan teks utama.

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
07
Shah, N. B. & Wainwright, M. J. (2018)
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
Siap mencoba metodenya?

Siapkan sesi individu atau kelompok dalam waktu kurang dari dua menit. Tidak perlu akun untuk memulai.

Buat Pemeringkatan Baru →