Tentang pemeringkatan berpasangan

Sains keputusan yang lebih baik.

Perbandingan berpasangan bukan idea baharu. Ia telah dikaji, diuji dan disahkan sepanjang hampir satu abad penyelidikan dalam psikologi, ekonomi dan sains keputusan.

1927 Thurstone memformalkan kaedah ini
1952 Bradley dan Terry memodelkan pilihan berpasangan
Sebuah mesin taip, buku nota dan pensel

Daripada psikofizik ke bilik lembaga pengarah

Kaedah yang diformalkan pada tahun 1927 — dan direplikasi sejak itu.

A Law of Comparative Judgment oleh Thurstone, University of Chicago, 1927.

Sejarah intelektual perbandingan berpasangan bermula dengan masalah praktikal: bagaimana anda mengukur sesuatu yang tiada unit semula jadi?

Jawapannya, yang dicadangkan oleh ahli psikologi Louis Leon Thurstone di University of Chicago, ialah membandingkan perkara secara langsung, dalam pasangan. Kertas kerjanya pada tahun 1927, A Law of Comparative Judgment, memformalkan pandangan ini menjadi model matematik yang tepat.

Pandangan Thurstone berasaskan pemerhatian empirikal: orang jauh lebih baik menjawab “yang mana antara dua ini lebih kuat bunyinya?” berbanding “sekuat mana bunyi ini, pada skala satu hingga sepuluh?”

Mengapa pasangan lebih berkesan daripada skala

Beban kognitif penarafan lebih tinggi daripada yang disangka.

Apabila anda meminta seseorang menilai kepentingan sesuatu keutamaan strategik pada skala satu hingga sepuluh, anda meminta mereka melakukan beberapa operasi kognitif serentak. Proses ini memperkenalkan ralat sistematik pada setiap langkah.

Ralat yang paling merosakkan ialah bias penambatan. Item pertama yang dinilai cenderung mempengaruhi semua penilaian berikutnya; penyelidikan oleh Tversky dan Kahneman (1974) menunjukkan bahawa kesan penambatan adalah besar dan sangat sukar diperbetulkan.

Sumber ralat kedua ialah pemampatan skala. Dalam amalan, kebanyakan responden mengelak hujung ekstrem skala, menumpukan jawapan di tengah — itulah sebabnya tinjauan tentang dua belas keutamaan sering menghasilkan dua belas perkara yang semuanya “sangat penting”.

Keseluruhan interaksi, diulang berkali-kali sehingga setiap item telah dibandingkan dengan setiap item yang lain.

Kenaikan gaji
ATAU
Cuti tambahan seminggu
Harga lebih rendah
ATAU
Penghantaran lebih pantas
Seorang pekerja kanan
ATAU
Dua pekerja junior

Minta sesiapa sahaja menilai kedua-duanya daripada sepuluh dan kedua-duanya mendapat sembilan. Minta mereka memilih dan mereka menjawab dalam sesaat — dan benar-benar maksudkannya.

Bagaimana keutamaan menjadi pemeringkatan

Kaedah pengagregatan adalah mudah, telus dan berasaskan matematik.

Diberi n item untuk diperingkatkan, setiap item dibandingkan dengan setiap item lain tepat sekali. Jumlah perbandingan yang diperlukan ialah n(n−1)/2.

Mengagregatkan jawapan individu

Skor setiap item ialah kadar kemenangannya: bahagian perbandingan yang dimenanginya, dengan seri atau langkau dikira sebagai separuh. Menyusun item mengikut kemenangan adalah mudah dan telus, dan kajian menunjukkan kaedah ini bertahan baik berbanding model statistik yang lebih kompleks (Shah & Wainwright, 2018).

Mengagregatkan jawapan kumpulan

Bagi sesi kumpulan, perbandingan setiap peserta diagregatkan sebelum pemeringkatan akhir dikira. Jumlah kemenangan kumpulan bagi sesuatu perbandingan ialah jumlah undian individu bagi semua peserta.

Yang penting, hasil agregat juga mendedahkan bentuk perselisihan pendapat. Item yang memecahbelahkan kumpulan kelihatan dalam data — dan ini selalunya output paling berharga daripada sesi kumpulan.

Tentang ketidaktransitifan
Dalam kes yang jarang berlaku, perbandingan berpasangan boleh menghasilkan keputusan tidak transitif — iaitu A mengalahkan B, B mengalahkan C, tetapi C mengalahkan A. Ini dikenali sebagai paradoks Condorcet.

Sesi kumpulan sebagai alat diagnostik

Senarai berperingkat bukan satu-satunya output. Bentuk perselisihan pendapat sama pentingnya.

Kaedah membuat keputusan berkumpulan konvensional berkongsi satu kelemahan asas: ia sensitif terhadap urutan pendapat dinyatakan. Orang pertama yang bercakap menambat kumpulan.

Kumpulan cenderung membincangkan perkara yang sudah diketahui semua orang dan kurang menggunakan perkara yang hanya diketahui oleh seorang ahli. Inilah masalah profil tersembunyi (Stasser & Titus, 1985). Mengumpul pilihan setiap orang secara peribadi, sebelum sebarang perbincangan, meletakkan setiap pandangan di atas meja.

Nota fasilitator
Penggunaan sesi kumpulan yang paling berkesan ialah mendedahkan hasil sebelum perbincangan bermula, bukan selepasnya. Menunjukkan kepada kumpulan apa yang mereka percaya secara kolektif — sebelum sesiapa bercakap — mengubah kualiti perbualan yang menyusul.

Di mana ia digunakan

Daripada psikoakustik hingga latihan AI — kaedah ini boleh diskalakan.

Perancangan strategik dan pengurusan

Proses Hierarki Analitik (AHP) telah digunakan dalam keputusan strategik berisiko tinggi dalam pertahanan, infrastruktur, penjagaan kesihatan dan kerajaan. Satu kajian semula pada tahun 2008 mengenal pasti lebih 900 aplikasi yang diterbitkan merentas 19 bidang berbeza.

Pembelajaran mesin dan AI

Pembelajaran pengukuhan daripada maklum balas manusia (RLHF), teknik yang digunakan untuk melatih model bahasa besar moden, bergantung sepenuhnya pada perbandingan berpasangan. Penilai manusia ditunjukkan dua output model dan diminta memilih yang lebih baik.

Sukan dan pemeringkatan kompetitif

Sistem penarafan Elo, yang digunakan dalam catur, bola sepak dan berpuluh-puluh bidang persaingan lain, berkait rapat dengan model perbandingan berpasangan Bradley–Terry.

Bacaan lanjut

Sumber primer dan teks utama.

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
07
Shah, N. B. & Wainwright, M. J. (2018)
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
Bersedia untuk mencuba kaedah ini?

Sediakan sesi individu atau kumpulan dalam masa kurang daripada dua minit. Tiada akaun diperlukan untuk bermula.

Cipta Pemeringkatan Baharu →