เกี่ยวกับการจัดอันดับแบบเปรียบเทียบเป็นคู่

ศาสตร์แห่งการตัดสินใจที่ดีกว่า

การเปรียบเทียบเป็นคู่ไม่ใช่แนวคิดใหม่ ได้รับการศึกษา ทดสอบ และยืนยันมาเกือบศตวรรษในงานวิจัยด้านจิตวิทยา เศรษฐศาสตร์ และวิทยาการการตัดสินใจ

1927 Thurstone วางรากฐานวิธีการ
900+ การนำไปใช้ที่ตีพิมพ์ใน 19 สาขา
14 งานวิจัยอิสระที่พบว่าการเปรียบเทียบเป็นคู่ดีกว่าสเกล
เครื่องพิมพ์ดีด สมุดจด และดินสอ

จากจิตฟิสิกส์สู่ห้องประชุมผู้บริหาร

วิธีการที่วางรากฐานในปี 1927 — และได้รับการยืนยันซ้ำแล้วซ้ำเล่านับแต่นั้น

Thurstone, A Law of Comparative Judgment, มหาวิทยาลัยชิคาโก, 1927

ประวัติทางความคิดของการเปรียบเทียบเป็นคู่เริ่มจากปัญหาเชิงปฏิบัติ: จะวัดสิ่งที่ไม่มีหน่วยวัดตามธรรมชาติได้อย่างไร?

คำตอบที่นักจิตวิทยา Louis Leon Thurstone แห่งมหาวิทยาลัยชิคาโกเสนอ คือการเปรียบเทียบสิ่งต่าง ๆ โดยตรงทีละคู่ บทความ A Law of Comparative Judgment ของเขาในปี 1927 ได้วางแนวคิดนี้เป็นแบบจำลองทางคณิตศาสตร์ที่แม่นยำ

“วิธีการเปรียบเทียบเป็นคู่ให้สเกลค่าทางจิตวิทยาที่น่าเชื่อถือกว่าวิธีการวัดสเกลแบบอื่นใด”

Louis Leon Thurstone · Psychological Review · 1927

แนวคิดของ Thurstone ตั้งอยู่บนข้อสังเกตเชิงประจักษ์: ผู้คนตอบคำถาม “สองอย่างนี้อันไหนดังกว่า?” ได้ดีกว่า “อันนี้ดังแค่ไหน ในสเกลหนึ่งถึงสิบ?” อย่างมาก

ทำไมการเปรียบเทียบเป็นคู่จึงได้ผลดีกว่าสเกล

ภาระทางความคิดของการให้คะแนนมากกว่าที่เห็น

เมื่อคุณขอให้ใครสักคนให้คะแนนความสำคัญของลำดับความสำคัญเชิงกลยุทธ์ในสเกลหนึ่งถึงสิบ คุณกำลังขอให้เขาประมวลผลทางความคิดหลายอย่างพร้อมกัน กระบวนการนี้ทำให้เกิดความคลาดเคลื่อนอย่างเป็นระบบในทุกขั้นตอน

ความคลาดเคลื่อนที่ร้ายแรงที่สุดคือ อคติจากการยึดค่าแรก รายการแรกที่ถูกให้คะแนนมักส่งผลต่อคะแนนทั้งหมดที่ตามมา งานวิจัยของ Tversky และ Kahneman (1974) แสดงให้เห็นว่าผลของการยึดค่าแรกนั้นรุนแรงและแก้ไขได้ยากมาก

แหล่งความคลาดเคลื่อนที่สองคือ การบีบอัดของสเกล ในทางปฏิบัติ ผู้ตอบส่วนใหญ่หลีกเลี่ยงปลายสุดของสเกลและให้คำตอบกระจุกตรงกลาง — นี่จึงเป็นเหตุผลที่แบบสำรวจลำดับความสำคัญสิบสองข้อมักได้ผลเป็นสิบสองเรื่องที่ “สำคัญมาก” ทั้งหมด

การโต้ตอบทั้งหมด ทำซ้ำไปเรื่อย ๆ จนทุกรายการได้เปรียบเทียบกับทุกรายการอื่น

ขึ้นเงินเดือน
หรือ
วันหยุดเพิ่มหนึ่งสัปดาห์
ราคาต่ำลง
หรือ
ส่งของเร็วขึ้น
จ้างระดับอาวุโสหนึ่งคน
หรือ
จ้างระดับต้นสองคน

ให้ใครก็ได้ให้คะแนนเต็มสิบ ทั้งสองอย่างได้เก้า ให้เขาเลือก เขาตอบได้ในวินาทีเดียว — และตั้งใจจริง

บันทึกงานวิจัย
ความเหนือกว่าของการเปรียบเทียบเป็นคู่เมื่อเทียบกับสเกลให้คะแนนได้รับการพิสูจน์ซ้ำในงานวิจัยอิสระสิบสี่ชิ้น (Dillon, Frederick & Tangpanichdee, 1985)

ความชอบกลายเป็นอันดับได้อย่างไร

วิธีรวมผลเรียบง่าย โปร่งใส และมีพื้นฐานทางคณิตศาสตร์

เมื่อมีรายการ n รายการที่ต้องจัดอันดับ แต่ละรายการจะถูกเปรียบเทียบกับรายการอื่นทุกรายการเพียงครั้งเดียว จำนวนการเปรียบเทียบทั้งหมดคือ n(n−1)/2

การรวมคำตอบรายบุคคล

ในเซสชันรายบุคคล ผลลัพธ์มาจากจำนวนครั้งที่ชนะโดยตรง: แต่ละรายการได้หนึ่งคะแนนต่อการเปรียบเทียบที่ชนะ รายการสุดท้ายเรียงจากชนะมากที่สุดไปน้อยที่สุด

การรวมคำตอบของกลุ่ม

ในเซสชันแบบกลุ่ม การเปรียบเทียบของผู้เข้าร่วมแต่ละคนจะถูกรวมก่อนคำนวณอันดับสุดท้าย จำนวนชนะรวมของกลุ่มในการเปรียบเทียบใด ๆ คือผลรวมของคะแนนโหวตรายบุคคลของผู้เข้าร่วมทุกคน

ที่สำคัญคือ ผลรวมยังเผยให้เห็น รูปแบบของความเห็นต่าง รายการที่แบ่งกลุ่มจะเห็นได้ในข้อมูล — และนี่มักเป็นผลลัพธ์ที่มีค่าที่สุดของเซสชันแบบกลุ่ม

ว่าด้วยความไม่ถ่ายทอด
ในบางกรณีที่พบได้ยาก การเปรียบเทียบเป็นคู่อาจให้ผลแบบไม่ถ่ายทอด — A ชนะ B, B ชนะ C แต่ C ชนะ A ซึ่งเรียกว่าปฏิทรรศน์ของ Condorcet

เซสชันแบบกลุ่มในฐานะเครื่องมือวินิจฉัย

รายการที่จัดอันดับไม่ใช่ผลลัพธ์เดียว รูปแบบของความเห็นต่างก็สำคัญไม่แพ้กัน

วิธีตัดสินใจแบบกลุ่มทั่วไปมีจุดอ่อนพื้นฐานร่วมกัน: อ่อนไหวต่อลำดับการแสดงความเห็น คนที่พูดก่อนจะกำหนดทิศทางของกลุ่ม

นี่ไม่ใช่ความล้มเหลวของตัวบุคคล — แต่เป็นผลที่คาดได้จากพลวัตของกลุ่ม งานวิจัยพบอย่างสม่ำเสมอว่าการอภิปรายกลุ่มให้การตัดสินรวมที่แม่นยำน้อยกว่าการรวมความเห็นส่วนตัวที่เป็นอิสระต่อกัน ผลนี้บางครั้งเรียกว่า ปัญหาโปรไฟล์ที่ซ่อนอยู่

“กลุ่มมักล้มเหลวในการแบ่งปันข้อมูลที่มีเพียงบางคนรู้ และความล้มเหลวนี้เป็นระบบ ไม่ใช่เรื่องบังเอิญ”

Stasser & Titus · Journal of Personality and Social Psychology · 1985
บันทึกสำหรับผู้ดำเนินการ
วิธีใช้เซสชันแบบกลุ่มที่ได้ผลที่สุดคือเผยผลลัพธ์ก่อนเริ่มการอภิปราย ไม่ใช่หลังจากนั้น การแสดงให้กลุ่มเห็นว่าพวกเขาคิดอะไรร่วมกัน — ก่อนที่ใครจะพูด — จะเปลี่ยนคุณภาพของการสนทนาที่ตามมา

ใช้ที่ไหนบ้าง

ตั้งแต่จิตสวนศาสตร์ไปจนถึงการฝึก AI — วิธีนี้ขยายได้

การวางแผนเชิงกลยุทธ์และการจัดการ

กระบวนการลำดับชั้นเชิงวิเคราะห์ (AHP) ถูกใช้ในการตัดสินใจเชิงกลยุทธ์ที่มีเดิมพันสูงในด้านกลาโหม โครงสร้างพื้นฐาน สาธารณสุข และภาครัฐ บทปริทัศน์ปี 2008 พบการนำไปใช้ที่ตีพิมพ์แล้วกว่า 900 รายการใน 19 สาขา

แมชชีนเลิร์นนิงและ AI

การเรียนรู้แบบเสริมกำลังจากความคิดเห็นของมนุษย์ (RLHF) ซึ่งใช้ฝึกโมเดลภาษาขนาดใหญ่ในปัจจุบัน อาศัยการเปรียบเทียบเป็นคู่ทั้งหมด ผู้ประเมินจะเห็นคำตอบของโมเดลสองแบบแล้วเลือกแบบที่ดีกว่า

กีฬาและการจัดอันดับเชิงแข่งขัน

ระบบคะแนน Elo ที่ใช้ในหมากรุก ฟุตบอล และการแข่งขันอีกหลายสิบประเภท คือการประยุกต์ใช้โมเดลคู่ Bradley–Terry โดยตรง

อ่านเพิ่มเติม

แหล่งข้อมูลปฐมภูมิและตำราสำคัญ

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
พร้อมลองวิธีนี้หรือยัง?

ตั้งค่าเซสชันรายบุคคลหรือแบบกลุ่มได้ในไม่ถึงสองนาที ไม่ต้องมีบัญชีก็เริ่มได้

สร้างการจัดอันดับใหม่ →