เกี่ยวกับการจัดอันดับแบบเปรียบเทียบเป็นคู่
ศาสตร์แห่งการตัดสินใจที่ดีกว่า
การเปรียบเทียบเป็นคู่ไม่ใช่แนวคิดใหม่ ได้รับการศึกษา ทดสอบ และยืนยันมาเกือบศตวรรษในงานวิจัยด้านจิตวิทยา เศรษฐศาสตร์ และวิทยาการการตัดสินใจ
จากจิตฟิสิกส์สู่ห้องประชุมผู้บริหาร
วิธีการที่วางรากฐานในปี 1927 — และได้รับการยืนยันซ้ำแล้วซ้ำเล่านับแต่นั้น

ประวัติทางความคิดของการเปรียบเทียบเป็นคู่เริ่มจากปัญหาเชิงปฏิบัติ: จะวัดสิ่งที่ไม่มีหน่วยวัดตามธรรมชาติได้อย่างไร?
คำตอบที่นักจิตวิทยา Louis Leon Thurstone แห่งมหาวิทยาลัยชิคาโกเสนอ คือการเปรียบเทียบสิ่งต่าง ๆ โดยตรงทีละคู่ บทความ A Law of Comparative Judgment ของเขาในปี 1927 ได้วางแนวคิดนี้เป็นแบบจำลองทางคณิตศาสตร์ที่แม่นยำ
“วิธีการเปรียบเทียบเป็นคู่ให้สเกลค่าทางจิตวิทยาที่น่าเชื่อถือกว่าวิธีการวัดสเกลแบบอื่นใด”
Louis Leon Thurstone · Psychological Review · 1927แนวคิดของ Thurstone ตั้งอยู่บนข้อสังเกตเชิงประจักษ์: ผู้คนตอบคำถาม “สองอย่างนี้อันไหนดังกว่า?” ได้ดีกว่า “อันนี้ดังแค่ไหน ในสเกลหนึ่งถึงสิบ?” อย่างมาก
ทำไมการเปรียบเทียบเป็นคู่จึงได้ผลดีกว่าสเกล
ภาระทางความคิดของการให้คะแนนมากกว่าที่เห็น
เมื่อคุณขอให้ใครสักคนให้คะแนนความสำคัญของลำดับความสำคัญเชิงกลยุทธ์ในสเกลหนึ่งถึงสิบ คุณกำลังขอให้เขาประมวลผลทางความคิดหลายอย่างพร้อมกัน กระบวนการนี้ทำให้เกิดความคลาดเคลื่อนอย่างเป็นระบบในทุกขั้นตอน
ความคลาดเคลื่อนที่ร้ายแรงที่สุดคือ อคติจากการยึดค่าแรก รายการแรกที่ถูกให้คะแนนมักส่งผลต่อคะแนนทั้งหมดที่ตามมา งานวิจัยของ Tversky และ Kahneman (1974) แสดงให้เห็นว่าผลของการยึดค่าแรกนั้นรุนแรงและแก้ไขได้ยากมาก
แหล่งความคลาดเคลื่อนที่สองคือ การบีบอัดของสเกล ในทางปฏิบัติ ผู้ตอบส่วนใหญ่หลีกเลี่ยงปลายสุดของสเกลและให้คำตอบกระจุกตรงกลาง — นี่จึงเป็นเหตุผลที่แบบสำรวจลำดับความสำคัญสิบสองข้อมักได้ผลเป็นสิบสองเรื่องที่ “สำคัญมาก” ทั้งหมด
การโต้ตอบทั้งหมด ทำซ้ำไปเรื่อย ๆ จนทุกรายการได้เปรียบเทียบกับทุกรายการอื่น
ให้ใครก็ได้ให้คะแนนเต็มสิบ ทั้งสองอย่างได้เก้า ให้เขาเลือก เขาตอบได้ในวินาทีเดียว — และตั้งใจจริง
ความชอบกลายเป็นอันดับได้อย่างไร
วิธีรวมผลเรียบง่าย โปร่งใส และมีพื้นฐานทางคณิตศาสตร์
เมื่อมีรายการ n รายการที่ต้องจัดอันดับ แต่ละรายการจะถูกเปรียบเทียบกับรายการอื่นทุกรายการเพียงครั้งเดียว จำนวนการเปรียบเทียบทั้งหมดคือ n(n−1)/2
การรวมคำตอบรายบุคคล
ในเซสชันรายบุคคล ผลลัพธ์มาจากจำนวนครั้งที่ชนะโดยตรง: แต่ละรายการได้หนึ่งคะแนนต่อการเปรียบเทียบที่ชนะ รายการสุดท้ายเรียงจากชนะมากที่สุดไปน้อยที่สุด
การรวมคำตอบของกลุ่ม
ในเซสชันแบบกลุ่ม การเปรียบเทียบของผู้เข้าร่วมแต่ละคนจะถูกรวมก่อนคำนวณอันดับสุดท้าย จำนวนชนะรวมของกลุ่มในการเปรียบเทียบใด ๆ คือผลรวมของคะแนนโหวตรายบุคคลของผู้เข้าร่วมทุกคน
ที่สำคัญคือ ผลรวมยังเผยให้เห็น รูปแบบของความเห็นต่าง รายการที่แบ่งกลุ่มจะเห็นได้ในข้อมูล — และนี่มักเป็นผลลัพธ์ที่มีค่าที่สุดของเซสชันแบบกลุ่ม
เซสชันแบบกลุ่มในฐานะเครื่องมือวินิจฉัย
รายการที่จัดอันดับไม่ใช่ผลลัพธ์เดียว รูปแบบของความเห็นต่างก็สำคัญไม่แพ้กัน
วิธีตัดสินใจแบบกลุ่มทั่วไปมีจุดอ่อนพื้นฐานร่วมกัน: อ่อนไหวต่อลำดับการแสดงความเห็น คนที่พูดก่อนจะกำหนดทิศทางของกลุ่ม
นี่ไม่ใช่ความล้มเหลวของตัวบุคคล — แต่เป็นผลที่คาดได้จากพลวัตของกลุ่ม งานวิจัยพบอย่างสม่ำเสมอว่าการอภิปรายกลุ่มให้การตัดสินรวมที่แม่นยำน้อยกว่าการรวมความเห็นส่วนตัวที่เป็นอิสระต่อกัน ผลนี้บางครั้งเรียกว่า ปัญหาโปรไฟล์ที่ซ่อนอยู่
“กลุ่มมักล้มเหลวในการแบ่งปันข้อมูลที่มีเพียงบางคนรู้ และความล้มเหลวนี้เป็นระบบ ไม่ใช่เรื่องบังเอิญ”
Stasser & Titus · Journal of Personality and Social Psychology · 1985ใช้ที่ไหนบ้าง
ตั้งแต่จิตสวนศาสตร์ไปจนถึงการฝึก AI — วิธีนี้ขยายได้
การวางแผนเชิงกลยุทธ์และการจัดการ
กระบวนการลำดับชั้นเชิงวิเคราะห์ (AHP) ถูกใช้ในการตัดสินใจเชิงกลยุทธ์ที่มีเดิมพันสูงในด้านกลาโหม โครงสร้างพื้นฐาน สาธารณสุข และภาครัฐ บทปริทัศน์ปี 2008 พบการนำไปใช้ที่ตีพิมพ์แล้วกว่า 900 รายการใน 19 สาขา
แมชชีนเลิร์นนิงและ AI
การเรียนรู้แบบเสริมกำลังจากความคิดเห็นของมนุษย์ (RLHF) ซึ่งใช้ฝึกโมเดลภาษาขนาดใหญ่ในปัจจุบัน อาศัยการเปรียบเทียบเป็นคู่ทั้งหมด ผู้ประเมินจะเห็นคำตอบของโมเดลสองแบบแล้วเลือกแบบที่ดีกว่า
กีฬาและการจัดอันดับเชิงแข่งขัน
ระบบคะแนน Elo ที่ใช้ในหมากรุก ฟุตบอล และการแข่งขันอีกหลายสิบประเภท คือการประยุกต์ใช้โมเดลคู่ Bradley–Terry โดยตรง
อ่านเพิ่มเติม
แหล่งข้อมูลปฐมภูมิและตำราสำคัญ
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
ตั้งค่าเซสชันรายบุคคลหรือแบบกลุ่มได้ในไม่ถึงสองนาที ไม่ต้องมีบัญชีก็เริ่มได้