درباره رتبه‌بندی دوبه‌دو

دانشِ تصمیم‌های بهتر.

مقایسه دوبه‌دو ایده تازه‌ای نیست. نزدیک به یک قرن در پژوهش‌های روان‌شناسی، اقتصاد و علم تصمیم‌گیری مطالعه، آزموده و تأیید شده است.

1927 Thurstone این روش را صورت‌بندی می‌کند
1952 بردلی و تری انتخاب‌های دوبه‌دو را مدل‌سازی می‌کنند
یک ماشین تحریر، یک دفترچه یادداشت و یک مداد

از روان‌فیزیک تا اتاق‌های هیئت‌مدیره

روشی که در 1927 صورت‌بندی شد — و از آن زمان بارها تکرار شده است.

A Law of Comparative Judgment اثر Thurstone، دانشگاه شیکاگو، 1927.

تاریخ فکری مقایسه دوبه‌دو با مسئله‌ای عملی آغاز می‌شود: چیزهایی را که واحد طبیعی ندارند چگونه می‌توان اندازه گرفت؟

پاسخی که روان‌شناس Louis Leon Thurstone در دانشگاه شیکاگو پیشنهاد کرد، مقایسه مستقیم چیزها به‌صورت جفت‌جفت بود. مقاله او در 1927، A Law of Comparative Judgment، این بینش را در قالب یک مدل ریاضی دقیق صورت‌بندی کرد.

بینش Thurstone بر مشاهده‌ای تجربی استوار بود: افراد در پاسخ به «کدام‌یک از این دو بلندتر است؟» به‌مراتب بهتر عمل می‌کنند تا در پاسخ به «این چقدر بلند است، در مقیاس یک تا ده؟»

چرا جفت‌ها بهتر از مقیاس‌ها عمل می‌کنند

بار شناختی امتیازدهی بیش از آن است که به نظر می‌رسد.

وقتی از کسی می‌خواهید اهمیت یک اولویت راهبردی را در مقیاس یک تا ده امتیاز دهد، از او می‌خواهید چند عملیات شناختی را هم‌زمان انجام دهد. این فرایند در هر گام خطای نظام‌مند وارد می‌کند.

زیان‌بارترین این خطاها سوگیری لنگر انداختن است. نخستین موردی که امتیاز می‌گیرد معمولاً بر همه امتیازهای بعدی اثر می‌گذارد؛ پژوهش Tversky و Kahneman (1974) نشان داد که اثرهای لنگر انداختن هم بزرگ‌اند و هم به‌طرز چشمگیری در برابر اصلاح مقاوم.

منبع دوم خطا فشردگی مقیاس است. در عمل، بیشتر پاسخ‌دهندگان از دو سر مقیاس پرهیز می‌کنند و پاسخ‌ها را در میانه متمرکز می‌کنند — به همین دلیل است که نظرسنجی درباره دوازده اولویت اغلب دوازده چیز را برمی‌گرداند که همه «بسیار مهم»اند.

کل تعامل همین است، که بارها و بارها تکرار می‌شود تا هر مورد با تک‌تک موارد دیگر مقایسه شود.

افزایش حقوق
یا
یک هفته مرخصی بیشتر
قیمت پایین‌تر
یا
تحویل سریع‌تر
یک نیروی ارشد
یا
دو نیروی تازه‌کار

از هر کسی بخواهید به این‌ها از ده نمره دهد، هر دو نه می‌گیرند. از او بخواهید انتخاب کند، در یک ثانیه پاسخ می‌دهد — و منظورش همان است.

ترجیح‌ها چگونه به رتبه‌بندی تبدیل می‌شوند

روش تجمیع ساده، شفاف و از نظر ریاضی مستدل است.

با داشتن n مورد برای رتبه‌بندی، هر مورد دقیقاً یک بار با تک‌تک موارد دیگر مقایسه می‌شود. تعداد کل مقایسه‌های لازم n(n−1)/2 است.

تجمیع پاسخ‌های فردی

امتیاز هر مورد نرخ برد آن است: سهم مقایسه‌هایی که برده است، که در آن تساوی یا رد کردن نیم حساب می‌شود. مرتب کردن موارد بر اساس بردها ساده و شفاف است و پژوهش‌ها نشان می‌دهند که در برابر مدل‌های آماری پیچیده‌تر به‌خوبی دوام می‌آورد (Shah & Wainwright, 2018).

تجمیع پاسخ‌های گروهی

در جلسه‌های گروهی، مقایسه‌های هر شرکت‌کننده پیش از محاسبه رتبه‌بندی نهایی تجمیع می‌شوند. مجموع بردهای گروه در هر مقایسه، جمع رأی‌های فردی همه شرکت‌کنندگان است.

نکته مهم اینکه نتیجه تجمیع‌شده شکل اختلاف‌نظر را نیز آشکار می‌کند. مواردی که گروه را دوپاره می‌کنند در داده‌ها دیده می‌شوند — و این اغلب ارزشمندترین خروجی یک جلسه گروهی است.

درباره ناتراگذری
در موارد نادر، مقایسه دوبه‌دو ممکن است نتایج ناتراگذر به بار آورد — یعنی A بر B برتری یابد، B بر C، اما C بر A. این را پارادوکس کندورسه می‌نامند.

جلسه گروهی به‌عنوان ابزار تشخیص

فهرست رتبه‌بندی‌شده تنها خروجی نیست. شکل اختلاف‌نظر هم به همان اندازه مهم است.

روش‌های متعارف تصمیم‌گیری گروهی یک ضعف بنیادین مشترک دارند: به ترتیب بیان نظرها حساس‌اند. نخستین کسی که سخن می‌گوید گروه را لنگر می‌اندازد.

گروه‌ها معمولاً درباره چیزهایی بحث می‌کنند که همه از قبل می‌دانند و از آنچه فقط یک عضو می‌داند کمتر استفاده می‌کنند. این همان مسئله نیم‌رخ پنهان است (Stasser & Titus, 1985). جمع‌آوری انتخاب‌های هر فرد به‌صورت خصوصی، پیش از هر بحثی، همه دیدگاه‌ها را روی میز می‌آورد.

یادداشت برای تسهیلگر
مؤثرترین استفاده از جلسه گروهی این است که نتیجه پیش از آغاز بحث آشکار شود، نه پس از آن. نشان دادن باور جمعی گروه به خودش — پیش از آنکه کسی سخن بگوید — کیفیت گفت‌وگوی پس از آن را دگرگون می‌کند.

کجا به کار می‌رود

از روان‌آکوستیک تا آموزش هوش مصنوعی — این روش مقیاس‌پذیر است.

برنامه‌ریزی راهبردی و مدیریت

فرایند تحلیل سلسله‌مراتبی (AHP) در تصمیم‌های راهبردی سرنوشت‌ساز در حوزه‌های دفاع، زیرساخت، سلامت و دولت به کار رفته است. مروری در 2008 بیش از 900 کاربرد منتشرشده را در 19 حوزه گوناگون شناسایی کرد.

یادگیری ماشین و هوش مصنوعی

یادگیری تقویتی از بازخورد انسانی (RLHF)، فنی که برای آموزش مدل‌های زبانی بزرگ امروزی به کار می‌رود، به‌طور کامل بر مقایسه دوبه‌دو تکیه دارد. دو خروجی مدل به ارزیابان انسانی نشان داده می‌شود و از آن‌ها خواسته می‌شود بهتر را برگزینند.

ورزش و رتبه‌بندی رقابتی

سیستم رتبه‌بندی الو که در شطرنج، فوتبال و ده‌ها حوزه رقابتی دیگر به کار می‌رود، ارتباط نزدیکی با مدل مقایسه دوبه‌دوی بردلی–تری دارد.

مطالعه بیشتر

منابع دست‌اول و متون کلیدی.

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
07
Shah, N. B. & Wainwright, M. J. (2018)
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
آماده‌اید این روش را امتحان کنید؟

یک جلسه فردی یا گروهی را در کمتر از دو دقیقه راه‌اندازی کنید. برای شروع به حساب نیاز نیست.

ساخت رتبه‌بندی تازه →