על דירוג בהשוואה זוגית
המדע של החלטות טובות יותר.
השוואה זוגית אינה רעיון חדש. היא נחקרה, נבדקה ותוקפה במשך כמעט מאה שנות מחקר בפסיכולוגיה, בכלכלה ובמדעי ההחלטה.
מפסיכופיזיקה ועד חדרי ישיבות
שיטה שגובשה ב-1927 — ומאז שוחזרה שוב ושוב.

ההיסטוריה האינטלקטואלית של ההשוואה הזוגית מתחילה בבעיה מעשית: איך מודדים דברים שאין להם יחידת מידה טבעית?
התשובה, שהציע הפסיכולוג לואיס לאון ת׳רסטון מאוניברסיטת שיקגו, הייתה להשוות דברים ישירות, בזוגות. המאמר שלו מ-1927, A Law of Comparative Judgment, גיבש את התובנה הזו למודל מתמטי מדויק.
התובנה של ת׳רסטון נשענה על תצפית אמפירית: אנשים טובים הרבה יותר בתשובה לשאלה ״איזה משני אלה חזק יותר?״ מאשר לשאלה ״כמה חזק זה, בסולם של אחת עד עשר?״
למה זוגות עובדים טוב יותר מסקאלות
העומס הקוגניטיבי של מתן ציון גבוה יותר ממה שנראה.
כשמבקשים ממישהו לדרג את החשיבות של עדיפות אסטרטגית בסולם של אחת עד עשר, מבקשים ממנו לבצע כמה פעולות קוגניטיביות בו-זמנית. התהליך הזה מכניס טעות שיטתית בכל שלב.
המזיקה מבין הטעויות האלה היא הטיית העיגון. הפריט הראשון שמקבל ציון נוטה להשפיע על כל הציונים שאחריו; מחקר של טברסקי וכהנמן (1974) הראה שהשפעות העיגון גדולות ועמידות במיוחד לתיקון.
מקור טעות שני הוא דחיסת הסקאלה. בפועל, רוב המשיבים נמנעים מקצוות הסקאלה ומרכזים את התשובות באמצע — ולכן סקר של שתים-עשרה עדיפויות מחזיר כל כך הרבה פעמים שתים-עשרה דברים ש״חשובים מאוד״ כולם.
כל האינטראקציה, חוזרת שוב ושוב עד שכל פריט הושווה לכל פריט אחר.
אם מבקשים מכל אחד לתת לאלה ציון מתוך עשר, שניהם מקבלים תשע. אם מבקשים לבחור, התשובה מגיעה תוך שנייה — והיא אמיתית.
איך העדפות הופכות לדירוג
שיטת הצבירה פשוטה, שקופה ומבוססת מתמטית.
בהינתן n פריטים לדירוג, כל פריט מושווה לכל פריט אחר פעם אחת בדיוק. המספר הכולל של ההשוואות הנדרשות הוא n(n−1)/2.
צבירת תשובות אישיות
הציון של כל פריט הוא שיעור הניצחונות שלו: החלק מההשוואות שלו שבהן ניצח, כאשר תיקו או דילוג נספרים כחצי. סידור פריטים לפי ניצחונות הוא פשוט ושקוף, ומחקרים מראים שהוא עומד היטב מול מודלים סטטיסטיים מורכבים יותר (Shah & Wainwright, 2018).
צבירת תשובות קבוצתיות
בסשנים קבוצתיים, ההשוואות של כל משתתף נצברות לפני חישוב הדירוג הסופי. סך הניצחונות הקבוצתי בכל השוואה הוא סכום ההצבעות האישיות של כל המשתתפים.
חשוב מכך, התוצאה המצטברת חושפת גם את צורת המחלוקת. פריטים שמפלגים את הקבוצה נראים בנתונים — ולעיתים קרובות זה התוצר החשוב ביותר של סשן קבוצתי.
הסשן הקבוצתי ככלי אבחון
הרשימה המדורגת אינה התוצר היחיד. צורת המחלוקת חשובה באותה מידה.
לשיטות המקובלות של קבלת החלטות בקבוצה יש פגם יסודי משותף: הן רגישות לסדר שבו הדעות מובעות. מי שמדבר ראשון מעגן את הקבוצה.
קבוצות נוטות לדון במה שכולם כבר יודעים ולנצל מעט מדי את מה שרק חבר אחד יודע. זוהי בעיית הפרופיל הנסתר (Stasser & Titus, 1985). איסוף הבחירות של כל אדם באופן פרטי, לפני כל דיון, מעלה כל עמדה על השולחן.
איפה משתמשים בה
מפסיכואקוסטיקה ועד אימון בינה מלאכותית — השיטה מתאימה לכל קנה מידה.
תכנון אסטרטגי וניהול
תהליך ההיררכיה האנליטית (AHP) שימש בהחלטות אסטרטגיות בעלות סיכון גבוה בביטחון, בתשתיות, בבריאות ובממשל. סקירה מ-2008 זיהתה יותר מ-900 יישומים שפורסמו ב-19 תחומים שונים.
למידת מכונה ובינה מלאכותית
למידת חיזוק ממשוב אנושי (RLHF), הטכניקה שבה מאמנים מודלי שפה גדולים מודרניים, נשענת כולה על השוואה זוגית. למעריכים אנושיים מוצגים שני פלטים של המודל, ומבקשים מהם לבחור את הטוב מביניהם.
ספורט ודירוג תחרותי
שיטת הדירוג אלו, המשמשת בשחמט, בכדורגל ובעשרות תחומי תחרות אחרים, קשורה קשר הדוק למודל ההשוואה הזוגית של בראדלי–טרי.
לקריאה נוספת
מקורות ראשוניים וטקסטים מרכזיים.
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
הגדרת סשן אישי או קבוצתי בפחות משתי דקות. לא צריך חשבון כדי להתחיל.