쌍대 비교 순위 소개

더 나은 결정의 과학.

쌍대 비교는 새로운 아이디어가 아닙니다. 심리학, 경제학, 의사결정 과학 분야에서 거의 한 세기에 걸쳐 연구되고, 검증되고, 입증되었습니다.

1927 서스톤이 방법을 공식화
1952 Bradley와 Terry가 쌍대 선택을 모델링
타자기, 메모장, 연필

정신물리학에서 이사회실까지

1927년에 공식화되어 지금까지 재현되어 온 방법.

서스톤, A Law of Comparative Judgment, 시카고 대학교, 1927년.

쌍대 비교의 지적 역사는 하나의 실용적인 문제에서 시작됩니다. 자연적인 단위가 없는 것을 어떻게 측정할 수 있을까요?

시카고 대학교의 심리학자 루이스 리언 서스톤이 제시한 답은 대상을 쌍으로 직접 비교하는 것이었습니다. 그의 1927년 논문 A Law of Comparative Judgment는 이 통찰을 정밀한 수학적 모델로 공식화했습니다.

서스톤의 통찰은 경험적 관찰에 근거한 것이었습니다. 사람들은 “이 소리는 1부터 10까지의 척도에서 얼마나 큰가?”보다 “이 둘 중 어느 쪽이 더 큰가?”라는 질문에 훨씬 더 잘 답합니다.

쌍대 비교가 척도보다 나은 이유

평점을 매기는 일의 인지 부담은 보기보다 큽니다.

누군가에게 전략적 우선순위의 중요도를 1부터 10까지의 척도로 평가해 달라고 하면, 여러 인지 작업을 동시에 수행하도록 요구하는 셈입니다. 이 과정은 단계마다 체계적인 오류를 낳습니다.

이러한 오류 중 가장 치명적인 것은 기준점 편향입니다. 처음 평가한 항목이 이후의 모든 평가에 영향을 미치는 경향이 있으며, 트버스키와 카너먼(1974)의 연구는 기준점 효과가 크고 교정하기가 매우 어렵다는 것을 보여 주었습니다.

두 번째 오류의 원인은 척도 압축입니다. 실제로 대부분의 응답자는 척도의 양 극단을 피하고 중간에 응답을 몰아 둡니다. 그래서 열두 가지 우선순위를 묻는 설문조사가 열두 가지 모두 “매우 중요함”이라는 결과를 내는 경우가 많습니다.

모든 항목이 다른 모든 항목과 비교될 때까지 이 상호작용이 계속 반복됩니다.

급여 인상
또는
일주일 추가 휴가
더 낮은 가격
또는
더 빠른 배송
시니어 한 명 채용
또는
주니어 두 명

누구에게든 이것들을 10점 만점으로 평가하게 하면 둘 다 9점이 나옵니다. 고르게 하면 1초 만에 답하고, 그 답은 진심입니다.

선호가 순위가 되는 방법

집계 방법은 단순하고 투명하며 수학적 근거가 있습니다.

순위를 매길 항목이 n개일 때, 각 항목은 다른 모든 항목과 정확히 한 번씩 비교됩니다. 필요한 비교의 총 횟수는 n(n−1)/2입니다.

개인 응답 집계

각 항목의 점수는 승률, 즉 해당 항목이 이긴 비교의 비율이며, 무승부나 건너뛰기는 절반으로 계산합니다. 승리 수로 항목을 정렬하는 방식은 단순하고 투명하며, 연구에 따르면 더 복잡한 통계 모델과 비교해도 좋은 성능을 보입니다(Shah & Wainwright, 2018).

그룹 응답 집계

그룹 세션에서는 최종 순위를 계산하기 전에 각 참가자의 비교를 집계합니다. 어떤 비교에서든 그룹의 승리 합계는 모든 참가자의 개별 투표를 더한 값입니다.

중요한 것은 집계된 결과가 의견 차이의 형태도 드러낸다는 점입니다. 그룹의 의견을 가르는 항목이 데이터에 나타나며, 이것이 그룹 세션에서 가장 가치 있는 결과인 경우가 많습니다.

비이행성에 대하여
드물게 쌍대 비교는 A가 B를 이기고, B가 C를 이기지만, C가 A를 이기는 비이행적 결과를 낳을 수 있습니다. 이를 콩도르세의 역설이라고 합니다.

진단 도구로서의 그룹 세션

순위 목록만이 결과는 아닙니다. 의견 차이의 형태도 똑같이 중요합니다.

기존의 그룹 의사결정 방법에는 근본적인 결함이 있습니다. 의견이 표현되는 순서에 민감하다는 것입니다. 처음 말하는 사람이 그룹의 기준점이 됩니다.

그룹은 모두가 이미 아는 것을 주로 논의하고, 한 구성원만 아는 것은 충분히 활용하지 못하는 경향이 있습니다. 이것이 숨겨진 프로필 문제입니다(Stasser & Titus, 1985). 토론 전에 각자의 선택을 개별적으로 수집하면 모든 관점이 테이블 위에 오릅니다.

퍼실리테이터 노트
그룹 세션을 가장 효과적으로 활용하는 방법은 토론이 끝난 후가 아니라 시작되기 전에 결과를 공개하는 것입니다. 아무도 말하기 전에 그룹이 집단적으로 무엇을 믿는지 보여 주면 이어지는 대화의 질이 달라집니다.

어디에 쓰이는가

정신음향학에서 AI 학습까지, 이 방법은 규모를 가리지 않습니다.

전략 기획 및 경영

계층화 분석법(AHP)은 국방, 인프라, 의료, 정부 분야의 중대한 전략적 결정에 사용되어 왔습니다. 2008년의 한 검토에서는 19개 분야에 걸쳐 900건 이상의 발표된 응용 사례를 확인했습니다.

머신러닝과 AI

최신 대규모 언어 모델을 학습시키는 데 쓰이는 인간 피드백 기반 강화 학습(RLHF)은 전적으로 쌍대 비교에 의존합니다. 인간 평가자에게 두 모델의 출력을 보여 주고 더 나은 쪽을 고르게 합니다.

스포츠와 경쟁 순위

체스, 축구 및 수십 가지 다른 경쟁 분야에서 사용되는 Elo 레이팅 시스템은 Bradley–Terry 쌍대 비교 모델과 밀접하게 관련되어 있습니다.

더 읽을거리

1차 자료와 주요 문헌.

01
Thurstone, L. L. (1927)
A Law of Comparative Judgment. Psychological Review, 34(4), 273–286.
02
Bradley, R. A. & Terry, M. E. (1952)
Rank analysis of incomplete block designs. Biometrika, 39(3/4), 324–345.
03
Saaty, T. L. (1977)
A Scaling Method for Priorities in Hierarchical Structures. Journal of Mathematical Psychology, 15(3), 234–281.
04
Tversky, A. & Kahneman, D. (1974)
Judgment under Uncertainty: Heuristics and Biases. Science, 185(4157), 1124–1131.
05
Stasser, G. & Titus, W. (1985)
Pooling of Unshared Information in Group Discussion. Journal of Personality and Social Psychology, 48(6), 1467–1478.
06
Christiano, P. et al. (2017)
Deep Reinforcement Learning from Human Preferences. NeurIPS 2017.
07
Shah, N. B. & Wainwright, M. J. (2018)
Simple, Robust and Optimal Ranking from Pairwise Comparisons. Journal of Machine Learning Research.
이 방법을 사용해 볼 준비가 되셨나요?

개인 또는 그룹 세션을 2분 안에 설정하세요. 시작하는 데 계정이 필요 없습니다.

새 순위 만들기 →