0한 장 요약
여러 LLM에게 같은 문제를 풀게 하고 중앙값 투표(중위수, median)로 답을 정하는 "LLM 배심원"이 개별 모델보다 정확하다고들 합니다. 그 근거는 서로 다르게 틀리는 투표자를 모으면 오류가 상쇄된다는 콩도르세의 직관입니다. 이 논문은 그 조건이 실제로 성립하는지, 사람이 라벨한 한국어·영어 유사도 문항 2,448쌍에서 같은 7모델로 확인했습니다. 결론은 "대체로 성립하지 않는다"입니다.
1질문: 여럿에게 물으면 더 정확해지는가
LLM으로 텍스트를 채점하는 "LLM-as-a-judge"는 이미 표준 도구가 되었고, 한 모델 대신 여러 모델의 표를 모으는 "LLM 배심원"이 편향과 비용을 줄인다는 보고가 잇따랐습니다(Verga et al. 2024). 배경에는 콩도르세 배심원 정리가 있습니다. 투표자 각각이 우연보다 낫고 서로 독립적으로 틀리면, 다수결은 어느 투표자보다 정확해집니다.
문제는 두 번째 조건입니다. 최근 연구들은 LLM이 이 조건을 자주 어긴다고 보고합니다. 회사가 달라도 같은 문항을 같이 틀리고(Kim et al. 2025), 판정자 9명을 모아도 오류가 겹쳐 실질 2표에 그치며(Kohli 2026), 모델끼리 일치한다고 정답인 것도 아닙니다(Norman et al. 2026). 그렇다면 배심원이 도움이 되는지는 문항에 달린 경험적 질문이 됩니다. 어떤 문항에서 개별 모델들이 따로 틀리고, 어떤 문항에서 함께 틀리는가.
2설계: 같은 7모델, 같은 2,448쌍, 네 가지 조건
실험 재료는 두 문장이 얼마나 비슷한지 1~5점으로 매기는 문장 유사도(STS) 과제입니다. 사람이 이미 라벨한 공개 벤치마크가 있어 정답이 사람 기준으로 주어지기 때문입니다.
핵심은 모든 것이 고정된 개체 내 설계라는 점입니다. 7모델 전원이 2,448쌍 전부를 네 조건 모두에서 채점했습니다. 그래서 배심원 이득이 달라지면 그 원인은 문항과 조건뿐이고, 어떤 모델이나 문항이 표본에 들어왔는지의 우연이 아닙니다.
| 요소 | 내용 | |
|---|---|---|
| 배심원 7모델 | 5개 회사, 공개·비공개 혼합. 다양성이 첫 번째 선택 기준(오류 상관을 낮추는 것이 배심원의 제1원칙). 7명이라 홀수라 중앙값이 하나로 정해짐 | |
| 모델 등급·비용 | gemma-4 8B, exaone-3.5 7.8B, llama-3.1 8B는 연구실 서버(4비트 양자화, API 요금 0). gpt-4o-mini, claude-haiku-4-5, gemini-2.5-flash는 상용 API(1M 토큰당 입력 $0.15~1.00, 출력 $0.60~5.00, 2026-09-11 확인). gpt-oss-120b는 120B MoE 오픈 모델을 Cerebras API($0.25/$0.69, 공식 블로그 값)로 호출 | 동등 등급이 아님. 본실험 전체 API 비용 추정 약 $3.6 |
| 루브릭 | 5단계 채점 기준을 프롬프트에 삽입. 파일럿에서 여러 차례 다듬은 최종 문구(부록 A·B) | |
| 앵커 | "앞선 판정자는 이 쌍을 N점으로 판정했습니다"를 삽입. N은 언제나 사람 정답에서 한 칸 벗어난 값 | |
| 기본 조건 | 따로 말하지 않으면 블라인드·무루브릭 |
3자(尺)와 난이도, 그리고 가설
지표
- 정확일치: 사람 등급과 똑같이 맞힌 비율. 가장 엄격한 자.
- 배심원 이득: 중앙값 투표 정확도 − 개별 모델 평균(7개 모델 각각의 정확도를 산술평균한 값, 즉 무작위로 고른 개별 모델 하나의 기대 정확도). 양수면 중앙값 투표가 평균적인 개별 모델보다 낫다는 뜻.
- 개별 모델별 비교: 중앙값 투표가 앞서는 개별 모델 수(7개 중)와 최고 개별 모델과의 차이. 평균이 아니라 모델 하나하나와 견주는 지표.
- 최고 개별 모델: 그 코퍼스에서 정확일치가 가장 높은 개별 모델.
- ±1 일치, Spearman ρ: 한 등급 차이까지 허용한 일치율과 순위 상관. LLM이 등급을 체계적으로 위로 매기는 것을 감안한 보조 자.
불확실성은 문항 단위 부트스트랩(2,000회, 95% 신뢰구간)으로 재고, 구간이 0을 안 넘을 때 유의하다고 봅니다. 배심원 크기 효과는 1·3·5·7명의 모든 부분집합 평균으로 계산합니다.
난이도
세 코퍼스 모두 사람 정답 등급 1~5로 난이도를 봅니다. 처음에는 양 끝(1·5점)이 쉽고 가운데(3점)가 어렵다고 가정했지만, 논문은 그 순서를 강제하지 않고 등급마다 실측 정확도를 그대로 보고합니다. KLUE-STS는 평가자 5~7명의 개별 점수가 있어 사람 평가자 편차(표준편차)로도 난이도를 정합니다. 이것은 모델과 무관한 신호입니다. STS-B와 KorSTS는 평균 점수만 공개돼 등급으로만 봅니다.
가설과 결과
가설은 세 개이고 결과도 세 묶음입니다. 배심원 중앙값 투표의 효과와 난이도(4~5절), 루브릭을 넣었을 때(6절), 앵커를 보였을 때(7절). 루브릭이 앵커 손상을 누그러뜨리는지는 앵커 가설(H3) 안에서 함께 봅니다.
| 가설 | 사전 예측 | 결과 | 절 |
|---|---|---|---|
| H1 | 어려운 문항일수록 배심원 이득이 커진다 | 기각. 등급 1~3과 KLUE 편차 중·상위 구간에서 이득이 유의하게 음수. 5등급에서만 양수 | 5절 |
| H2 | 루브릭을 주면 정확도가 오른다 | 지지. +8.4 / +4.7 / +3.2, 세 코퍼스 모두 신뢰구간이 0 제외. 중앙값 투표도 비슷하게 상승 | 6절 |
| H3 | 앞선 점수(앵커)를 보여 주면 정확도가 떨어지고 표가 끌린다. 루브릭은 이 손상을 누그러뜨린다 | 지지. −8.6 / −3.8 / −2.8, 표가 앵커값과 같은 비율 42~52% (블라인드 36~40%). 루브릭의 완화는 한국어 +8.7, +3.1 유의, 영어 +0.5 비유의 | 7절 |
| 탐색 | 배심원 크기 1·3·5·7 | 1→7명으로 늘려도 이득 없음. 최고 개별 모델이 모든 코퍼스에서 앞섬 | 4절 |
4결과 1: 배심원은 개별 모델을 못 이긴다
블라인드·무루브릭 조건의 결과입니다. 중앙값 투표는 KorSTS에서 7개 개별 모델 중 4개(gemini-2.5-flash, gemma-4, gpt-oss-120b, llama-3.1)보다 정확하고 3개(exaone-3.5, gpt-4o-mini, claude-haiku-4-5)보다 낮았습니다. STS-B도 같은 4개보다 높고 같은 3개보다 낮습니다. KLUE-STS에서는 2개(gemma-4, gpt-oss-120b)와 같고 5개보다 낮았습니다. 최고 개별 모델과의 차이는 −9.3, −11.9, −6.0점이고, 개별 모델 평균과 견주면 −0.2, −3.4, +1.2점입니다.
| 코퍼스 | n | 개별 모델 평균 | 최고 개별 | 배심원 | 이득 [95% CI] | 배심원 ±1 | ρ | 앞서는 개별 모델 수 (7개 중) |
|---|---|---|---|---|---|---|---|---|
| KorSTS | 1,379 | 30.8 | 39.9 (claude-haiku-4-5) | 30.6 | −0.2 [−1.5, +1.2] | 78.4 | 0.79 | 4 |
| KLUE-STS | 519 | 17.6 | 26.2 (llama-3.1) | 14.3 | −3.4 [−4.7, −2.0] | 51.6 | 0.83 | 0 (동률 2) |
| STS-B | 550 | 35.1 | 42.4 (exaone-3.5) | 36.4 | +1.2 [−0.5, +3.0] | 76.5 | 0.83 | 4 |
개별 모델별 정확일치 (블라인드·무루브릭)
같은 문항을 개별 모델 하나로 채점했을 때의 정확일치입니다. 괄호는 그 코퍼스에서의 순위입니다. 중앙값 투표는 어느 코퍼스에서도 7개 모델 전부를 앞서지 못하고, 코퍼스·조건을 모두 나눈 60칸 어디에서도 전원을 앞서는 경우가 없습니다. 상위 3개(exaone, gpt-4o-mini, haiku)와 하위 2개(gemma, gpt-oss)는 대체로 고정이고, llama-3.1은 KLUE 1위·STS-B 7위로 코퍼스에 따라 크게 움직입니다(코퍼스 간 순위 상관 0.20~0.71). 네 조건 전체의 표와 순위 안정성은 연구 포털 06 결과 절과 표 파일에 있습니다.
| 개별 모델 | KorSTS | KLUE-STS | STS-B |
|---|---|---|---|
| gemini-2.5-flash | 26.9 (4) | 14.6 (5) | 35.6 (4) |
| gemma-4 (8B) | 23.4 (7) | 14.3 (6) | 34.2 (5) |
| exaone-3.5 (7.8B) | 35.8 (3) | 18.3 (3) | 42.4 (1) |
| gpt-4o-mini | 39.1 (2) | 18.5 (2) | 42.0 (2) |
| gpt-oss-120b | 23.9 (6) | 14.3 (7) | 31.8 (6) |
| claude-haiku-4-5 | 39.9 (1) | 17.3 (4) | 37.8 (3) |
| llama-3.1 (8B) | 26.5 (5) | 26.2 (1) | 22.0 (7) |
| 중앙값 투표 | 30.6 | 14.3 | 36.4 |
| 중앙값 투표가 앞서는 개별 모델 수 (7개 중) | 4 | 0 (동률 2) | 4 |
순위 상관은 0.79~0.83으로 높습니다. 배심원은 "어느 쌍이 더 비슷한가"의 순서는 잘 매깁니다. 못 하는 것은 사람 등급을 그대로 맞히는 일이고, 투표자를 더해도 그것은 달라지지 않습니다.
5결과 2: 어려운 문항일수록 배심원이 손해다 (H1 기각)
H1은 어려운 문항에서 배심원 이득이 커진다고 예측했습니다. 정반대였습니다. 등급 1~3에서 배심원은 개별 모델 평균보다 유의하게 나쁘고, 5등급(그리고 KorSTS의 4등급)에서만 확실히 좋습니다. 등급 2·3은 개별 모델들 자신에게도 가장 어려운 등급(정확도 4~21%)이라, 배심원은 도움이 가장 필요한 곳에서 실패합니다. 처음 가정한 "양 끝 쉬움, 가운데 어려움"도 성립하지 않았습니다. 2등급은 3등급만큼 어렵고 1등급도 쉽지 않습니다.
왜 그런가: 개별 모델들이 같은 방향으로 함께 틀린다
세 코퍼스를 합쳐 사람 등급(행)별로 배심원 표(열)가 어디에 몰리는지 보면 답이 보입니다. 사람이 2점 준 문항의 57%가 배심원 4점, 3점 문항의 69%가 4점입니다. 개별 모델들은 무작위로 틀리는 것이 아니라 함께, 위쪽으로 틀리고, 위로 밀린 표 일곱 개의 중앙값은 위로 밀린 표입니다. 4~5등급에서는 위로 밀릴 자리가 없어 오류가 제각각이 되고, 그제야 중앙값 투표가 힘을 씁니다.
세 코퍼스 합산 N = 2,448, 행 백분율. 대각선(정답) 위쪽, 즉 오른쪽으로 무게가 쏠려 있습니다.
사람 편차로 봐도 같다 (KLUE-STS)
KLUE-STS의 평가자 편차는 개별 모델 오류와 상관이 있고(ρ = 0.35) 등급 2·3에서 가장 큽니다(평균 SD 0.92, 0.83 vs 등급 1·4·5의 0.61, 0.66, 0.42). 사람이 가장 많이 갈린 문항이 모델이 가장 많이 틀리는 문항입니다. 편차 3분위로 나누면 개별 모델 정확도가 32.6 → 10.1 → 7.0%로 떨어지고, 배심원 이득은 하위 구간 −1.3(비유의), 중간 −6.7, 상위 −2.9(둘 다 유의)입니다. 모델과 무관한 난이도 정의로도 배심원은 어려운 문항에서 집니다.
| 사람 편차 (평가자 SD) | n | 개별 모델 평균 | 배심원 | 이득 [95% CI] |
|---|---|---|---|---|
| 하위 (0.00–0.50) | 198 | 32.6 | 31.3 | −1.3 [−3.7, +1.2] |
| 중간 (0.53–0.76) | 149 | 10.1 | 3.4 | −6.7 [−8.8, −4.8] |
| 상위 (0.80–1.75) | 172 | 7.0 | 4.1 | −2.9 [−4.9, −0.7] |
6결과 3: 루브릭은 모두를 끌어올린다 (H2 지지)
채점 기준을 주면 개별 모델 정확도가 세 코퍼스 모두에서 오릅니다. KorSTS +8.4, KLUE +4.7, STS-B +3.2 (모두 신뢰구간이 0 제외). 배심원도 비슷하게 오릅니다(+8.7, +3.6, +1.8). 즉 루브릭은 패널 전체를 들어 올리는 것이지 투표의 가치를 바꾸는 것이 아닙니다. 루브릭 조건에서도 배심원 이득은 −0.9, −5.0, +0.3으로 살아나지 않습니다.
등급별로 보면 루브릭은 척도의 양 끝에서 가장 크게 돕습니다. KorSTS 1등급이 20.3 → 40.4%, 5등급이 73.1 → 91.7%로 오릅니다. 반면 KorSTS와 STS-B의 4등급은 떨어집니다(56.7 → 32.5, 58.2 → 44.5). 루브릭이 4등급 쌍의 표를 거의 전부 5점으로 올리기 때문입니다(KorSTS에서 5점 표 39% → 60%, STS-B 42% → 56%). "표현 차이만 있으면 5점"이라는 규칙이 사람이 4점 준 미세한 차이를 표현 차이로 읽는 것입니다. 루브릭의 문구가 중요합니다. 논문에 쓴 것은 여러 차례 다듬은 최종 문구이고, 앞선 문구들은 4점과 5점을 시소처럼 맞바꿨습니다.
7결과 4: 앵커는 표를 끌어당긴다 (H3 지지, 루브릭의 완화는 한국어에서만)
앞선 판정자의 점수를 보여 주면 개별 모델 정확도가 세 코퍼스 모두에서 떨어집니다. KorSTS −8.6, KLUE −3.8, STS-B −2.8. 표는 앵커 쪽으로 움직였습니다. KorSTS에서 앵커를 보여 줬을 때 개별 모델 판정의 52.0%가 앵커값과 같았고, 같은 문항을 블라인드로 채점했을 때는 38.8%였습니다(KLUE 47.3 vs 35.9, STS-B 41.9 vs 39.7).
| 코퍼스 | 루브릭 효과 (개별 모델) | 루브릭 효과 (배심원) | 앵커 효과 (개별 모델) | 앵커 효과 (배심원) | 루브릭 × 앵커 |
|---|---|---|---|---|---|
| KorSTS | +8.4 [+7.4, +9.3]* | +8.7 [+6.9, +10.4]* | −8.6 [−9.3, −7.9]* | −12.6 [−14.2, −11.0]* | +8.7 [+7.6, +9.8]* |
| KLUE-STS | +4.7 [+3.7, +5.7]* | +3.6 [+2.2, +5.2]* | −3.8 [−4.6, −3.1]* | −3.4 [−4.7, −2.0]* | +3.1 [+1.9, +4.4]* |
| STS-B | +3.2 [+2.1, +4.3]* | +1.8 [0.0, +3.7]* | −2.8 [−3.8, −1.8]* | −4.4 [−6.3, −2.5]* | +0.5 [−0.9, +1.8] |
%p, 문항 부트스트랩 95% CI, * = 구간이 0 제외. 루브릭·앵커 효과는 다른 요인을 평균한 문항 쌍 차이. 상호작용 = 루브릭 있을 때의 앵커 효과 − 없을 때의 앵커 효과(개별 모델).
루브릭은 앵커 손상을 누그러뜨렸습니다(H3의 후반, 앵커 방어막). 루브릭 × 앵커 상호작용이 KorSTS +8.7, KLUE +3.1로 유의하지만 STS-B는 +0.5로 유의하지 않아, 이 부분은 한국어 두 코퍼스에서만 지지됩니다.
8누구 탓인가: 판정자가 아니라 문항
정답을 맞히고 못 맞히는 것이 모델의 실력 차인지 문항의 난이도 차인지 가르기 위해 다국면 Rasch 모형을 씁니다. 맞힐 확률을 "판정자 능력 θ − 문항 난이도 β + 루브릭 + 앵커 + 상호작용"으로 놓고 동시에 추정하는 방법입니다.
문항의 퍼짐이 판정자의 퍼짐보다 몇 배 큽니다. 즉 정확도 변동의 대부분은 문항에서 옵니다. 루브릭·앵커 항의 부호는 예상대로이고, 루브릭 × 앵커 항은 한국어에서 양수(+0.75, +0.55), 영어에서 0 근처(+0.05)로 7절과 맞습니다. KLUE에서 β는 사람 평가자 편차와 맞아떨어져, 모델이 느끼는 어려움이 사람도 알아볼 수 있는 어려움임을 보여 줍니다.
어려움의 정체는 두 가지 관찰이 가리킵니다. 첫째, 모델 점수는 위로 밀려 있습니다. 배심원 평균 점수가 사람 평균 등급보다 KorSTS 0.85, KLUE 1.41, STS-B 0.82 높습니다. 둘째, 개별 모델 오류를 가장 잘 예측하는 것은 뜻의 거리가 아니라 겉모양과 뜻의 어긋남입니다. 둘 다 개별 판정자가 약해서가 아니라 판정자들이 공유하는 표현 편향을 가리킵니다.
9논의: 권고와 한계
LLM 배심원은 개별 모델을 이기는가
사람이 라벨한 유사도 채점에서는 아닙니다. 7모델 중앙값은 개별 모델 평균을 유의하게 넘은 적이 없고, 최고 개별 모델에 6~12점 뒤졌으며, 배심원을 늘려도 나아지지 않았습니다. 예측한 기제(어려운 곳에서 투표가 돕는다)는 거꾸로 작동했습니다. 어려운 문항에서 개별 모델들의 오류는 상관돼 있고 위쪽으로 쏠려 있어 중앙값이 그것을 물려받습니다. 콩도르세가 요구하고 LLM이 어기는 조건이 바로 이것입니다.
한계
- 과제가 문장 유사도 1~5점 하나이고, 배심원이 비슷한 세대의 모델들입니다. 정답이 뚜렷한 과제(사실 확인, 코드 채점)나 훨씬 이질적인 패널에서는 오류가 덜 상관돼 배심원이 유용할 수 있으며, 이 자료로는 그 경우를 말할 수 없습니다. 이것은 "서로 다르게 틀리는 자료를 못 모았다"는 한계가 아니라 LLM 오류가 상관돼 있다는 발견입니다.
- 사람 편차는 KLUE-STS에만 있어, KorSTS와 STS-B의 난이도는 등급에만 기댑니다.
- 정확일치는 순서 척도에 엄격한 기준이라 ±1 일치와 순위 상관을 함께 보고합니다.
- 루브릭 결과는 문구에 의존하고(부록 B), 전 등급 개선은 등급 균형 파일럿에서 편향보정 집계를 요구했습니다. 이것은 일반화하지 않고 보고만 합니다.
- 7개 모델은 동등한 등급이 아닙니다. 8B급 로컬 오픈 모델 3개(gemma-4, exaone-3.5, llama-3.1), 상용 소형 API 3개(gpt-4o-mini, claude-haiku-4-5, gemini-2.5-flash), 120B 오픈 모델 1개(gpt-oss-120b, Cerebras API)가 섞여 있고 상용 모델의 크기는 비공개입니다. 다만 크기·단가와 정확도는 비례하지 않았습니다(7.8B 로컬 exaone이 STS-B 1위, 단가가 가장 높은 haiku가 KLUE 4위).
10결론과 논문 지도
논문의 절과 근거 대응
부록 A(프롬프트·채점 루브릭), B(루브릭 개발 이력·집계 규칙), C(Rasch 추정치), D(개별 모델별 정확도). 참고문헌 62편.
11용어 정리
| 용어 | 뜻 |
|---|---|
| LLM 배심원 (jury) | 여러 LLM이 각자 점수를 내고 중앙값 투표로 하나의 표를 만드는 평가 방식. 이 논문에서는 7모델. |
| 중앙값 투표 (median vote, 중위수) | 7개 점수를 크기순으로 늘어놓고 가운데 값을 배심원의 답으로 삼는 규칙. 최빈값을 고르는 다수결과 다르며, 순서 척도에서 동수가 생기지 않는다. |
| 배심원 이득 (jury benefit) | 중앙값 투표 정확도 − 개별 모델 평균(7개 모델 각각의 정확도의 평균). 평균적인 개별 모델보다 나은 정도. 모델 하나하나와의 비교는 '앞서는 개별 모델 수'로 따로 본다. |
| 콩도르세 배심원 정리 | 투표자 각각이 우연보다 낫고 서로 독립적으로 틀리면 다수결이 어느 투표자보다 정확하다는 정리. 독립성 조건이 핵심. |
| 오류 상관 (correlated errors) | 서로 다른 모델이 같은 문항을 같은 방향으로 틀리는 현상. 중앙값 투표 이득을 없애는 원인. |
| 상향 편향 (upward shift) | LLM이 사람보다 1~2등급 높은 유사도를 주는 체계적 경향. 순위는 보존됨. |
| 루브릭 (rubric) | 5단계 채점 기준. 이 논문의 최종 루브릭은 "바꿔 말하기·요약 = 5, 중요한 사실 하나 빠지면 4"로 4·5 경계를 못 박은 문구. |
| 앵커 (anchor) | 채점 전에 보여 주는 앞선 판정자의 점수. 정답에서 한 칸 벗어난 값을 제시해 동조 여부를 검정. |
| 사람 평가자 편차 | KLUE-STS 평가자 5~7명 점수의 표준편차. 모델과 무관한 난이도 신호. |
| 편향보정 중앙값 | 각 모델의 평균 상향치에 0.35를 곱해 빼고 중앙값을 취하는 집계. 루브릭의 전 등급 개선이 성립하는 규칙(부록 B). |
| Rasch 모형 | 맞힐 확률을 판정자 능력과 문항 난이도로 분해하는 문항반응 모형. 이 논문에서는 문항 난이도가 변동의 대부분을 설명. |