AI For All Lab · Research Portal · LLM 배심원 · 원고 v10 기준

독립적으로 투표하면, 배심원은 최고의 심판을 넘는다

LLM 13개가 사람이 매긴 문장쌍 2,444개를 네 조건에서 채점하고, 이어서 서로의 근거를 읽고 다시 판정했다. 사람 점수와의 서열상관(스피어만 ρ)으로 재면, 13개 점수의 평균 집계는 세 코퍼스·네 조건 모두에서 가장 좋은 단일 모델을 넘는다. 루브릭은 모두를 올리고, 무작위 앵커와 의견 교환은 독립성을 깨어 배심원을 떨어뜨린다.

가설 1 · 배심원

여러 모델의 평균이 최고 단일 모델보다 사람을 잘 따라가는가

13개 모델 vs 평균 집계, 세 코퍼스 × 네 조건

가설 2 · 루브릭

채점 기준표가 개별 모델과 배심원의 ρ를 함께 올리는가

같은 문항을 루브릭 유무로 두 번 채점

가설 3 · 무작위 앵커

정답과 무관한 앞선 점수가 판정을 끌어당기는가

문항마다 1~5 무작위 값을 "앞선 판정"으로 제시

가설 4 · 의견 교환

서로의 점수와 근거를 읽으면 배심원이 좋아지는가

델파이식 2~3라운드, 익명 공유

00 — 한눈에

숫자로 보는 결론

아래 여섯 칸이 원고 v10의 결과 전부를 요약한다. 값은 블라인드(루브릭 없음·앵커 없음) 조건, 순서는 언제나 KorSTS / KLUE-STS / STS-B.

배심원(13개 평균) ρ vs 최고 단일 모델

0.852 / 0.866 / 0.893

최고 단일 모델 0.815 / 0.843 / 0.875. 14명 중 1위, 12칸 중 12칸. 차이의 95% 구간이 모두 0을 비껴간다.

최고 단일 모델을 넘는 조합의 비율

98% / 92% / 86%

2개 이상 조합 8,178개 중. 루브릭이 있으면 96~99%. 5~9개면 충분하다.

값싼 5모델 조합 (입력 $0.10/1M 이하·로컬)

0.854 / 0.871 / 0.901

exaone-3.5 + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B. 전체 최적과 0.01 이내.

루브릭 효과 (배심원 Δρ)

+0.021 / +0.017 / +0.022

개별 모델 평균 +0.027 / +0.023 / +0.030. 13개 중 11~13개 모델이 오른다.

무작위 앵커 효과 (배심원 Δρ)

−0.052 / −0.032 / −0.015

개별 모델 평균 −0.097 / −0.078 / −0.043. 움직일 수 있는 판정의 45 / 41 / 25%가 앵커 쪽으로 끌린다.

의견 교환 효과 (배심원 Δρ, 1→2라운드)

−0.015 / −0.032 / −0.030

만장일치 문항 4~16% → 21~45%로 수렴하지만 배심원은 내려간다. 루브릭·3라운드로도 회복 없음.

논문 원고 v10

가제 「Independent Votes Beat the Best Judge: Rank Correlation with Human Similarity Ratings for LLM Juries, Rubrics, Random Anchors and Deliberation」제목 확정 전. Information Processing & Management(SCIE/SSCI) 투고용 영문 원고. 본문 6절·표 12·그림 6·부록 A~D·참고문헌 36편. 아래 03~06절은 이 원고의 가설·방법·결과를 같은 번호의 표·그림으로 옮긴 것이다.

01 — 배경

배심원이 이기려면 표가 독립적이어야 한다

데이터 라벨링, 검색 결과 채점, 요약·답안 평가가 빠르게 LLM에게 넘어가고 있다. 한 모델의 편향을 피하려고 여러 모델에게 같은 문항을 묻고 표를 합치는 배심원(jury) 방식이 퍼졌지만, 그것이 언제 최고의 단일 모델을 넘는지는 실증이 드물다.

오래된 논리

심판들이 서로 독립적으로 틀린다면 표를 합칠 때 오류가 상쇄되어 집단이 어느 구성원보다 진실에 가깝다(Galton, 1907; Condorcet 배심원 정리). LLM 심판들이 이 조건을 만족하는지는 경험적 질문이고, 최근 연구는 서로 다른 회사의 모델도 같은 문항을 같이 틀린다고 경고한다(Kim et al., 2025; Kohli, 2026).

두 가지 설계 선택

  • 무엇으로 재는가. 사람 정답은 여러 평가자의 연속 평균(0~5)이고, 배심원의 쓸모는 "어느 쌍이 더 비슷한가"라는 순서다. 사람 점수와의 서열상관은 순서를 그대로 재고, 모델이 전체적으로 높게 주는 습관(척도 치우침)에 영향을 받지 않는다. 반올림한 등급과의 정확일치는 순서를 완벽히 맞추고도 한 칸 후하게 주면 0점이 된다.
  • 심판이 무엇을 보는가. 판정 전에 보이는 숫자(앵커)는 사람의 결정을 끌어당기고(Tversky & Kahneman, 1974), LLM은 아첨과 프롬프트 효과에 취약하다(Sharma et al., 2024; Sclar et al., 2024). 서로의 점수를 본 배심원은 더 이상 독립 투표가 아니다.

지식의 공백

오류 상관이 다수결 이득을 제약한다는 보고는 있으나, 사람이 매긴 정답 위에서 (1) 평균 집계 배심원이 최고 단일 모델을 넘는지, (2) 루브릭이 얼마나 올리는지, (3) 정답과 무관한 앵커가 얼마나 끌어당기는지, (4) 서로의 근거를 읽는 델파이식 교환이 배심원을 돕는지 해치는지를 같은 모델·같은 문항에서 함께 잰 연구는 없다.

02 — 선행연구

판정자 한 명에서 배심원단, 그리고 배심원단의 한계까지

이 분야는 3년 만에 "한 명의 심판"에서 "배심원단"으로, 다시 "배심원단의 한계"로 옮겨 왔다. 원고 2절은 이를 네 갈래(심판·배심원 / 루브릭·앵커 / 사람 점수와의 일치 측정 / 의견 교환)로 정리한다.

연표. 연도별 전환점과 대표 연구.
연도전환점내용
2023판정자 1명의 시대GPT-4 한 모델이 심판을 봤다. 장황성·위치 편향이 드러났다 (Zheng et al.; Liu et al.; Saito et al.)
2024배심원의 등장서로 다른 회사의 작은 모델 여럿이 큰 모델 하나보다 정확하고 쌌다 (Verga et al., PoLL). 자기 선호·프롬프트 형식 민감성 보고 (Panickssery et al.; Sclar et al.)
2025오류 상관, 과의존, 다국어회사가 달라도 LLM들은 같은 문제를 같이 틀린다 (Kim et al.). 사람은 과신하는 LLM 출력을 따른다 (Rathi et al.). 20개 과제 대규모 비교 (Bavaresco et al.), 대체 기준 (Calderon et al.), 다국어 심판의 신뢰 저하 (Fu & Liu)
2026“9명 중 실효 2표”판정자 9명을 모아도 오류가 겹쳐 실질적으로 2표였다 (Kohli)

루브릭과 앵커

구조화된 기준은 사람 평가자 편향의 표준 처방이고(Fasolo et al., 2025) 세분화된 루브릭은 LLM 평가자를 개선한다(Kim et al., 2024). 앵커링은 사람 판단에서 가장 견고한 발견 중 하나이며(Tversky & Kahneman, 1974), LLM에서 가장 가까운 현상은 아첨(Sharma et al., 2024)이다. 루브릭이 LLM 심판의 앵커링을 줄이는지는 사람 정답 위에서 측정된 적이 없다.

사람 점수와의 일치를 무엇으로 재는가

STS 벤치마크는 시스템과 사람 점수의 일치를 상관으로 보고한다. SemEval은 피어슨(Agirre et al., 2012; Cer et al., 2017), 흔히 스피어만도 함께다. 정답이 여러 평가자의 연속 평균이기 때문이다. 카파류 계수(Cohen, 1968; Artstein & Poesio, 2008)와 이산 등급과의 정확일치는 범주 결정에 맞지만 심판의 척도 사용과 변별력을 뒤섞는다. 사람 평가자들 자신도 구조적으로 갈리므로(Wang et al., 2023) 연속 정답을 그대로 쓰는 편이 옳다.

의견 교환, 사회적 영향, 군중의 지혜

델파이 기법은 집단의 이전 답을 통제된 방식으로 돌려주며 판단을 반복해 수렴과 개선을 기대한다(Dalkey & Helmer, 1963; Rowe & Wright, 1999). 그러나 사람 군중 실험은 약한 사회적 영향만으로도 추정치의 다양성이 줄고 군중의 지혜가 무너지며 자신감만 커진다고 보고했다(Lorenz et al., 2011). LLM 다중 에이전트 토론은 사실 추론을 돕는다는 보고(Du et al., 2024)와, 한 답으로 수렴해 사고의 다양성을 잃는다는 보고(Liang et al., 2024)가 함께 있다. 사람 정답을 기준으로 의견 교환이 LLM 배심원을 돕는지 해치는지가 이 연구의 네 번째 질문이다.

03 — 가설

네 가지 가설

2026-09-16 교수님 의논 이후 다시 세운 가설이다. 지표는 사람 연속 점수와의 스피어만 서열상관 ρ, 배심원은 13개 정수 점수의 평균 집계다. 옛 가설(난이도–이득, 정답+1 앵커)은 폐기했고 그 이력은 11 이전 기록에 있다.

가설 1

인간 평가자에 개별 LLM보다 LLM 배심원(jury)이 가장 잘 따라간다.

개별 모델 13개와 배심원 중 배심원의 ρ가 가장 높다. 즉 배심원의 사람 점수와의 서열상관이 모든 개별 모델을 넘는다.

결과: 지지 — 12칸 중 12칸 14명 중 1위 (표 3·부록 표 B.2)

가설 2

루브릭을 쓰면 스피어만 순위상관계수가 올라간다.

채점 루브릭을 제공하면 개별 모델과 배심원의 ρ가 함께 오른다.

결과: 지지 — 개별 평균 +0.023~+0.030, 배심원 +0.017~+0.022 (표 7)

가설 3

정답과 무관한 앵커를 보이면 판정이 끌리고 ρ가 내려간다.

사람 점수와 독립인 무작위 점수를 “앞선 판정”으로 보이면 개별 모델과 배심원의 ρ가 내려가고, 판정이 그 점수 쪽으로 움직인다.

결과: 지지 — 개별 평균 −0.043~−0.097, 배심원 −0.015~−0.052, 끌림 25~45% (표 7·8)

가설 4

점수와 근거를 서로 교환하면 의견은 수렴하지만 배심원의 ρ는 오르지 않고 내려갈 수 있다.

교수님이 제안한 “상호정보 교환 앵커”. 델파이식 라운드에서 각 모델이 다른 12개의 익명 점수·근거를 읽고 다시 판정한다.

결과: 지지 — 만장일치 4~16% → 21~45%, 배심원 ρ는 6칸 모두 하락, 3라운드에도 회복 없음 (표 9·10)

네 가설이 함께 말하는 것

배심원의 이득은 독립적인 표를 평균할 때 생긴다. 루브릭은 각 심판을 좋게 만들어 이득을 키우고, 앵커와 의견 교환은 표를 서로 닮게 만들어 이득을 깎는다. 실무 지침: 값싼 모델 5~9개를 블라인드로, 병렬로 부르고 평균하라. 서로의 답을 보여 주지 말라.

04 — 방법

같은 모델에게 같은 문항을, 상황만 바꿔서

사람 실험처럼 설계하되 참가자는 전원 LLM이다. 같은 13개 모델이 같은 2,444쌍을 네 조건에서 채점하고, 이어서 델파이식 라운드로 다시 판정한다. 같은 모델이 자기 자신의 통제집단이므로 판정의 변화가 곧 조작의 효과다(개체 내 설계).

실험 요인. 채점 조건은 2×2 교차, 의견 교환은 그 위에 추가 라운드.
요인수준연결 가설
채점 루브릭없음 / 5단계 기준 제공가설 2
무작위 앵커없음 / “앞선 판정자는 N점” (N ~ 균등{1..5}, 문항 번호를 씨앗으로)가설 3
의견 교환 (델파이)기준(점수만) → 1라운드(근거+점수) → 2라운드(다른 12개의 익명 점수·근거를 읽고 재판정) → 3라운드(KLUE-STS만)가설 4
배심원 크기·조합2^13 − 1 = 8,191개 부분집합 전수, 홀수 크기 5·7·9·11 합의 조합, 코퍼스 교차 검증가설 1 (탐색)
난이도 층사람 점수 구간 3개(0~1.67 / 1.67~3.33 / 3.33~5), KLUE-STS 평가자 불일치 3분위탐색적

실제 판정 프롬프트

다음 두 문장의 주제 유사도를 1(무관)~5(동일)로 판정하세요.
문장1: 오늘 오후부터 전국에 비가 내리겠습니다.
문장2: 오늘 오후 들어 전국적으로 비가 오겠습니다.
숫자 하나만 답하세요.

영어 문항(STS-B)은 같은 뜻의 영어 프롬프트를 받는다. 루브릭 조건은 첫 줄 뒤에 5단계 채점 기준(5점 같은 사건·주장 / 4점 같은 주제의 매우 유사한 내용 / 3점 같은 분야의 관련 주제 / 2점 부분적으로만 겹침 / 1점 무관)을 덧붙이고, 앵커 조건은 문장 앞에 참고: 앞선 판정자는 이 쌍을 N점으로 판정했습니다.를 덧붙인다. N은 문항 번호를 씨앗으로 한 의사난수로 1~5에서 균등하게 뽑으므로 사람 점수와 무관하고, 13개 모델에 같은 값이 가며, 재현된다. 전 모델 온도 0, 추론(thinking) 모드 비활성, 버전 고정, 시스템 프롬프트 없음. 채점 조건 판정 수는 13 × 2,444 × 4 = 127,088.

델파이식 의견 교환

1라운드에서 각 모델은 한두 문장의 근거와 점수를 낸다. 2라운드에서는 같은 쌍과 함께 자기 1라운드 답, 그리고 다른 12개 모델의 1라운드 점수·근거를 ‘평가자 1~12’로 익명화해 문항별 고정 난수 순서로 받고 최종 점수를 정한다(유지 또는 변경). 루브릭 없이·있이 두 번 돌렸고, KLUE-STS는 루브릭 없이 3라운드까지 갔다. 판정 133,835건 추가, 총 260,923건.

배심원 13개 모델

개발사 9곳. 8B급 오픈 모델 3개는 연구실 서버(Ollama, RTX 3090)에서 비용 0으로, 상용 소형 5개는 각사 API로, 대형 오픈 5개는 추론 호스트(DeepInfra·Together·Cerebras)로 돌렸다. 9월 17일에 교수님이 주신 키로 6개(solar-pro4 · GLM-5.3-Flash · Kimi-K2.6 · gemma-3-27b · DeepSeek-V4-Flash · Qwen3.5-9B)를 더해 7개에서 13개가 되었다.

표 2. 13개 모델 풀. 단가는 2026-09-18 제공사 공식 가격표(GLM·Kimi·gemma-3·DeepSeek·Qwen은 DeepInfra, solar-pro4는 Upstage, 나머지는 각사; 미국 달러 / 100만 토큰, 입력 / 출력). GLM-5.3-Flash는 당시 50% 할인가. n/d = 비공개. 로컬 실행은 토큰 단가 없음.
모델개발사가중치크기실행 위치단가 입력 / 출력
gemini-2.5-flashGoogle비공개n/dGoogle Gemini API0.30 / 2.50
gemma-4 (8B)Google오픈8B, 4비트연구실 서버 (Ollama)0 / 0
exaone-3.5 (7.8B)LG AI Research오픈7.8B, 4비트연구실 서버 (Ollama)0 / 0
gpt-4o-miniOpenAI비공개n/dOpenAI API0.15 / 0.60
gpt-oss-120bOpenAI오픈120B MoECerebras API0.25 / 0.69
claude-haiku-4.5Anthropic비공개n/dAnthropic API1.00 / 5.00
llama-3.1 (8B)Meta오픈8B, 4비트연구실 서버 (Ollama)0 / 0
solar-pro4Upstage비공개n/dUpstage API0.30 / 1.20
GLM-5.3-FlashZ.ai (Zhipu)오픈n/d (Flash급)DeepInfra0.15 / 0.50
Kimi-K2.6Moonshot AI오픈MoE, n/dDeepInfra; OpenRouter0.75 / 3.50
gemma-3-27bGoogle오픈27BDeepInfra0.08 / 0.16
DeepSeek-V4-FlashDeepSeek오픈MoE, n/dDeepInfra0.09 / 0.18
Qwen3.5-9BAlibaba오픈9BTogether AI0.10 / 0.15

지표·집계·추론

  • 지표. 코퍼스 문항 전체에서 심판 점수와 사람 연속 점수의 스피어만 서열상관 ρ. 피어슨 r을 나란히 보고한다.
  • 배심원. 문항별 구성원 정수 점수의 산술 평균(평균 집계). 사람 정답이 만들어진 방식과 같고, 정수 중앙값이 버리는 순서 정보를 보존한다. 중앙값 투표는 비교용으로 함께 보고.
  • 비교. 같은 코퍼스·조건의 최고 단일 모델, 13개 개별 ρ의 평균, 14명(13 + 배심원) 중 순위. 차이는 문항 단위 쌍 부트스트랩 1,000회의 백분위 95% 구간. p값 대신 구간을 보고.
  • 조합 탐색. 8,191개 부분집합을 모든 코퍼스·조건에서 평균 집계로 평가. 같은 코퍼스에서 고르고 평가하면 낙관적이므로 (a) 최고 단일 모델을 넘는 조합 수, (b) 한 코퍼스에서 고른 뒤 다른 두 코퍼스에서 평가(leave-one-corpus-out), (c) 세 코퍼스 평균 ρ가 최대인 합의 조합(홀수 5·7·9·11, 평균·중앙값 모두)을 보고. 저가 조합 = 입력 $0.10/1M 이하 또는 로컬 모델만.
  • 조건 효과. 루브릭 효과 = 루브릭 − 무루브릭(앵커 없음), 앵커 효과 = 앵커 − 무앵커(같은 루브릭 설정). 앵커 끌림 = 무앵커 점수가 앵커와 달랐던 판정 중 앵커 쪽으로 움직인 비율.
  • 의견 교환. 라운드별 같은 상관 + 수렴 지표(문항 내 13개 점수의 표준편차, 만장일치 문항 비율, 변경 판정 비율, 다른 모델 평균 쪽으로 움직인 비율, 사람 점수에 가까워진/멀어진 비율).

심판 구성과 설계 변경 이력

2026-09-09 설계는 7모델 · 정확일치 · 중앙값 투표 · 정답+1 앵커였다. 9월 16일 교수님 의논에서 지표를 서열상관으로, 집계를 평균으로 바꾸고 정답+1 앵커(정답을 누설하는 인공물)를 무작위 앵커로 대체했다. 9월 17일 6모델을 더해 13모델, 9월 18일 의견 교환 라운드를 더했다. 초기 후보였던 Qwen 3.6·GLM 4.7은 수집 안정성·서비스 종료로 제외됐다. 상세는 의논 페이지.

05 — 분석 대상

사람이 매긴 세 자료를 각각 분석한다

같은 설계를 서로 독립된 세 자료에 적용한다. 하나가 다른 하나를 검증하는 관계가 아니라, 같은 질문을 세 번 묻고 답이 자료와 언어를 넘어 재현되는지를 본다.

세 자료 모두 사람이 매긴 공개 벤치마크이고, 정답은 여러 평가자의 연속 평균(0~5)을 그대로 쓴다. 반올림 등급 1~5는 STS-B 표본을 등급별로 고르고 자료를 기술할 때만 썼다.

표 1. 분석 대상. 판정 수 = 채점 4조건 + 의견 교환 라운드(KorSTS·STS-B 4회, KLUE-STS 5회) × 13모델.
자료언어문항사람 점수평가자 수도메인판정 수
KorSTS한국어1,379쌍 (test 전체)평균, 0~55캡션·뉴스·포럼 (STS-B 번역)71,708 + 71,708
KLUE-STS한국어519쌍 (dev)평균, 0~5 (평가자별 점수 공개)7에어비앤비 후기·정책 뉴스·스마트 스피커 발화26,988 + 33,735
STS-B영어546쌍 (dev에서 등급별 층화 550, 손상 4쌍 제외)평균, 0~55캡션·뉴스·포럼28,392 + 28,392

자료에서 확인한 두 가지 (교수님 질문 5·6에 대한 답)

반올림 규칙 불일치. 문항 파일을 만들 때 KorSTS·STS-B는 파이썬 round()(짝수 반올림), KLUE-STS는 int(x+0.5)(반올림)로 등급을 매겨 .5 경계 21쌍의 등급이 갈렸다. 새 분석은 연속 점수를 그대로 쓰므로 결과에 영향이 없고, 원고 부록 D에 투명하게 적었다.

STS-B 손상 4문항. 원본 파일을 읽을 때 뒤따르는 줄이 문장 2에 붙거나 문장 2가 비는 손상이 생긴 stsb-0049 · 0279 · 0322 · 0361을 모든 분석에서 제외했다(550 → 546). 부록 표 D.1.

KLUE-STS가 갖는 별도의 쓸모

평가자 7명의 개별 점수가 공개되어 있어 사람들이 한 문항에서 얼마나 갈렸는지를 직접 셀 수 있다. 이 자료에서만 난이도를 사람의 불일치로도 정의한다(표 11 아래 세 줄). 배심원 자신의 불일치로 난이도를 정하면 같은 표로 기준도 정하고 성적도 매기는 순환이 되므로 쓰지 않는다.

06 — 결과

사람 점수와의 서열상관으로 본 네 가설

원고 4절의 표 3~12와 그림 1~6을 같은 번호로 옮겼다. 값은 사람 연속 점수와의 스피어만 ρ, 배심원 = 13개 점수의 평균 집계, 구간은 문항 단위 쌍 부트스트랩 1,000회 95%. 부록 표 B.1·B.2(모델별 ρ·r, 앵커 조건), C.1(라운드별 모델), D.1(제외 문항)은 이 절 끝에 있다.

4.1 배심원 vs 개별 모델 (가설 1)

앵커 없는 6칸 모두에서 배심원의 ρ가 모든 개별 모델을 넘고 14명 중 1위다. 앵커 조건 2개를 더한 12칸에서도 같다(부록 표 B.2). 배심원 − 최고 단일 모델의 쌍 차이는 모든 칸에서 양수이고 구간이 0을 비껴간다. 피어슨 r도 같은 순서를 준다.

표 3. 사람 연속 점수와의 스피어만 상관, 앵커 없는 조건. n = 1,379 / 519 / 546. 구간은 문항 단위 쌍 부트스트랩 1,000회 95%.
코퍼스조건13개 개별 ρ 평균최고 단일 모델 ρ배심원 ρ (13개 평균) [95% CI]배심원 − 최고 단일 [95% CI]14명 중 순위배심원 피어슨 r중앙값 집계 ρ
KorSTS루브릭 없음0.7600.815 (gpt-4o-mini)0.852 [0.835, 0.868]+0.038 [+0.027, +0.049]10.8520.822
KorSTS루브릭0.7860.831 (GLM-5.3-Flash)0.873 [0.857, 0.886]+0.042 [+0.029, +0.055]10.8730.846
KLUE-STS루브릭 없음0.7840.843 (gpt-oss-120b)0.866 [0.841, 0.888]+0.023 [+0.002, +0.045]10.8380.855
KLUE-STS루브릭0.8080.857 (gemma-3-27b)0.883 [0.862, 0.902]+0.026 [+0.007, +0.046]10.8670.867
STS-B루브릭 없음0.8060.875 (solar-pro4)0.893 [0.870, 0.911]+0.019 [+0.006, +0.031]10.8840.861
STS-B루브릭0.8360.878 (solar-pro4)0.915 [0.897, 0.930]+0.037 [+0.024, +0.049]10.9030.866
그림 1
그림 1. 13개 개별 모델(회색, 무루브릭 값 순)과 배심원(13개 평균; 파랑 무루브릭, 초록 루브릭)의 스피어만 ρ, 세 코퍼스. 점선은 무루브릭 최고 단일 모델.

집계 규칙. 평균이 중앙값을 모든 칸에서 이긴다(표 4, ρ +0.012~+0.049). 정수 13개의 중앙값은 정수라 많은 문항이 동점이 되지만, 평균은 1/13 단위로 갈라 사람 점수의 미세한 순서를 따라간다. STS-B에서는 중앙값 배심원이 최고 단일 모델을 간신히 넘지 못하는데(0.861 vs 0.875) 평균 배심원은 +0.019로 넘는다.

표 4. 같은 13개 점수의 평균 집계와 중앙값 집계.
코퍼스조건중앙값 ρ평균 ρ평균 − 중앙값
KorSTS루브릭 없음0.8220.852+0.030
KorSTS루브릭0.8460.873+0.027
KLUE-STS루브릭 없음0.8550.866+0.012
KLUE-STS루브릭0.8670.883+0.017
STS-B루브릭 없음0.8610.893+0.032
STS-B루브릭0.8660.915+0.049

4.2 배심원 크기와 조합

2개 이상 조합 8,178개 중 8,018개(98%), 7,504개(92%), 7,048개(86%)가 무루브릭에서 최고 단일 모델을 넘고, 루브릭에서는 96~99%다(표 5). 최고 ρ는 1개에서 5개까지 가파르게 오르고 5~9개에서 평평하며, 그 뒤 가장 약한 모델을 더하면 조금 내려간다(그림 2). 크기 7의 합의 조합 exaone-3.5 + gpt-4o-mini + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B는 무루브릭 0.860 / 0.879 / 0.902, 루브릭 0.875 / 0.886 / 0.916. 중앙값 집계의 합의 조합은 0.02~0.04 낮고 STS-B에서는 최고 단일 모델을 거의 넘지 못한다.

표 5. 세 코퍼스에 한 번 고른 홀수 크기 합의 조합. 최고 단일 모델: KorSTS gpt-4o-mini 0.815(무루브릭)·GLM-5.3-Flash 0.831(루브릭); KLUE-STS gpt-oss-120b 0.843·gemma-3-27b 0.857; STS-B solar-pro4 0.875·0.878.
조건집계크기합의 조합 (세 코퍼스 평균 ρ 최대)ρ KorSTS / KLUE-STS / STS-B최고 단일 모델을 넘는가
루브릭 없음평균5exaone-3.5, gpt-4o-mini, gpt-oss-120b, solar-pro4, Qwen3.5-9B0.854 / 0.876 / 0.902예 / 예 / 예
루브릭 없음평균7exaone-3.5, gpt-4o-mini, gpt-oss-120b, solar-pro4, GLM-5.3-Flash, DeepSeek-V4-Flash, Qwen3.5-9B0.860 / 0.879 / 0.902예 / 예 / 예
루브릭 없음평균9exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, solar-pro4, GLM-5.3-Flash, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B0.860 / 0.881 / 0.898예 / 예 / 예
루브릭 없음평균11gemini-2.5-flash, exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B0.858 / 0.880 / 0.898예 / 예 / 예
루브릭 없음중앙값5exaone-3.5, gpt-4o-mini, solar-pro4, gemma-3-27b, Qwen3.5-9B0.828 / 0.860 / 0.880예 / 예 / 예
루브릭 없음중앙값7exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, solar-pro4, gemma-3-27b, Qwen3.5-9B0.828 / 0.865 / 0.871예 / 예 / 아니오
루브릭 없음중앙값9gemini-2.5-flash, exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, llama-3.1, solar-pro4, gemma-3-27b, Qwen3.5-9B0.824 / 0.860 / 0.869예 / 예 / 아니오
루브릭 없음중앙값11exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, llama-3.1, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B0.827 / 0.859 / 0.864예 / 예 / 아니오
루브릭평균5exaone-3.5, solar-pro4, GLM-5.3-Flash, DeepSeek-V4-Flash, Qwen3.5-9B0.872 / 0.885 / 0.916예 / 예 / 예
루브릭평균7exaone-3.5, gpt-oss-120b, solar-pro4, GLM-5.3-Flash, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B0.876 / 0.888 / 0.914예 / 예 / 예
루브릭평균9exaone-3.5, gpt-4o-mini, gpt-oss-120b, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B0.877 / 0.891 / 0.914예 / 예 / 예
루브릭평균11gemini-2.5-flash, gemma-4, exaone-3.5, gpt-4o-mini, gpt-oss-120b, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B0.875 / 0.890 / 0.915예 / 예 / 예
루브릭중앙값5gpt-4o-mini, claude-haiku-4.5, GLM-5.3-Flash, gemma-3-27b, Qwen3.5-9B0.850 / 0.872 / 0.873예 / 예 / 아니오
루브릭중앙값7exaone-3.5, gpt-4o-mini, llama-3.1, solar-pro4, GLM-5.3-Flash, DeepSeek-V4-Flash, Qwen3.5-9B0.849 / 0.868 / 0.878예 / 예 / 아니오
루브릭중앙값9exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B0.850 / 0.874 / 0.867예 / 예 / 아니오
루브릭중앙값11gemini-2.5-flash, gemma-4, exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B0.848 / 0.866 / 0.872예 / 예 / 아니오
그림 2
그림 2. 무루브릭에서 배심원 크기별로 도달 가능한 최고 스피어만 ρ. 13개 전체(파랑)와 저가 모델만(초록), 최고 단일 모델(점선)과 13개 전체 평균(점점선).
표 6. 코퍼스 교차 검증(leave-one-corpus-out). 한 코퍼스에서 고른 조합이 나머지 두 코퍼스의 최고 단일 모델을 모든 경우 넘는다.
조건고른 코퍼스그 코퍼스의 최적 조합고른 코퍼스 ρ나머지 두 코퍼스 ρ vs 그곳의 최고 단일 모델
루브릭 없음KorSTSexaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, DeepSeek-V4-Flash, Qwen3.5-9B0.860KLUE-STS 0.880 vs 0.843 (넘음); STS-B 0.899 vs 0.875 (넘음)
루브릭 없음KLUE-STSexaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, GLM-5.3-Flash, gemma-3-27b, Qwen3.5-9B0.884KorSTS 0.859 vs 0.815 (넘음); STS-B 0.891 vs 0.875 (넘음)
루브릭 없음STS-Bexaone-3.5, gpt-oss-120b, solar-pro4, DeepSeek-V4-Flash, Qwen3.5-9B0.904KorSTS 0.852 vs 0.815 (넘음); KLUE-STS 0.874 vs 0.843 (넘음)
루브릭KorSTSexaone-3.5, gpt-4o-mini, gpt-oss-120b, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B0.877KLUE-STS 0.891 vs 0.857 (넘음); STS-B 0.914 vs 0.878 (넘음)
루브릭KLUE-STSgemini-2.5-flash, exaone-3.5, gpt-4o-mini, gpt-oss-120b, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B0.893KorSTS 0.874 vs 0.831 (넘음); STS-B 0.910 vs 0.878 (넘음)
루브릭STS-Bgemini-2.5-flash, gemma-4, exaone-3.5, gpt-4o-mini, gpt-oss-120b, llama-3.1, solar-pro4, GLM-5.3-Flash, DeepSeek-V4-Flash, Qwen3.5-9B0.917KorSTS 0.871 vs 0.831 (넘음); KLUE-STS 0.880 vs 0.857 (넘음)

저가 배심원. 입력 $0.10/1M 이하이거나 로컬인 8개(8B 3개, solar-pro4, GLM-5.3-Flash, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B)로 제한하면 최고 5모델 조합 exaone-3.5 + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B가 무루브릭 0.854 / 0.871 / 0.901, 루브릭 0.872 / 0.885 / 0.916으로 전체 최적과 0.01 이내이고 모든 코퍼스에서 최고 단일 모델을 넘는다. 로컬 3개만으로는 넘지 못한다. 구성원을 병렬로 부르므로 지연은 가장 느린 구성원이 정하고, 합의 7모델 조합의 구성원은 모두 입력 $0.30/1M 이하다.

4.3 루브릭 (가설 2)

루브릭은 개별 평균 ρ를 세 코퍼스 모두 올리고(+0.027 / +0.023 / +0.030, 구간 모두 0을 비껴감) 배심원도 올린다(+0.021 / +0.017 / +0.022; 표 7). 13개 중 13 / 11 / 12개 모델이 오른다. 최고 단일 모델은 KorSTS에서만 확실히 오르는데, 다른 두 코퍼스에서는 이미 풀의 천장 근처였기 때문이다. 루브릭이 있으면 조합의 96~99%가 최고 단일 모델을 넘는다.

표 7. 조건 효과(스피어만 ρ의 변화). 루브릭 효과 = 루브릭 − 무루브릭(앵커 없음). 앵커 효과 = 무작위 앵커 − 무앵커(같은 루브릭 설정). 구간은 문항 단위 쌍 부트스트랩.
코퍼스루브릭: 개별 평균 Δρ [95% CI]루브릭: 최고 단일 Δρ [95% CI]루브릭: 배심원 Δρ [95% CI]무작위 앵커: 개별 평균 Δρ무작위 앵커: 배심원 Δρ [95% CI]앵커+루브릭: 개별 평균 Δρ앵커+루브릭: 배심원 Δρ [95% CI]
KorSTS+0.027 [+0.021, +0.034]+0.017 [+0.003, +0.030]+0.021 [+0.015, +0.027]−0.097−0.052 [−0.067, −0.038]−0.054−0.030 [−0.040, −0.020]
KLUE-STS+0.023 [+0.014, +0.033]+0.014 [−0.005, +0.028]+0.017 [+0.005, +0.029]−0.078−0.032 [−0.054, −0.010]−0.035−0.008 [−0.022, +0.006]
STS-B+0.030 [+0.021, +0.038]+0.004 [−0.008, +0.017]+0.022 [+0.014, +0.030]−0.043−0.015 [−0.027, −0.003]−0.023−0.008 [−0.017, +0.001]

4.4 무작위 앵커 (가설 3)

무작위 앵커는 무루브릭에서 개별 평균 ρ를 0.097 / 0.078 / 0.043, 배심원을 0.052 / 0.032 / 0.015 내리고 구간이 모두 0을 비껴간다(표 7, 그림 3). 무앵커 점수가 앵커와 달랐던 판정 중 45% / 41% / 25%가 앵커 쪽으로, 3% / 2% / 3%가 반대쪽으로 움직였다(표 8). 새로 더한 6개 모델은 기존 7개보다 더 세게 끌렸다. 루브릭은 끌림을 18~32%로 줄이고 상관 손실을 절반쯤으로 낮추지만 없애지는 못한다(루브릭 있어도 배심원 −0.030 / −0.008 / −0.008). 배심원은 구성원 평균보다 덜 잃는다. 구성원이 서로 다른 정도로 끌려 평균이 일부 상쇄하기 때문이지만, 앵커를 벗어나지는 못한다.

표 8. 앵커 끌림. 무앵커 점수가 무작위 앵커와 달랐던 판정 중의 비율(13모델 합산).
코퍼스조건문항앵커 쪽으로 (%)반대쪽으로 (%)그대로 (%)앵커 쪽, 기존 7 / 추가 6 (%)
KorSTS루브릭 없음1,37944.72.752.638.5 / 52.2
KorSTS루브릭1,37931.83.564.724.9 / 39.9
KLUE-STS루브릭 없음51940.92.057.137.9 / 44.3
KLUE-STS루브릭51927.42.170.422.9 / 32.6
STS-B루브릭 없음54625.43.071.625.5 / 25.4
STS-B루브릭54618.05.077.019.2 / 16.6
그림 3
그림 3. 무루브릭·무앵커 조건 대비 스피어만 ρ의 변화: 루브릭(초록)과 무작위 앵커(주황), 개별 모델 평균과 배심원. 오차 막대는 배심원의 95% 부트스트랩 구간.

4.5 의견 교환 (가설 4)

점수 전에 근거를 쓰게 한 1라운드는 배심원 ρ를 거의 바꾸지 않았다(무루브릭 +0.010 / −0.004 / 0.000). 다른 모델들의 점수·근거를 읽은 2라운드에서는 판정의 23~30%가 바뀌었고, 그중 98~99%가 다른 모델들의 직전 평균 쪽으로 움직였다(표 10). 불일치가 무너졌다. 문항 내 13개 점수의 표준편차는 0.47~0.59에서 0.22~0.34로, 만장일치 문항은 4~16%에서 21~45%로. 개별 평균 ρ는 올랐지만(+0.017~+0.033) 이는 가장 약한 모델들이 끌어올린 것이다. 1라운드 ρ 하위 4개는 +0.067~+0.082, 상위 4개는 −0.024~+0.007(부록 표 C.1). 그런데 배심원의 ρ는 세 코퍼스 모두 내려갔다(0.015 / 0.032 / 0.030, 구간이 0을 비껴감). 합의 7모델 조합도 같다(그림 4). 바뀐 판정 중 사람 점수에 가까워진 것은 33~41%, 멀어진 것은 58~67%다.

루브릭은 배심원을 지키지 못했다. 루브릭이 있어도 1→2라운드에서 0.015 / 0.034 / 0.029를 잃었다(표 9). KLUE-STS 3라운드는 만장일치를 72%, 문항 내 표준편차를 0.10까지 밀었지만 배심원 ρ는 2라운드 자리에 머물렀고(0.831 → 0.835, 구간 [−0.013, +0.021]) 합의 조합은 더 내려갔다(0.857 → 0.839). 의견 교환은 배심원을 다수의 견해로 수렴시킨다. 약한 모델은 이를 받아들여 이득을 보고, 강한 모델은 손해를 본다. 평균이 상쇄해 주던 독립적 오류가 더 이상 독립적이지 않다(그림 5).

표 9. 의견 교환 라운드: 기준(점수만, 4.1절) → 1라운드(근거+점수) → 2라운드(다른 12개의 1라운드 점수·근거를 읽은 뒤) → 3라운드(KLUE-STS 무루브릭만).
조건코퍼스개별 평균 ρ최고 단일 ρ배심원 ρ (13개 평균)14명 중 순위합의 7모델 ρ배심원 R2 − R1 [95% CI]
루브릭 없음KorSTS0.760 → 0.760 → 0.7930.815 → 0.821 → 0.8230.852 → 0.863 → 0.8481 → 1 → 10.860 → 0.866 → 0.850−0.015 [−0.020, −0.008]
루브릭 없음KLUE-STS0.784 → 0.769 → 0.798 → 0.8140.843 → 0.842 → 0.842 → 0.8350.866 → 0.862 → 0.831 → 0.8351 → 1 → 5 → 20.879 → 0.879 → 0.857 → 0.839−0.032 [−0.049, −0.015]
루브릭 없음STS-B0.806 → 0.807 → 0.8230.875 → 0.865 → 0.8440.893 → 0.893 → 0.8631 → 1 → 10.902 → 0.900 → 0.862−0.030 [−0.040, −0.020]
루브릭KorSTS0.786 → 0.780 → 0.8090.831 → 0.813 → 0.8290.873 → 0.872 → 0.8571 → 1 → 10.875 → 0.869 → 0.858−0.015 [−0.022, −0.009]
루브릭KLUE-STS0.808 → 0.804 → 0.8210.857 → 0.844 → 0.8500.883 → 0.877 → 0.8441 → 1 → 20.886 → 0.880 → 0.870−0.034 [−0.054, −0.017]
루브릭STS-B0.836 → 0.834 → 0.8400.878 → 0.860 → 0.8590.915 → 0.906 → 0.8771 → 1 → 10.916 → 0.901 → 0.877−0.029 [−0.042, −0.016]
표 10. 라운드 사이의 수렴. ‘다른 모델 쪽으로’ = 변경 방향이 (다른 12개의 직전 평균 − 자기 직전 점수)의 부호와 같음.
조건코퍼스단계문항 내 13개 점수 SD만장일치 문항 (%)변경된 판정 (%)변경 중 다른 모델 쪽으로 (%)변경 중 사람에 가까워짐 / 멀어짐 (%)평균 점수 (사람 평균)
루브릭 없음KorSTSR1 → R20.59 → 0.345 → 21309841 / 583.66 → 3.78 (2.61)
루브릭 없음KLUE-STSR1 → R20.49 → 0.2716 → 35239833 / 674.09 → 4.19 (2.48)
루브릭 없음KLUE-STSR2 → R30.27 → 0.1035 → 721110040 / 594.19 → 4.22 (2.48)
루브릭 없음STS-BR1 → R20.47 → 0.224 → 45289940 / 603.83 → 3.96 (2.86)
루브릭KorSTSR1 → R20.55 → 0.325 → 32309640 / 583.67 → 3.78 (2.61)
루브릭KLUE-STSR1 → R20.46 → 0.259 → 43239633 / 674.05 → 4.15 (2.48)
루브릭STS-BR1 → R20.43 → 0.219 → 47259838 / 623.82 → 3.94 (2.86)
그림 4
그림 4. 라운드별 사람 점수와의 스피어만 ρ: 배심원(파랑), 개별 모델 평균(회색), 최고 단일 모델(검정) 무루브릭; 배심원(초록 점선)과 개별 평균(연회색 점선) 루브릭.
그림 5
그림 5. 라운드별 수렴: 문항 내 13개 점수의 평균 표준편차(왼쪽)와 13개가 모두 같은 문항의 비율(오른쪽). 실선 무루브릭, 점선 루브릭.

4.6 난이도 층 (탐색적)

사람 점수 구간 안에서는 범위 제한으로 상관이 낮아지지만 심판들의 순서는 유지된다. 배심원은 무루브릭에서 코퍼스 × 구간 9칸 중 7칸에서 최고 단일 모델을 넘고 9칸 모두에서 개별 평균을 넘는다(표 11, 그림 6). 모델들의 위쪽 치우침이 점수를 압축하는 KLUE-STS 높은 구간이 모든 심판에게 가장 약한 칸이다. KLUE-STS 평가자 불일치 하·중·상위 3분위에서 배심원의 최고 단일 모델 대비 여유는 −0.003 / +0.072 / +0.012.

표 11. 사람 점수 구간(0~1.67 / 1.67~3.33 / 3.33~5)별, 그리고 KLUE-STS 평가자 불일치 3분위별 스피어만 상관(루브릭 없음). ‘최고 단일 모델(전체)’ = 코퍼스 전체 1위 모델을 구간 안에서 평가. 구간 안 상관은 범위 제한으로 전체보다 낮으므로 심판 간 비교로만 읽는다.
코퍼스구간n구간 내 사람 점수 SD최고 단일 모델(전체) ρ개별 평균 ρ배심원 ρ (13개 평균)합의 7모델 ρ
KorSTS낮음 (0~1.67)4070.540.5480.5660.6750.672
KorSTS중간 (1.67~3.33)4380.470.4640.4110.5250.531
KorSTS높음 (3.33~5)5340.540.3650.3020.4490.461
KLUE-STS낮음 (0~1.67)1780.480.5320.4190.5150.510
KLUE-STS중간 (1.67~3.33)1650.490.4950.3620.5060.521
KLUE-STS높음 (3.33~5)1760.470.0600.2030.3210.376
STS-B낮음 (0~1.67)1290.580.6250.6500.7560.739
STS-B중간 (1.67~3.33)1850.500.5210.3860.4990.503
STS-B높음 (3.33~5)2320.550.5230.4490.6530.704
KLUE-STS, 평가자 불일치낮음1981.840.8850.8380.8820.893
KLUE-STS, 평가자 불일치중간1491.400.8020.7790.8740.869
KLUE-STS, 평가자 불일치높음1720.980.7190.6240.7310.754
그림 6
그림 6. 사람 점수 구간별 스피어만 ρ: 최고 단일 모델, 개별 모델 평균, 배심원 (루브릭 없음).

4.7 가설 요약

표 12. 가설과 결과.
가설예측결과근거
가설 1 배심원배심원의 ρ가 모든 개별 모델을 넘는다지지코퍼스 × 조건 12칸 중 12칸에서 14명 중 1위; 앵커 없는 모든 칸에서 배심원 − 최고 단일 > 0, 구간이 0을 비껴감 (표 3, 부록 B)
가설 2 루브릭루브릭이 개별과 배심원의 ρ를 올린다지지개별 평균 +0.023~+0.030; 배심원 +0.017~+0.022; 모든 구간이 0을 비껴감 (표 7)
가설 3 앵커무작위 앵커가 ρ를 내리고 판정을 끌어당긴다지지개별 평균 −0.097~−0.043; 배심원 −0.052~−0.015; 움직일 수 있는 판정의 25~45%가 앵커 쪽으로 (표 7~8)
가설 4 의견 교환점수·근거 공유는 의견을 수렴시키지만 배심원의 ρ를 올리지 않는다지지만장일치 4~16% → 21~45%; 배심원 ρ가 조건 × 코퍼스 6칸 모두 하락, 3라운드에도 회복 없음 (표 9~10)

부록 표

부록 표 B.1. 개별 모델과 배심원의 스피어만 ρ / 피어슨 r, 앵커 없는 조건.
모델KorSTS 무루브릭 ρ / rKorSTS 루브릭 ρ / rKLUE-STS 무루브릭 ρ / rKLUE-STS 루브릭 ρ / rSTS-B 무루브릭 ρ / rSTS-B 루브릭 ρ / r
gemini-2.5-flash0.740 / 0.7590.789 / 0.7960.751 / 0.6930.831 / 0.7940.809 / 0.8200.849 / 0.851
gemma-4 (8B)0.685 / 0.6960.776 / 0.7700.778 / 0.7420.813 / 0.7770.764 / 0.7650.825 / 0.813
exaone-3.5 (7.8B)0.795 / 0.8030.798 / 0.8060.822 / 0.8000.828 / 0.8040.859 / 0.8650.853 / 0.859
gpt-4o-mini0.815 / 0.8220.815 / 0.8140.841 / 0.8280.850 / 0.8430.851 / 0.8570.864 / 0.866
gpt-oss-120b0.785 / 0.7910.798 / 0.7880.843 / 0.7920.828 / 0.7910.818 / 0.8220.827 / 0.821
claude-haiku-4.50.811 / 0.8240.813 / 0.8160.837 / 0.8130.849 / 0.8250.811 / 0.8270.854 / 0.864
llama-3.1 (8B)0.478 / 0.4430.552 / 0.5730.537 / 0.5160.501 / 0.4940.592 / 0.5970.673 / 0.658
solar-pro40.809 / 0.8170.825 / 0.8280.832 / 0.7960.834 / 0.8260.875 / 0.8800.878 / 0.885
GLM-5.3-Flash0.801 / 0.8010.831 / 0.8240.804 / 0.7420.841 / 0.8000.789 / 0.7900.856 / 0.857
Kimi-K2.60.793 / 0.7960.803 / 0.7920.802 / 0.7440.840 / 0.7690.808 / 0.8190.824 / 0.827
gemma-3-27b0.800 / 0.8110.822 / 0.8280.818 / 0.7880.857 / 0.8340.802 / 0.8210.849 / 0.859
DeepSeek-V4-Flash0.780 / 0.7670.794 / 0.8010.724 / 0.6870.801 / 0.7550.837 / 0.8210.846 / 0.846
Qwen3.5-9B0.784 / 0.7950.807 / 0.8120.807 / 0.7660.825 / 0.8130.861 / 0.8650.870 / 0.874
배심원 (13개 평균)0.852 / 0.8520.873 / 0.8730.866 / 0.8380.883 / 0.8670.893 / 0.8840.915 / 0.903
부록 표 B.2. 앵커 조건의 스피어만 ρ(앵커 / 앵커+루브릭)와 판정당 중앙값 응답 시간.
모델KorSTS 앵커 / 앵커+루브릭 ρKLUE-STS 앵커 / 앵커+루브릭 ρSTS-B 앵커 / 앵커+루브릭 ρ응답 시간 중앙값 (초)
gemini-2.5-flash0.745 / 0.8000.770 / 0.8360.831 / 0.8371.0
gemma-4 (8B)0.704 / 0.7590.753 / 0.8140.644 / 0.7981.1
exaone-3.5 (7.8B)0.569 / 0.7770.601 / 0.7920.829 / 0.8340.4
gpt-4o-mini0.672 / 0.7100.752 / 0.7880.703 / 0.8010.7
gpt-oss-120b0.740 / 0.7960.795 / 0.8260.746 / 0.8280.4
claude-haiku-4.50.749 / 0.7870.758 / 0.8490.833 / 0.8470.8
llama-3.1 (8B)0.328 / 0.5380.334 / 0.4840.480 / 0.5610.7
solar-pro40.663 / 0.7160.707 / 0.7770.866 / 0.8740.4
GLM-5.3-Flash0.794 / 0.8210.821 / 0.8440.813 / 0.8572.2
Kimi-K2.60.763 / 0.7630.793 / 0.7750.837 / 0.8461.2
gemma-3-27b0.714 / 0.7880.728 / 0.8270.759 / 0.8321.0
DeepSeek-V4-Flash0.424 / 0.6960.578 / 0.7100.723 / 0.8181.0
Qwen3.5-9B0.751 / 0.5700.792 / 0.7230.847 / 0.8420.5
배심원 (13개 평균)0.800 / 0.8430.834 / 0.8750.878 / 0.907—
배심원 14명 중 순위1 / 11 / 11 / 1—
부록 표 C.1. 개별 모델의 스피어만 ρ, 기준 → 1라운드 → 2라운드 (루브릭 없음).
모델KorSTS 기준 → R1 → R2KLUE-STS 기준 → R1 → R2STS-B 기준 → R1 → R2
gemini-2.5-flash0.740 → 0.718 → 0.7740.751 → 0.657 → 0.7260.809 → 0.737 → 0.778
gemma-4 (8B)0.685 → 0.724 → 0.8040.778 → 0.766 → 0.8310.764 → 0.759 → 0.837
exaone-3.5 (7.8B)0.795 → 0.760 → 0.7870.822 → 0.801 → 0.8310.859 → 0.853 → 0.825
gpt-4o-mini0.815 → 0.794 → 0.8230.841 → 0.837 → 0.8420.851 → 0.834 → 0.840
gpt-oss-120b0.785 → 0.793 → 0.8120.843 → 0.839 → 0.8190.818 → 0.804 → 0.834
claude-haiku-4.50.811 → 0.817 → 0.8080.837 → 0.842 → 0.8410.811 → 0.833 → 0.844
llama-3.1 (8B)0.478 → 0.522 → 0.6390.537 → 0.484 → 0.6220.592 → 0.708 → 0.809
solar-pro40.809 → 0.806 → 0.8140.832 → 0.824 → 0.8370.875 → 0.865 → 0.828
GLM-5.3-Flash0.801 → 0.778 → 0.8170.804 → 0.756 → 0.8110.789 → 0.803 → 0.812
Kimi-K2.60.793 → 0.794 → 0.8060.802 → 0.794 → 0.8040.808 → 0.836 → 0.825
gemma-3-27b0.800 → 0.789 → 0.8160.818 → 0.805 → 0.8190.802 → 0.781 → 0.832
DeepSeek-V4-Flash0.780 → 0.821 → 0.8210.724 → 0.827 → 0.8070.837 → 0.863 → 0.841
Qwen3.5-9B0.784 → 0.769 → 0.7920.807 → 0.768 → 0.7920.861 → 0.811 → 0.801
부록 표 D.1. 제외한 STS-B 손상 4문항.
문항손상길이 변화
stsb-0049뒤따르는 7줄이 문장 2에 붙음75 → 1,871자
stsb-0322뒤따르는 11줄이 문장 2에 붙음135 → 2,405자
stsb-0279뒤따르는 줄이 문장 2에 붙음87 → 244자
stsb-0361두 문장이 필드 1에, 문장 2 비어 있음문장 2: 0자

판정 원자료 260,923건(근거 텍스트 포함)·프롬프트·집계·조합 탐색·부트스트랩·그림 코드·결과 표를 담은 익명 재현 패키지: repro_package_v10.zip (18 MB). API 키와 서버 정보는 포함하지 않는다.

07 — 현황

지금까지 한 것

2026-09-16 교수님 의논 이후 일주일 동안 지표·집계·앵커·모델 수·가설을 바꾸고 원고 v10까지 마쳤다. 그 전(9월 9~14일)의 일은 11 이전 기록에 있다.

완료

09-16 · 서열상관 재분석

지표를 정확일치 → 스피어만 ρ(피어슨 병기), 배심원을 중앙값 → 평균으로 바꿔 7모델 판정을 다시 계산. 등급 변환 불일치·STS-B 손상 4문항 확인. 정답+1 앵커 폐기, 무작위 앵커 결과 정리.

완료

09-17 · 6모델 추가 → 13모델

solar-pro4·GLM-5.3-Flash·Kimi-K2.6·gemma-3-27b·DeepSeek-V4-Flash·Qwen3.5-9B 판정 58,752건 수집(4조건). 13모델 조합 8,191개 전수 탐색, 코퍼스 교차 검증, 홀수 크기 5·7·9·11 합의 조합, 저가 조합.

완료

09-18 · 의견 교환(델파이) 실험

13모델 × 2,444쌍, 무루브릭·루브릭 각 2라운드 + KLUE-STS 3라운드 = 판정 133,835건. 수렴 지표·라운드별 ρ·부트스트랩 구간.

완료

09-19 · 원고 v10 (영문, IP&M)

서론부터 새로 씀. 가설 1~4, 표 12, 그림 6(300 dpi), 부록 A~D, 참고문헌 36편. 익명 원고·제목 페이지 분리, 투고 체크리스트 점검.

완료

09-19 · 재현 패키지 v10

문항 파일·판정 260,923건·프롬프트·코드·결과·그림·README, 122파일 151 MB(zip 18 MB). 경로·키·서버명 익명화, 검사 0건.

완료

09-20~23 · 발표 자료

국문 10장 슬라이드·발표 스크립트(PDF). 슬라이드 8에 라운드 수렴 표 추가.

완료

09-23 · 포털 v10 개편

이 페이지. 00~09를 원고 v10 흐름으로 다시 쓰고 옛 페이지를 11절에 보존.

08 — 계획

앞으로 할 것

분석과 원고는 끝났다. 남은 것은 교수님 확정과 투고 절차다.

다음

제목 확정 (교수님 상의)

가제 「Independent Votes Beat the Best Judge: Rank Correlation with Human Similarity Ratings for LLM Juries, Rubrics, Random Anchors and Deliberation」. 확정되면 원고·제목 페이지·슬라이드·이 포털을 한 번에 고친다.

다음

OSF 기탁

재현 패키지를 OSF에 올려 익명 열람 링크를 받고 원고의 자료 가용성 문구 자리에 넣는다.

다음

저자 정보·선언문

제목 페이지의 저자·소속·교신 정보, 이해관계·AI 사용 선언, 커버레터.

다음

투고

Information Processing & Management (SCIE/SSCI). 국문 논문은 쓰지 않는다(2026-09-02 결정).

09 — 참고문헌

참고문헌 (원고 v10, 36편)

APA 7판 형식, 영문 알파벳순. 원고 본문에서 인용한 문헌만 남겼다.

  • Agirre, E., Cer, D., Diab, M., & Gonzalez-Agirre, A. (2012). SemEval-2012 Task 6: A pilot on semantic textual similarity. Proceedings of the First Joint Conference on Lexical and Computational Semantics (*SEM 2012), 385–393. https://aclanthology.org/S12-1051
  • Artstein, R., & Poesio, M. (2008). Inter-coder agreement for computational linguistics. Computational Linguistics, 34(4), 555–596. https://doi.org/10.1162/coli.07-034-R2
  • Bavaresco, A., Bernardi, R., Bertolazzi, L., Elliott, D., Fernández, R., Gatt, A., Ghaleb, E., Giulianelli, M., Hanna, M., Koller, A., Martins, A., Mondorf, P., Neplenbroek, V., Pezzelle, S., Plank, B., Schlangen, D., Suglia, A., Surikuchi, A. K., Takmaz, E., & Testoni, A. (2025). LLMs instead of human judges? A large scale empirical study across 20 NLP evaluation tasks. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers), 238–255. https://doi.org/10.18653/v1/2025.acl-short.20
  • Calderon, N., Reichart, R., & Dror, R. (2025). The alternative annotator test for LLM-as-a-judge: How to statistically justify replacing human annotators with LLMs. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 16051–16081. https://doi.org/10.18653/v1/2025.acl-long.782
  • Cer, D., Diab, M., Agirre, E., Lopez-Gazpio, I., & Specia, L. (2017). SemEval-2017 Task 1: Semantic textual similarity multilingual and crosslingual focused evaluation. Proceedings of the 11th International Workshop on Semantic Evaluation (SemEval-2017), 1–14. https://doi.org/10.18653/v1/S17-2001
  • Chen, G. H., Chen, S., Liu, Z., Jiang, F., & Wang, B. (2024). Humans or LLMs as the judge? A study on judgement bias. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 8301–8327. https://doi.org/10.18653/v1/2024.emnlp-main.474
  • Cohen, J. (1968). Weighted kappa: Nominal scale agreement with provision for scaled disagreement or partial credit. Psychological Bulletin, 70(4), 213–220. https://doi.org/10.1037/h0026256
  • Dalkey, N., & Helmer, O. (1963). An experimental application of the Delphi method to the use of experts. Management Science, 9(3), 458–467. https://doi.org/10.1287/mnsc.9.3.458
  • Du, Y., Li, S., Torralba, A., Tenenbaum, J. B., & Mordatch, I. (2024). Improving factuality and reasoning in language models through multiagent debate. Proceedings of the 41st International Conference on Machine Learning (ICML 2024), PMLR 235, 11733–11763. https://proceedings.mlr.press/v235/du24e.html
  • Fasolo, B., Heard, C., & Scopelliti, I. (2025). Mitigating cognitive bias to improve organizational decisions: An integrative review, framework, and research agenda. Journal of Management, 51(6), 2182–2211. https://doi.org/10.1177/01492063241287188
  • Fu, X., & Liu, W. (2025). How reliable is multilingual LLM-as-a-judge? Findings of the Association for Computational Linguistics: EMNLP 2025, 11040–11053. https://doi.org/10.18653/v1/2025.findings-emnlp.587
  • Galton, F. (1907). Vox populi. Nature, 75(1949), 450–451. https://doi.org/10.1038/075450a0
  • Gu, J., Jiang, X., Shi, Z., Tan, H., Zhai, X., Xu, C., Li, W., Shen, Y., Ma, S., Liu, H., Wang, S., Zhang, K., Wang, Y., Gao, W., Ni, L., & Guo, J. (2024). A survey on LLM-as-a-judge. arXiv. https://doi.org/10.48550/arXiv.2411.15594
  • Ham, J., Choe, Y. J., Park, K., Choi, I., & Soh, H. (2020). KorNLI and KorSTS: New benchmark datasets for Korean natural language understanding. Findings of the Association for Computational Linguistics: EMNLP 2020, 422–430. https://doi.org/10.18653/v1/2020.findings-emnlp.39
  • Jiang, D., Ren, X., & Lin, B. Y. (2023). LLM-Blender: Ensembling large language models with pairwise ranking and generative fusion. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 14165–14178. https://doi.org/10.18653/v1/2023.acl-long.792
  • Kim, E., Garg, A., Peng, K., & Garg, N. (2025). Correlated errors in large language models. Proceedings of the 42nd International Conference on Machine Learning (ICML 2025), PMLR 267. https://doi.org/10.48550/arXiv.2506.07962
  • Kim, S., Shin, J., Cho, Y., Jang, J., Longpre, S., Lee, H., Yun, S., Shin, S., Kim, S., Thorne, J., & Seo, M. (2024). Prometheus: Inducing fine-grained evaluation capability in language models. Proceedings of the Twelfth International Conference on Learning Representations (ICLR 2024). https://doi.org/10.48550/arXiv.2310.08491
  • Kohli, G. S. (2026). Nine judges, two effective votes: Correlated errors undermine LLM evaluation panels. arXiv. https://doi.org/10.48550/arXiv.2605.29800
  • Li, D., Jiang, B., Huang, L., Beigi, A., Zhao, C., Tan, Z., Bhattacharjee, A., Jiang, Y., Chen, C., Wu, T., Shu, K., Cheng, L., & Liu, H. (2025). From generation to judgment: Opportunities and challenges of LLM-as-a-judge. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, 2757–2791. https://doi.org/10.18653/v1/2025.emnlp-main.138
  • Li, Z., Wang, C., Ma, P., Wu, D., Wang, S., Gao, C., & Liu, Y. (2024). Split and merge: Aligning position biases in LLM-based evaluators. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 11084–11108. https://doi.org/10.18653/v1/2024.emnlp-main.621
  • Liang, T., He, Z., Jiao, W., Wang, X., Wang, Y., Wang, R., Yang, Y., Shi, S., & Tu, Z. (2024). Encouraging divergent thinking in large language models through multi-agent debate. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 17889–17904. https://doi.org/10.18653/v1/2024.emnlp-main.992
  • Liu, Y., Iter, D., Xu, Y., Wang, S., Xu, R., & Zhu, C. (2023). G-Eval: NLG evaluation using GPT-4 with better human alignment. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, 2511–2522. https://doi.org/10.18653/v1/2023.emnlp-main.153
  • Lorenz, J., Rauhut, H., Schweitzer, F., & Helbing, D. (2011). How social influence can undermine the wisdom of crowd effect. Proceedings of the National Academy of Sciences, 108(22), 9020–9025. https://doi.org/10.1073/pnas.1008636108
  • Morreau, M. (2021). Democracy without enlightenment: A jury theorem for evaluative voting. Journal of Political Philosophy, 29(2), 188–210. https://doi.org/10.1111/jopp.12226
  • Panickssery, A., Bowman, S. R., & Feng, S. (2024). LLM evaluators recognize and favor their own generations. Advances in Neural Information Processing Systems, 37, 68772–68802. https://doi.org/10.52202/079017-2197
  • Park, S., Moon, J., Kim, S., Cho, W. I., Han, J., Park, J., Song, C., Kim, J., Song, Y., Oh, T., Lee, J., Oh, J., Lyu, S., Jeong, Y., Lee, I., Seo, S., Lee, D., Kim, H., Lee, M., … Cho, K. (2021). KLUE: Korean Language Understanding Evaluation. Proceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks 1 (NeurIPS Datasets and Benchmarks 2021). https://doi.org/10.48550/arXiv.2105.09680
  • Romaniega, Á. (2022). On the probability of the Condorcet Jury Theorem or the miracle of aggregation. Mathematical Social Sciences, 119, 41–55. https://doi.org/10.1016/j.mathsocsci.2022.06.002
  • Rowe, G., & Wright, G. (1999). The Delphi technique as a forecasting tool: Issues and analysis. International Journal of Forecasting, 15(4), 353–375. https://doi.org/10.1016/S0169-2070(99)00018-7
  • Saito, K., Wachi, A., Wataoka, K., & Akimoto, Y. (2023). Verbosity bias in preference labeling by large language models. arXiv. https://doi.org/10.48550/arXiv.2310.10076
  • Sclar, M., Choi, Y., Tsvetkov, Y., & Suhr, A. (2024). Quantifying language models' sensitivity to spurious features in prompt design or: How I learned to start worrying about prompt formatting. Proceedings of the Twelfth International Conference on Learning Representations (ICLR 2024). https://doi.org/10.48550/arXiv.2310.11324
  • Sharma, M., Tong, M., Korbak, T., Duvenaud, D., Askell, A., Bowman, S. R., Cheng, N., Durmus, E., Hatfield-Dodds, Z., Johnston, S. R., Kravec, S., Maxwell, T., McCandlish, S., Ndousse, K., Rausch, O., Schiefer, N., Yan, D., Zhang, M., & Perez, E. (2024). Towards understanding sycophancy in language models. Proceedings of the Twelfth International Conference on Learning Representations (ICLR 2024). https://doi.org/10.48550/arXiv.2310.13548
  • Spearman, C. (1904). The proof and measurement of association between two things. The American Journal of Psychology, 15(1), 72–101. https://doi.org/10.2307/1412159
  • Tversky, A., & Kahneman, D. (1974). Judgment under uncertainty: Heuristics and biases. Science, 185(4157), 1124–1131. https://doi.org/10.1126/science.185.4157.1124
  • Verga, P., Hofstätter, S., Althammer, S., Su, Y., Piktus, A., Arkhangorodsky, A., Xu, M., White, N., & Lewis, P. (2024). Replacing judges with juries: Evaluating LLM generations with a panel of diverse models. arXiv. https://doi.org/10.48550/arXiv.2404.18796
  • Wang, Y., Tao, S., Xie, N., Yang, H., Baldwin, T., & Verspoor, K. (2023). Collective human opinions in semantic textual similarity. Transactions of the Association for Computational Linguistics, 11, 997–1013. https://doi.org/10.1162/tacl_a_00584
  • Zheng, L., Chiang, W.-L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., Lin, Z., Li, Z., Li, D., Xing, E. P., Zhang, H., Gonzalez, J. E., & Stoica, I. (2023). Judging LLM-as-a-judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, 36, 46595–46623. https://doi.org/10.52202/075280-2020
10 — 교수님과의 의논

교수님과의 의논

교수님 피드백을 받을 때마다 확인한 사실과 다시 계산한 결과를 날짜별로 남긴다. 정해진 내용은 본문(03 가설·04 방법·06 결과)과 원고 v10에 반영했고, 여기에는 이력과 상세 페이지를 둔다.

  • 2026-09-16 (17·18일 갱신) · 교수님 질문 아홉 개에 대한 답 — 서열상관으로 다시 본 배심원.v10의 근거
    지표를 정확일치에서 사람 연속 점수와의 서열상관(스피어만·피어슨)으로, 배심원을 중앙값에서 평균으로 바꾸어 다시 계산했다. 등급 변환 규칙 불일치와 STS-B 손상 4문항을 확인했고, 앵커는 정답+1이었음을 답하며 무작위 앵커 결과를 붙였다. 조합 탐색과 교차코퍼스 검증, 난이도 층을 담았고, 17일에 후보 6모델 판정 58,752건을 받아 13모델 조합 재탐색 결과를 4번·8번에 더했다. 18일에는 교수님이 제안하신 상호정보 교환 앵커(가설 4)를 13모델 델파이 라운드(133,835건)로 실험해 10번 절로 더했다. 열기 →
  • 2026-09-12 ~ 14 · 첫 피드백("결론이 원하던 것과 다르다") 이후의 추가 분석.v7 기준 · 보정 부분은 v10에서 제외
    정확일치 기준에서 배심원이 진 원인(공통 위쪽 치우침)을 찾고 분위수 보정과 무작위 앵커 재실험을 정리했다. 서열상관으로 지표가 바뀌면서 보정은 원고에서 빠졌고, 무작위 앵커 부분만 가설 3으로 이어졌다. 열기 →
11 — 이전 기록

v7 시절의 포털·해설·노트 (보존)

2026-09-09~14의 설계(7모델 · 정확일치 · 중앙값 투표 · 정답+1 앵커 · 난이도–이득 가설)로 쓴 페이지들이다. 결론이 지금과 다르지만(당시: 중앙값 투표는 개별 모델을 못 이긴다) 연구가 어떻게 바뀌어 왔는지를 보여 주므로 지우지 않고 그대로 둔다. 링크는 예전 그대로 열린다.

v7 → v10에서 바뀐 것

  • 지표 반올림 등급과의 정확일치 → 사람 연속 점수와의 스피어만 ρ (피어슨 병기)
  • 집계 중앙값 투표 → 평균 집계 (중앙값은 비교용)
  • 앵커 정답+1 (정답 누설) → 문항 씨앗 무작위 1~5
  • 모델 7개 → 13개 (개발사 9곳), 조합 8,191개 전수
  • 가설 난이도–이득(H1)·루브릭(H2)·앵커+완화(H3) → 배심원(1)·루브릭(2)·무작위 앵커(3)·의견 교환(4). 난이도는 탐색적 분석으로
  • 결론 "중앙값 투표는 개별 모델을 못 이긴다" → "독립적으로 투표하고 평균하면 배심원은 최고 단일 모델을 넘는다"