AI For All Lab · Research Portal · LLM 배심원 · 원고 v10 기준
LLM 13개가 사람이 매긴 문장쌍 2,444개를 네 조건에서 채점하고, 이어서 서로의 근거를 읽고 다시 판정했다. 사람 점수와의 서열상관(스피어만 ρ)으로 재면, 13개 점수의 평균 집계는 세 코퍼스·네 조건 모두에서 가장 좋은 단일 모델을 넘는다. 루브릭은 모두를 올리고, 무작위 앵커와 의견 교환은 독립성을 깨어 배심원을 떨어뜨린다.
가설 1 · 배심원
여러 모델의 평균이 최고 단일 모델보다 사람을 잘 따라가는가
13개 모델 vs 평균 집계, 세 코퍼스 × 네 조건
가설 2 · 루브릭
채점 기준표가 개별 모델과 배심원의 ρ를 함께 올리는가
같은 문항을 루브릭 유무로 두 번 채점
가설 3 · 무작위 앵커
정답과 무관한 앞선 점수가 판정을 끌어당기는가
문항마다 1~5 무작위 값을 "앞선 판정"으로 제시
가설 4 · 의견 교환
서로의 점수와 근거를 읽으면 배심원이 좋아지는가
델파이식 2~3라운드, 익명 공유
아래 여섯 칸이 원고 v10의 결과 전부를 요약한다. 값은 블라인드(루브릭 없음·앵커 없음) 조건, 순서는 언제나 KorSTS / KLUE-STS / STS-B.
배심원(13개 평균) ρ vs 최고 단일 모델
0.852 / 0.866 / 0.893
최고 단일 모델 0.815 / 0.843 / 0.875. 14명 중 1위, 12칸 중 12칸. 차이의 95% 구간이 모두 0을 비껴간다.
최고 단일 모델을 넘는 조합의 비율
98% / 92% / 86%
2개 이상 조합 8,178개 중. 루브릭이 있으면 96~99%. 5~9개면 충분하다.
값싼 5모델 조합 (입력 $0.10/1M 이하·로컬)
0.854 / 0.871 / 0.901
exaone-3.5 + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B. 전체 최적과 0.01 이내.
루브릭 효과 (배심원 Δρ)
+0.021 / +0.017 / +0.022
개별 모델 평균 +0.027 / +0.023 / +0.030. 13개 중 11~13개 모델이 오른다.
무작위 앵커 효과 (배심원 Δρ)
−0.052 / −0.032 / −0.015
개별 모델 평균 −0.097 / −0.078 / −0.043. 움직일 수 있는 판정의 45 / 41 / 25%가 앵커 쪽으로 끌린다.
의견 교환 효과 (배심원 Δρ, 1→2라운드)
−0.015 / −0.032 / −0.030
만장일치 문항 4~16% → 21~45%로 수렴하지만 배심원은 내려간다. 루브릭·3라운드로도 회복 없음.
가제 「Independent Votes Beat the Best Judge: Rank Correlation with Human Similarity Ratings for LLM Juries, Rubrics, Random Anchors and Deliberation」제목 확정 전. Information Processing & Management(SCIE/SSCI) 투고용 영문 원고. 본문 6절·표 12·그림 6·부록 A~D·참고문헌 36편. 아래 03~06절은 이 원고의 가설·방법·결과를 같은 번호의 표·그림으로 옮긴 것이다.
데이터 라벨링, 검색 결과 채점, 요약·답안 평가가 빠르게 LLM에게 넘어가고 있다. 한 모델의 편향을 피하려고 여러 모델에게 같은 문항을 묻고 표를 합치는 배심원(jury) 방식이 퍼졌지만, 그것이 언제 최고의 단일 모델을 넘는지는 실증이 드물다.
심판들이 서로 독립적으로 틀린다면 표를 합칠 때 오류가 상쇄되어 집단이 어느 구성원보다 진실에 가깝다(Galton, 1907; Condorcet 배심원 정리). LLM 심판들이 이 조건을 만족하는지는 경험적 질문이고, 최근 연구는 서로 다른 회사의 모델도 같은 문항을 같이 틀린다고 경고한다(Kim et al., 2025; Kohli, 2026).
오류 상관이 다수결 이득을 제약한다는 보고는 있으나, 사람이 매긴 정답 위에서 (1) 평균 집계 배심원이 최고 단일 모델을 넘는지, (2) 루브릭이 얼마나 올리는지, (3) 정답과 무관한 앵커가 얼마나 끌어당기는지, (4) 서로의 근거를 읽는 델파이식 교환이 배심원을 돕는지 해치는지를 같은 모델·같은 문항에서 함께 잰 연구는 없다.
이 분야는 3년 만에 "한 명의 심판"에서 "배심원단"으로, 다시 "배심원단의 한계"로 옮겨 왔다. 원고 2절은 이를 네 갈래(심판·배심원 / 루브릭·앵커 / 사람 점수와의 일치 측정 / 의견 교환)로 정리한다.
| 연도 | 전환점 | 내용 |
|---|---|---|
| 2023 | 판정자 1명의 시대 | GPT-4 한 모델이 심판을 봤다. 장황성·위치 편향이 드러났다 (Zheng et al.; Liu et al.; Saito et al.) |
| 2024 | 배심원의 등장 | 서로 다른 회사의 작은 모델 여럿이 큰 모델 하나보다 정확하고 쌌다 (Verga et al., PoLL). 자기 선호·프롬프트 형식 민감성 보고 (Panickssery et al.; Sclar et al.) |
| 2025 | 오류 상관, 과의존, 다국어 | 회사가 달라도 LLM들은 같은 문제를 같이 틀린다 (Kim et al.). 사람은 과신하는 LLM 출력을 따른다 (Rathi et al.). 20개 과제 대규모 비교 (Bavaresco et al.), 대체 기준 (Calderon et al.), 다국어 심판의 신뢰 저하 (Fu & Liu) |
| 2026 | “9명 중 실효 2표” | 판정자 9명을 모아도 오류가 겹쳐 실질적으로 2표였다 (Kohli) |
구조화된 기준은 사람 평가자 편향의 표준 처방이고(Fasolo et al., 2025) 세분화된 루브릭은 LLM 평가자를 개선한다(Kim et al., 2024). 앵커링은 사람 판단에서 가장 견고한 발견 중 하나이며(Tversky & Kahneman, 1974), LLM에서 가장 가까운 현상은 아첨(Sharma et al., 2024)이다. 루브릭이 LLM 심판의 앵커링을 줄이는지는 사람 정답 위에서 측정된 적이 없다.
STS 벤치마크는 시스템과 사람 점수의 일치를 상관으로 보고한다. SemEval은 피어슨(Agirre et al., 2012; Cer et al., 2017), 흔히 스피어만도 함께다. 정답이 여러 평가자의 연속 평균이기 때문이다. 카파류 계수(Cohen, 1968; Artstein & Poesio, 2008)와 이산 등급과의 정확일치는 범주 결정에 맞지만 심판의 척도 사용과 변별력을 뒤섞는다. 사람 평가자들 자신도 구조적으로 갈리므로(Wang et al., 2023) 연속 정답을 그대로 쓰는 편이 옳다.
델파이 기법은 집단의 이전 답을 통제된 방식으로 돌려주며 판단을 반복해 수렴과 개선을 기대한다(Dalkey & Helmer, 1963; Rowe & Wright, 1999). 그러나 사람 군중 실험은 약한 사회적 영향만으로도 추정치의 다양성이 줄고 군중의 지혜가 무너지며 자신감만 커진다고 보고했다(Lorenz et al., 2011). LLM 다중 에이전트 토론은 사실 추론을 돕는다는 보고(Du et al., 2024)와, 한 답으로 수렴해 사고의 다양성을 잃는다는 보고(Liang et al., 2024)가 함께 있다. 사람 정답을 기준으로 의견 교환이 LLM 배심원을 돕는지 해치는지가 이 연구의 네 번째 질문이다.
2026-09-16 교수님 의논 이후 다시 세운 가설이다. 지표는 사람 연속 점수와의 스피어만 서열상관 ρ, 배심원은 13개 정수 점수의 평균 집계다. 옛 가설(난이도–이득, 정답+1 앵커)은 폐기했고 그 이력은 11 이전 기록에 있다.
가설 1
인간 평가자에 개별 LLM보다 LLM 배심원(jury)이 가장 잘 따라간다.
개별 모델 13개와 배심원 중 배심원의 ρ가 가장 높다. 즉 배심원의 사람 점수와의 서열상관이 모든 개별 모델을 넘는다.
결과: 지지 — 12칸 중 12칸 14명 중 1위 (표 3·부록 표 B.2)가설 2
루브릭을 쓰면 스피어만 순위상관계수가 올라간다.
채점 루브릭을 제공하면 개별 모델과 배심원의 ρ가 함께 오른다.
결과: 지지 — 개별 평균 +0.023~+0.030, 배심원 +0.017~+0.022 (표 7)가설 3
정답과 무관한 앵커를 보이면 판정이 끌리고 ρ가 내려간다.
사람 점수와 독립인 무작위 점수를 “앞선 판정”으로 보이면 개별 모델과 배심원의 ρ가 내려가고, 판정이 그 점수 쪽으로 움직인다.
결과: 지지 — 개별 평균 −0.043~−0.097, 배심원 −0.015~−0.052, 끌림 25~45% (표 7·8)가설 4
점수와 근거를 서로 교환하면 의견은 수렴하지만 배심원의 ρ는 오르지 않고 내려갈 수 있다.
교수님이 제안한 “상호정보 교환 앵커”. 델파이식 라운드에서 각 모델이 다른 12개의 익명 점수·근거를 읽고 다시 판정한다.
결과: 지지 — 만장일치 4~16% → 21~45%, 배심원 ρ는 6칸 모두 하락, 3라운드에도 회복 없음 (표 9·10)네 가설이 함께 말하는 것
배심원의 이득은 독립적인 표를 평균할 때 생긴다. 루브릭은 각 심판을 좋게 만들어 이득을 키우고, 앵커와 의견 교환은 표를 서로 닮게 만들어 이득을 깎는다. 실무 지침: 값싼 모델 5~9개를 블라인드로, 병렬로 부르고 평균하라. 서로의 답을 보여 주지 말라.
사람 실험처럼 설계하되 참가자는 전원 LLM이다. 같은 13개 모델이 같은 2,444쌍을 네 조건에서 채점하고, 이어서 델파이식 라운드로 다시 판정한다. 같은 모델이 자기 자신의 통제집단이므로 판정의 변화가 곧 조작의 효과다(개체 내 설계).
| 요인 | 수준 | 연결 가설 |
|---|---|---|
| 채점 루브릭 | 없음 / 5단계 기준 제공 | 가설 2 |
| 무작위 앵커 | 없음 / “앞선 판정자는 N점” (N ~ 균등{1..5}, 문항 번호를 씨앗으로) | 가설 3 |
| 의견 교환 (델파이) | 기준(점수만) → 1라운드(근거+점수) → 2라운드(다른 12개의 익명 점수·근거를 읽고 재판정) → 3라운드(KLUE-STS만) | 가설 4 |
| 배심원 크기·조합 | 2^13 − 1 = 8,191개 부분집합 전수, 홀수 크기 5·7·9·11 합의 조합, 코퍼스 교차 검증 | 가설 1 (탐색) |
| 난이도 층 | 사람 점수 구간 3개(0~1.67 / 1.67~3.33 / 3.33~5), KLUE-STS 평가자 불일치 3분위 | 탐색적 |
다음 두 문장의 주제 유사도를 1(무관)~5(동일)로 판정하세요. 문장1: 오늘 오후부터 전국에 비가 내리겠습니다. 문장2: 오늘 오후 들어 전국적으로 비가 오겠습니다. 숫자 하나만 답하세요.
영어 문항(STS-B)은 같은 뜻의 영어 프롬프트를 받는다. 루브릭 조건은 첫 줄 뒤에 5단계 채점 기준(5점 같은 사건·주장 / 4점 같은 주제의 매우 유사한 내용 / 3점 같은 분야의 관련 주제 / 2점 부분적으로만 겹침 / 1점 무관)을 덧붙이고,
앵커 조건은 문장 앞에 참고: 앞선 판정자는 이 쌍을 N점으로 판정했습니다.를 덧붙인다.
N은 문항 번호를 씨앗으로 한 의사난수로 1~5에서 균등하게 뽑으므로 사람 점수와 무관하고, 13개 모델에 같은 값이 가며, 재현된다.
전 모델 온도 0, 추론(thinking) 모드 비활성, 버전 고정, 시스템 프롬프트 없음. 채점 조건 판정 수는 13 × 2,444 × 4 = 127,088.
1라운드에서 각 모델은 한두 문장의 근거와 점수를 낸다. 2라운드에서는 같은 쌍과 함께 자기 1라운드 답, 그리고 다른 12개 모델의 1라운드 점수·근거를 ‘평가자 1~12’로 익명화해 문항별 고정 난수 순서로 받고 최종 점수를 정한다(유지 또는 변경). 루브릭 없이·있이 두 번 돌렸고, KLUE-STS는 루브릭 없이 3라운드까지 갔다. 판정 133,835건 추가, 총 260,923건.
개발사 9곳. 8B급 오픈 모델 3개는 연구실 서버(Ollama, RTX 3090)에서 비용 0으로, 상용 소형 5개는 각사 API로, 대형 오픈 5개는 추론 호스트(DeepInfra·Together·Cerebras)로 돌렸다. 9월 17일에 교수님이 주신 키로 6개(solar-pro4 · GLM-5.3-Flash · Kimi-K2.6 · gemma-3-27b · DeepSeek-V4-Flash · Qwen3.5-9B)를 더해 7개에서 13개가 되었다.
| 모델 | 개발사 | 가중치 | 크기 | 실행 위치 | 단가 입력 / 출력 |
|---|---|---|---|---|---|
| gemini-2.5-flash | 비공개 | n/d | Google Gemini API | 0.30 / 2.50 | |
| gemma-4 (8B) | 오픈 | 8B, 4비트 | 연구실 서버 (Ollama) | 0 / 0 | |
| exaone-3.5 (7.8B) | LG AI Research | 오픈 | 7.8B, 4비트 | 연구실 서버 (Ollama) | 0 / 0 |
| gpt-4o-mini | OpenAI | 비공개 | n/d | OpenAI API | 0.15 / 0.60 |
| gpt-oss-120b | OpenAI | 오픈 | 120B MoE | Cerebras API | 0.25 / 0.69 |
| claude-haiku-4.5 | Anthropic | 비공개 | n/d | Anthropic API | 1.00 / 5.00 |
| llama-3.1 (8B) | Meta | 오픈 | 8B, 4비트 | 연구실 서버 (Ollama) | 0 / 0 |
| solar-pro4 | Upstage | 비공개 | n/d | Upstage API | 0.30 / 1.20 |
| GLM-5.3-Flash | Z.ai (Zhipu) | 오픈 | n/d (Flash급) | DeepInfra | 0.15 / 0.50 |
| Kimi-K2.6 | Moonshot AI | 오픈 | MoE, n/d | DeepInfra; OpenRouter | 0.75 / 3.50 |
| gemma-3-27b | 오픈 | 27B | DeepInfra | 0.08 / 0.16 | |
| DeepSeek-V4-Flash | DeepSeek | 오픈 | MoE, n/d | DeepInfra | 0.09 / 0.18 |
| Qwen3.5-9B | Alibaba | 오픈 | 9B | Together AI | 0.10 / 0.15 |
심판 구성과 설계 변경 이력
2026-09-09 설계는 7모델 · 정확일치 · 중앙값 투표 · 정답+1 앵커였다. 9월 16일 교수님 의논에서 지표를 서열상관으로, 집계를 평균으로 바꾸고 정답+1 앵커(정답을 누설하는 인공물)를 무작위 앵커로 대체했다. 9월 17일 6모델을 더해 13모델, 9월 18일 의견 교환 라운드를 더했다. 초기 후보였던 Qwen 3.6·GLM 4.7은 수집 안정성·서비스 종료로 제외됐다. 상세는 의논 페이지.
같은 설계를 서로 독립된 세 자료에 적용한다. 하나가 다른 하나를 검증하는 관계가 아니라, 같은 질문을 세 번 묻고 답이 자료와 언어를 넘어 재현되는지를 본다.
세 자료 모두 사람이 매긴 공개 벤치마크이고, 정답은 여러 평가자의 연속 평균(0~5)을 그대로 쓴다. 반올림 등급 1~5는 STS-B 표본을 등급별로 고르고 자료를 기술할 때만 썼다.
| 자료 | 언어 | 문항 | 사람 점수 | 평가자 수 | 도메인 | 판정 수 |
|---|---|---|---|---|---|---|
| KorSTS | 한국어 | 1,379쌍 (test 전체) | 평균, 0~5 | 5 | 캡션·뉴스·포럼 (STS-B 번역) | 71,708 + 71,708 |
| KLUE-STS | 한국어 | 519쌍 (dev) | 평균, 0~5 (평가자별 점수 공개) | 7 | 에어비앤비 후기·정책 뉴스·스마트 스피커 발화 | 26,988 + 33,735 |
| STS-B | 영어 | 546쌍 (dev에서 등급별 층화 550, 손상 4쌍 제외) | 평균, 0~5 | 5 | 캡션·뉴스·포럼 | 28,392 + 28,392 |
자료에서 확인한 두 가지 (교수님 질문 5·6에 대한 답)
반올림 규칙 불일치. 문항 파일을 만들 때 KorSTS·STS-B는 파이썬 round()(짝수 반올림), KLUE-STS는 int(x+0.5)(반올림)로 등급을 매겨 .5 경계 21쌍의 등급이 갈렸다. 새 분석은 연속 점수를 그대로 쓰므로 결과에 영향이 없고, 원고 부록 D에 투명하게 적었다.
STS-B 손상 4문항. 원본 파일을 읽을 때 뒤따르는 줄이 문장 2에 붙거나 문장 2가 비는 손상이 생긴 stsb-0049 · 0279 · 0322 · 0361을 모든 분석에서 제외했다(550 → 546). 부록 표 D.1.
KLUE-STS가 갖는 별도의 쓸모
평가자 7명의 개별 점수가 공개되어 있어 사람들이 한 문항에서 얼마나 갈렸는지를 직접 셀 수 있다. 이 자료에서만 난이도를 사람의 불일치로도 정의한다(표 11 아래 세 줄). 배심원 자신의 불일치로 난이도를 정하면 같은 표로 기준도 정하고 성적도 매기는 순환이 되므로 쓰지 않는다.
원고 4절의 표 3~12와 그림 1~6을 같은 번호로 옮겼다. 값은 사람 연속 점수와의 스피어만 ρ, 배심원 = 13개 점수의 평균 집계, 구간은 문항 단위 쌍 부트스트랩 1,000회 95%. 부록 표 B.1·B.2(모델별 ρ·r, 앵커 조건), C.1(라운드별 모델), D.1(제외 문항)은 이 절 끝에 있다.
앵커 없는 6칸 모두에서 배심원의 ρ가 모든 개별 모델을 넘고 14명 중 1위다. 앵커 조건 2개를 더한 12칸에서도 같다(부록 표 B.2). 배심원 − 최고 단일 모델의 쌍 차이는 모든 칸에서 양수이고 구간이 0을 비껴간다. 피어슨 r도 같은 순서를 준다.
| 코퍼스 | 조건 | 13개 개별 ρ 평균 | 최고 단일 모델 ρ | 배심원 ρ (13개 평균) [95% CI] | 배심원 − 최고 단일 [95% CI] | 14명 중 순위 | 배심원 피어슨 r | 중앙값 집계 ρ |
|---|---|---|---|---|---|---|---|---|
| KorSTS | 루브릭 없음 | 0.760 | 0.815 (gpt-4o-mini) | 0.852 [0.835, 0.868] | +0.038 [+0.027, +0.049] | 1 | 0.852 | 0.822 |
| KorSTS | 루브릭 | 0.786 | 0.831 (GLM-5.3-Flash) | 0.873 [0.857, 0.886] | +0.042 [+0.029, +0.055] | 1 | 0.873 | 0.846 |
| KLUE-STS | 루브릭 없음 | 0.784 | 0.843 (gpt-oss-120b) | 0.866 [0.841, 0.888] | +0.023 [+0.002, +0.045] | 1 | 0.838 | 0.855 |
| KLUE-STS | 루브릭 | 0.808 | 0.857 (gemma-3-27b) | 0.883 [0.862, 0.902] | +0.026 [+0.007, +0.046] | 1 | 0.867 | 0.867 |
| STS-B | 루브릭 없음 | 0.806 | 0.875 (solar-pro4) | 0.893 [0.870, 0.911] | +0.019 [+0.006, +0.031] | 1 | 0.884 | 0.861 |
| STS-B | 루브릭 | 0.836 | 0.878 (solar-pro4) | 0.915 [0.897, 0.930] | +0.037 [+0.024, +0.049] | 1 | 0.903 | 0.866 |

집계 규칙. 평균이 중앙값을 모든 칸에서 이긴다(표 4, ρ +0.012~+0.049). 정수 13개의 중앙값은 정수라 많은 문항이 동점이 되지만, 평균은 1/13 단위로 갈라 사람 점수의 미세한 순서를 따라간다. STS-B에서는 중앙값 배심원이 최고 단일 모델을 간신히 넘지 못하는데(0.861 vs 0.875) 평균 배심원은 +0.019로 넘는다.
| 코퍼스 | 조건 | 중앙값 ρ | 평균 ρ | 평균 − 중앙값 |
|---|---|---|---|---|
| KorSTS | 루브릭 없음 | 0.822 | 0.852 | +0.030 |
| KorSTS | 루브릭 | 0.846 | 0.873 | +0.027 |
| KLUE-STS | 루브릭 없음 | 0.855 | 0.866 | +0.012 |
| KLUE-STS | 루브릭 | 0.867 | 0.883 | +0.017 |
| STS-B | 루브릭 없음 | 0.861 | 0.893 | +0.032 |
| STS-B | 루브릭 | 0.866 | 0.915 | +0.049 |
2개 이상 조합 8,178개 중 8,018개(98%), 7,504개(92%), 7,048개(86%)가 무루브릭에서 최고 단일 모델을 넘고, 루브릭에서는 96~99%다(표 5). 최고 ρ는 1개에서 5개까지 가파르게 오르고 5~9개에서 평평하며, 그 뒤 가장 약한 모델을 더하면 조금 내려간다(그림 2). 크기 7의 합의 조합 exaone-3.5 + gpt-4o-mini + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B는 무루브릭 0.860 / 0.879 / 0.902, 루브릭 0.875 / 0.886 / 0.916. 중앙값 집계의 합의 조합은 0.02~0.04 낮고 STS-B에서는 최고 단일 모델을 거의 넘지 못한다.
| 조건 | 집계 | 크기 | 합의 조합 (세 코퍼스 평균 ρ 최대) | ρ KorSTS / KLUE-STS / STS-B | 최고 단일 모델을 넘는가 |
|---|---|---|---|---|---|
| 루브릭 없음 | 평균 | 5 | exaone-3.5, gpt-4o-mini, gpt-oss-120b, solar-pro4, Qwen3.5-9B | 0.854 / 0.876 / 0.902 | 예 / 예 / 예 |
| 루브릭 없음 | 평균 | 7 | exaone-3.5, gpt-4o-mini, gpt-oss-120b, solar-pro4, GLM-5.3-Flash, DeepSeek-V4-Flash, Qwen3.5-9B | 0.860 / 0.879 / 0.902 | 예 / 예 / 예 |
| 루브릭 없음 | 평균 | 9 | exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, solar-pro4, GLM-5.3-Flash, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B | 0.860 / 0.881 / 0.898 | 예 / 예 / 예 |
| 루브릭 없음 | 평균 | 11 | gemini-2.5-flash, exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B | 0.858 / 0.880 / 0.898 | 예 / 예 / 예 |
| 루브릭 없음 | 중앙값 | 5 | exaone-3.5, gpt-4o-mini, solar-pro4, gemma-3-27b, Qwen3.5-9B | 0.828 / 0.860 / 0.880 | 예 / 예 / 예 |
| 루브릭 없음 | 중앙값 | 7 | exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, solar-pro4, gemma-3-27b, Qwen3.5-9B | 0.828 / 0.865 / 0.871 | 예 / 예 / 아니오 |
| 루브릭 없음 | 중앙값 | 9 | gemini-2.5-flash, exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, llama-3.1, solar-pro4, gemma-3-27b, Qwen3.5-9B | 0.824 / 0.860 / 0.869 | 예 / 예 / 아니오 |
| 루브릭 없음 | 중앙값 | 11 | exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, llama-3.1, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B | 0.827 / 0.859 / 0.864 | 예 / 예 / 아니오 |
| 루브릭 | 평균 | 5 | exaone-3.5, solar-pro4, GLM-5.3-Flash, DeepSeek-V4-Flash, Qwen3.5-9B | 0.872 / 0.885 / 0.916 | 예 / 예 / 예 |
| 루브릭 | 평균 | 7 | exaone-3.5, gpt-oss-120b, solar-pro4, GLM-5.3-Flash, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B | 0.876 / 0.888 / 0.914 | 예 / 예 / 예 |
| 루브릭 | 평균 | 9 | exaone-3.5, gpt-4o-mini, gpt-oss-120b, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B | 0.877 / 0.891 / 0.914 | 예 / 예 / 예 |
| 루브릭 | 평균 | 11 | gemini-2.5-flash, gemma-4, exaone-3.5, gpt-4o-mini, gpt-oss-120b, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B | 0.875 / 0.890 / 0.915 | 예 / 예 / 예 |
| 루브릭 | 중앙값 | 5 | gpt-4o-mini, claude-haiku-4.5, GLM-5.3-Flash, gemma-3-27b, Qwen3.5-9B | 0.850 / 0.872 / 0.873 | 예 / 예 / 아니오 |
| 루브릭 | 중앙값 | 7 | exaone-3.5, gpt-4o-mini, llama-3.1, solar-pro4, GLM-5.3-Flash, DeepSeek-V4-Flash, Qwen3.5-9B | 0.849 / 0.868 / 0.878 | 예 / 예 / 아니오 |
| 루브릭 | 중앙값 | 9 | exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B | 0.850 / 0.874 / 0.867 | 예 / 예 / 아니오 |
| 루브릭 | 중앙값 | 11 | gemini-2.5-flash, gemma-4, exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B | 0.848 / 0.866 / 0.872 | 예 / 예 / 아니오 |

| 조건 | 고른 코퍼스 | 그 코퍼스의 최적 조합 | 고른 코퍼스 ρ | 나머지 두 코퍼스 ρ vs 그곳의 최고 단일 모델 |
|---|---|---|---|---|
| 루브릭 없음 | KorSTS | exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, DeepSeek-V4-Flash, Qwen3.5-9B | 0.860 | KLUE-STS 0.880 vs 0.843 (넘음); STS-B 0.899 vs 0.875 (넘음) |
| 루브릭 없음 | KLUE-STS | exaone-3.5, gpt-4o-mini, gpt-oss-120b, claude-haiku-4.5, GLM-5.3-Flash, gemma-3-27b, Qwen3.5-9B | 0.884 | KorSTS 0.859 vs 0.815 (넘음); STS-B 0.891 vs 0.875 (넘음) |
| 루브릭 없음 | STS-B | exaone-3.5, gpt-oss-120b, solar-pro4, DeepSeek-V4-Flash, Qwen3.5-9B | 0.904 | KorSTS 0.852 vs 0.815 (넘음); KLUE-STS 0.874 vs 0.843 (넘음) |
| 루브릭 | KorSTS | exaone-3.5, gpt-4o-mini, gpt-oss-120b, solar-pro4, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B | 0.877 | KLUE-STS 0.891 vs 0.857 (넘음); STS-B 0.914 vs 0.878 (넘음) |
| 루브릭 | KLUE-STS | gemini-2.5-flash, exaone-3.5, gpt-4o-mini, gpt-oss-120b, GLM-5.3-Flash, Kimi-K2.6, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B | 0.893 | KorSTS 0.874 vs 0.831 (넘음); STS-B 0.910 vs 0.878 (넘음) |
| 루브릭 | STS-B | gemini-2.5-flash, gemma-4, exaone-3.5, gpt-4o-mini, gpt-oss-120b, llama-3.1, solar-pro4, GLM-5.3-Flash, DeepSeek-V4-Flash, Qwen3.5-9B | 0.917 | KorSTS 0.871 vs 0.831 (넘음); KLUE-STS 0.880 vs 0.857 (넘음) |
저가 배심원. 입력 $0.10/1M 이하이거나 로컬인 8개(8B 3개, solar-pro4, GLM-5.3-Flash, gemma-3-27b, DeepSeek-V4-Flash, Qwen3.5-9B)로 제한하면 최고 5모델 조합 exaone-3.5 + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B가 무루브릭 0.854 / 0.871 / 0.901, 루브릭 0.872 / 0.885 / 0.916으로 전체 최적과 0.01 이내이고 모든 코퍼스에서 최고 단일 모델을 넘는다. 로컬 3개만으로는 넘지 못한다. 구성원을 병렬로 부르므로 지연은 가장 느린 구성원이 정하고, 합의 7모델 조합의 구성원은 모두 입력 $0.30/1M 이하다.
루브릭은 개별 평균 ρ를 세 코퍼스 모두 올리고(+0.027 / +0.023 / +0.030, 구간 모두 0을 비껴감) 배심원도 올린다(+0.021 / +0.017 / +0.022; 표 7). 13개 중 13 / 11 / 12개 모델이 오른다. 최고 단일 모델은 KorSTS에서만 확실히 오르는데, 다른 두 코퍼스에서는 이미 풀의 천장 근처였기 때문이다. 루브릭이 있으면 조합의 96~99%가 최고 단일 모델을 넘는다.
| 코퍼스 | 루브릭: 개별 평균 Δρ [95% CI] | 루브릭: 최고 단일 Δρ [95% CI] | 루브릭: 배심원 Δρ [95% CI] | 무작위 앵커: 개별 평균 Δρ | 무작위 앵커: 배심원 Δρ [95% CI] | 앵커+루브릭: 개별 평균 Δρ | 앵커+루브릭: 배심원 Δρ [95% CI] |
|---|---|---|---|---|---|---|---|
| KorSTS | +0.027 [+0.021, +0.034] | +0.017 [+0.003, +0.030] | +0.021 [+0.015, +0.027] | −0.097 | −0.052 [−0.067, −0.038] | −0.054 | −0.030 [−0.040, −0.020] |
| KLUE-STS | +0.023 [+0.014, +0.033] | +0.014 [−0.005, +0.028] | +0.017 [+0.005, +0.029] | −0.078 | −0.032 [−0.054, −0.010] | −0.035 | −0.008 [−0.022, +0.006] |
| STS-B | +0.030 [+0.021, +0.038] | +0.004 [−0.008, +0.017] | +0.022 [+0.014, +0.030] | −0.043 | −0.015 [−0.027, −0.003] | −0.023 | −0.008 [−0.017, +0.001] |
무작위 앵커는 무루브릭에서 개별 평균 ρ를 0.097 / 0.078 / 0.043, 배심원을 0.052 / 0.032 / 0.015 내리고 구간이 모두 0을 비껴간다(표 7, 그림 3). 무앵커 점수가 앵커와 달랐던 판정 중 45% / 41% / 25%가 앵커 쪽으로, 3% / 2% / 3%가 반대쪽으로 움직였다(표 8). 새로 더한 6개 모델은 기존 7개보다 더 세게 끌렸다. 루브릭은 끌림을 18~32%로 줄이고 상관 손실을 절반쯤으로 낮추지만 없애지는 못한다(루브릭 있어도 배심원 −0.030 / −0.008 / −0.008). 배심원은 구성원 평균보다 덜 잃는다. 구성원이 서로 다른 정도로 끌려 평균이 일부 상쇄하기 때문이지만, 앵커를 벗어나지는 못한다.
| 코퍼스 | 조건 | 문항 | 앵커 쪽으로 (%) | 반대쪽으로 (%) | 그대로 (%) | 앵커 쪽, 기존 7 / 추가 6 (%) |
|---|---|---|---|---|---|---|
| KorSTS | 루브릭 없음 | 1,379 | 44.7 | 2.7 | 52.6 | 38.5 / 52.2 |
| KorSTS | 루브릭 | 1,379 | 31.8 | 3.5 | 64.7 | 24.9 / 39.9 |
| KLUE-STS | 루브릭 없음 | 519 | 40.9 | 2.0 | 57.1 | 37.9 / 44.3 |
| KLUE-STS | 루브릭 | 519 | 27.4 | 2.1 | 70.4 | 22.9 / 32.6 |
| STS-B | 루브릭 없음 | 546 | 25.4 | 3.0 | 71.6 | 25.5 / 25.4 |
| STS-B | 루브릭 | 546 | 18.0 | 5.0 | 77.0 | 19.2 / 16.6 |

점수 전에 근거를 쓰게 한 1라운드는 배심원 ρ를 거의 바꾸지 않았다(무루브릭 +0.010 / −0.004 / 0.000). 다른 모델들의 점수·근거를 읽은 2라운드에서는 판정의 23~30%가 바뀌었고, 그중 98~99%가 다른 모델들의 직전 평균 쪽으로 움직였다(표 10). 불일치가 무너졌다. 문항 내 13개 점수의 표준편차는 0.47~0.59에서 0.22~0.34로, 만장일치 문항은 4~16%에서 21~45%로. 개별 평균 ρ는 올랐지만(+0.017~+0.033) 이는 가장 약한 모델들이 끌어올린 것이다. 1라운드 ρ 하위 4개는 +0.067~+0.082, 상위 4개는 −0.024~+0.007(부록 표 C.1). 그런데 배심원의 ρ는 세 코퍼스 모두 내려갔다(0.015 / 0.032 / 0.030, 구간이 0을 비껴감). 합의 7모델 조합도 같다(그림 4). 바뀐 판정 중 사람 점수에 가까워진 것은 33~41%, 멀어진 것은 58~67%다.
루브릭은 배심원을 지키지 못했다. 루브릭이 있어도 1→2라운드에서 0.015 / 0.034 / 0.029를 잃었다(표 9). KLUE-STS 3라운드는 만장일치를 72%, 문항 내 표준편차를 0.10까지 밀었지만 배심원 ρ는 2라운드 자리에 머물렀고(0.831 → 0.835, 구간 [−0.013, +0.021]) 합의 조합은 더 내려갔다(0.857 → 0.839). 의견 교환은 배심원을 다수의 견해로 수렴시킨다. 약한 모델은 이를 받아들여 이득을 보고, 강한 모델은 손해를 본다. 평균이 상쇄해 주던 독립적 오류가 더 이상 독립적이지 않다(그림 5).
| 조건 | 코퍼스 | 개별 평균 ρ | 최고 단일 ρ | 배심원 ρ (13개 평균) | 14명 중 순위 | 합의 7모델 ρ | 배심원 R2 − R1 [95% CI] |
|---|---|---|---|---|---|---|---|
| 루브릭 없음 | KorSTS | 0.760 → 0.760 → 0.793 | 0.815 → 0.821 → 0.823 | 0.852 → 0.863 → 0.848 | 1 → 1 → 1 | 0.860 → 0.866 → 0.850 | −0.015 [−0.020, −0.008] |
| 루브릭 없음 | KLUE-STS | 0.784 → 0.769 → 0.798 → 0.814 | 0.843 → 0.842 → 0.842 → 0.835 | 0.866 → 0.862 → 0.831 → 0.835 | 1 → 1 → 5 → 2 | 0.879 → 0.879 → 0.857 → 0.839 | −0.032 [−0.049, −0.015] |
| 루브릭 없음 | STS-B | 0.806 → 0.807 → 0.823 | 0.875 → 0.865 → 0.844 | 0.893 → 0.893 → 0.863 | 1 → 1 → 1 | 0.902 → 0.900 → 0.862 | −0.030 [−0.040, −0.020] |
| 루브릭 | KorSTS | 0.786 → 0.780 → 0.809 | 0.831 → 0.813 → 0.829 | 0.873 → 0.872 → 0.857 | 1 → 1 → 1 | 0.875 → 0.869 → 0.858 | −0.015 [−0.022, −0.009] |
| 루브릭 | KLUE-STS | 0.808 → 0.804 → 0.821 | 0.857 → 0.844 → 0.850 | 0.883 → 0.877 → 0.844 | 1 → 1 → 2 | 0.886 → 0.880 → 0.870 | −0.034 [−0.054, −0.017] |
| 루브릭 | STS-B | 0.836 → 0.834 → 0.840 | 0.878 → 0.860 → 0.859 | 0.915 → 0.906 → 0.877 | 1 → 1 → 1 | 0.916 → 0.901 → 0.877 | −0.029 [−0.042, −0.016] |
| 조건 | 코퍼스 | 단계 | 문항 내 13개 점수 SD | 만장일치 문항 (%) | 변경된 판정 (%) | 변경 중 다른 모델 쪽으로 (%) | 변경 중 사람에 가까워짐 / 멀어짐 (%) | 평균 점수 (사람 평균) |
|---|---|---|---|---|---|---|---|---|
| 루브릭 없음 | KorSTS | R1 → R2 | 0.59 → 0.34 | 5 → 21 | 30 | 98 | 41 / 58 | 3.66 → 3.78 (2.61) |
| 루브릭 없음 | KLUE-STS | R1 → R2 | 0.49 → 0.27 | 16 → 35 | 23 | 98 | 33 / 67 | 4.09 → 4.19 (2.48) |
| 루브릭 없음 | KLUE-STS | R2 → R3 | 0.27 → 0.10 | 35 → 72 | 11 | 100 | 40 / 59 | 4.19 → 4.22 (2.48) |
| 루브릭 없음 | STS-B | R1 → R2 | 0.47 → 0.22 | 4 → 45 | 28 | 99 | 40 / 60 | 3.83 → 3.96 (2.86) |
| 루브릭 | KorSTS | R1 → R2 | 0.55 → 0.32 | 5 → 32 | 30 | 96 | 40 / 58 | 3.67 → 3.78 (2.61) |
| 루브릭 | KLUE-STS | R1 → R2 | 0.46 → 0.25 | 9 → 43 | 23 | 96 | 33 / 67 | 4.05 → 4.15 (2.48) |
| 루브릭 | STS-B | R1 → R2 | 0.43 → 0.21 | 9 → 47 | 25 | 98 | 38 / 62 | 3.82 → 3.94 (2.86) |


사람 점수 구간 안에서는 범위 제한으로 상관이 낮아지지만 심판들의 순서는 유지된다. 배심원은 무루브릭에서 코퍼스 × 구간 9칸 중 7칸에서 최고 단일 모델을 넘고 9칸 모두에서 개별 평균을 넘는다(표 11, 그림 6). 모델들의 위쪽 치우침이 점수를 압축하는 KLUE-STS 높은 구간이 모든 심판에게 가장 약한 칸이다. KLUE-STS 평가자 불일치 하·중·상위 3분위에서 배심원의 최고 단일 모델 대비 여유는 −0.003 / +0.072 / +0.012.
| 코퍼스 | 구간 | n | 구간 내 사람 점수 SD | 최고 단일 모델(전체) ρ | 개별 평균 ρ | 배심원 ρ (13개 평균) | 합의 7모델 ρ |
|---|---|---|---|---|---|---|---|
| KorSTS | 낮음 (0~1.67) | 407 | 0.54 | 0.548 | 0.566 | 0.675 | 0.672 |
| KorSTS | 중간 (1.67~3.33) | 438 | 0.47 | 0.464 | 0.411 | 0.525 | 0.531 |
| KorSTS | 높음 (3.33~5) | 534 | 0.54 | 0.365 | 0.302 | 0.449 | 0.461 |
| KLUE-STS | 낮음 (0~1.67) | 178 | 0.48 | 0.532 | 0.419 | 0.515 | 0.510 |
| KLUE-STS | 중간 (1.67~3.33) | 165 | 0.49 | 0.495 | 0.362 | 0.506 | 0.521 |
| KLUE-STS | 높음 (3.33~5) | 176 | 0.47 | 0.060 | 0.203 | 0.321 | 0.376 |
| STS-B | 낮음 (0~1.67) | 129 | 0.58 | 0.625 | 0.650 | 0.756 | 0.739 |
| STS-B | 중간 (1.67~3.33) | 185 | 0.50 | 0.521 | 0.386 | 0.499 | 0.503 |
| STS-B | 높음 (3.33~5) | 232 | 0.55 | 0.523 | 0.449 | 0.653 | 0.704 |
| KLUE-STS, 평가자 불일치 | 낮음 | 198 | 1.84 | 0.885 | 0.838 | 0.882 | 0.893 |
| KLUE-STS, 평가자 불일치 | 중간 | 149 | 1.40 | 0.802 | 0.779 | 0.874 | 0.869 |
| KLUE-STS, 평가자 불일치 | 높음 | 172 | 0.98 | 0.719 | 0.624 | 0.731 | 0.754 |

| 가설 | 예측 | 결과 | 근거 |
|---|---|---|---|
| 가설 1 배심원 | 배심원의 ρ가 모든 개별 모델을 넘는다 | 지지 | 코퍼스 × 조건 12칸 중 12칸에서 14명 중 1위; 앵커 없는 모든 칸에서 배심원 − 최고 단일 > 0, 구간이 0을 비껴감 (표 3, 부록 B) |
| 가설 2 루브릭 | 루브릭이 개별과 배심원의 ρ를 올린다 | 지지 | 개별 평균 +0.023~+0.030; 배심원 +0.017~+0.022; 모든 구간이 0을 비껴감 (표 7) |
| 가설 3 앵커 | 무작위 앵커가 ρ를 내리고 판정을 끌어당긴다 | 지지 | 개별 평균 −0.097~−0.043; 배심원 −0.052~−0.015; 움직일 수 있는 판정의 25~45%가 앵커 쪽으로 (표 7~8) |
| 가설 4 의견 교환 | 점수·근거 공유는 의견을 수렴시키지만 배심원의 ρ를 올리지 않는다 | 지지 | 만장일치 4~16% → 21~45%; 배심원 ρ가 조건 × 코퍼스 6칸 모두 하락, 3라운드에도 회복 없음 (표 9~10) |
| 모델 | KorSTS 무루브릭 ρ / r | KorSTS 루브릭 ρ / r | KLUE-STS 무루브릭 ρ / r | KLUE-STS 루브릭 ρ / r | STS-B 무루브릭 ρ / r | STS-B 루브릭 ρ / r |
|---|---|---|---|---|---|---|
| gemini-2.5-flash | 0.740 / 0.759 | 0.789 / 0.796 | 0.751 / 0.693 | 0.831 / 0.794 | 0.809 / 0.820 | 0.849 / 0.851 |
| gemma-4 (8B) | 0.685 / 0.696 | 0.776 / 0.770 | 0.778 / 0.742 | 0.813 / 0.777 | 0.764 / 0.765 | 0.825 / 0.813 |
| exaone-3.5 (7.8B) | 0.795 / 0.803 | 0.798 / 0.806 | 0.822 / 0.800 | 0.828 / 0.804 | 0.859 / 0.865 | 0.853 / 0.859 |
| gpt-4o-mini | 0.815 / 0.822 | 0.815 / 0.814 | 0.841 / 0.828 | 0.850 / 0.843 | 0.851 / 0.857 | 0.864 / 0.866 |
| gpt-oss-120b | 0.785 / 0.791 | 0.798 / 0.788 | 0.843 / 0.792 | 0.828 / 0.791 | 0.818 / 0.822 | 0.827 / 0.821 |
| claude-haiku-4.5 | 0.811 / 0.824 | 0.813 / 0.816 | 0.837 / 0.813 | 0.849 / 0.825 | 0.811 / 0.827 | 0.854 / 0.864 |
| llama-3.1 (8B) | 0.478 / 0.443 | 0.552 / 0.573 | 0.537 / 0.516 | 0.501 / 0.494 | 0.592 / 0.597 | 0.673 / 0.658 |
| solar-pro4 | 0.809 / 0.817 | 0.825 / 0.828 | 0.832 / 0.796 | 0.834 / 0.826 | 0.875 / 0.880 | 0.878 / 0.885 |
| GLM-5.3-Flash | 0.801 / 0.801 | 0.831 / 0.824 | 0.804 / 0.742 | 0.841 / 0.800 | 0.789 / 0.790 | 0.856 / 0.857 |
| Kimi-K2.6 | 0.793 / 0.796 | 0.803 / 0.792 | 0.802 / 0.744 | 0.840 / 0.769 | 0.808 / 0.819 | 0.824 / 0.827 |
| gemma-3-27b | 0.800 / 0.811 | 0.822 / 0.828 | 0.818 / 0.788 | 0.857 / 0.834 | 0.802 / 0.821 | 0.849 / 0.859 |
| DeepSeek-V4-Flash | 0.780 / 0.767 | 0.794 / 0.801 | 0.724 / 0.687 | 0.801 / 0.755 | 0.837 / 0.821 | 0.846 / 0.846 |
| Qwen3.5-9B | 0.784 / 0.795 | 0.807 / 0.812 | 0.807 / 0.766 | 0.825 / 0.813 | 0.861 / 0.865 | 0.870 / 0.874 |
| 배심원 (13개 평균) | 0.852 / 0.852 | 0.873 / 0.873 | 0.866 / 0.838 | 0.883 / 0.867 | 0.893 / 0.884 | 0.915 / 0.903 |
| 모델 | KorSTS 앵커 / 앵커+루브릭 ρ | KLUE-STS 앵커 / 앵커+루브릭 ρ | STS-B 앵커 / 앵커+루브릭 ρ | 응답 시간 중앙값 (초) |
|---|---|---|---|---|
| gemini-2.5-flash | 0.745 / 0.800 | 0.770 / 0.836 | 0.831 / 0.837 | 1.0 |
| gemma-4 (8B) | 0.704 / 0.759 | 0.753 / 0.814 | 0.644 / 0.798 | 1.1 |
| exaone-3.5 (7.8B) | 0.569 / 0.777 | 0.601 / 0.792 | 0.829 / 0.834 | 0.4 |
| gpt-4o-mini | 0.672 / 0.710 | 0.752 / 0.788 | 0.703 / 0.801 | 0.7 |
| gpt-oss-120b | 0.740 / 0.796 | 0.795 / 0.826 | 0.746 / 0.828 | 0.4 |
| claude-haiku-4.5 | 0.749 / 0.787 | 0.758 / 0.849 | 0.833 / 0.847 | 0.8 |
| llama-3.1 (8B) | 0.328 / 0.538 | 0.334 / 0.484 | 0.480 / 0.561 | 0.7 |
| solar-pro4 | 0.663 / 0.716 | 0.707 / 0.777 | 0.866 / 0.874 | 0.4 |
| GLM-5.3-Flash | 0.794 / 0.821 | 0.821 / 0.844 | 0.813 / 0.857 | 2.2 |
| Kimi-K2.6 | 0.763 / 0.763 | 0.793 / 0.775 | 0.837 / 0.846 | 1.2 |
| gemma-3-27b | 0.714 / 0.788 | 0.728 / 0.827 | 0.759 / 0.832 | 1.0 |
| DeepSeek-V4-Flash | 0.424 / 0.696 | 0.578 / 0.710 | 0.723 / 0.818 | 1.0 |
| Qwen3.5-9B | 0.751 / 0.570 | 0.792 / 0.723 | 0.847 / 0.842 | 0.5 |
| 배심원 (13개 평균) | 0.800 / 0.843 | 0.834 / 0.875 | 0.878 / 0.907 | — |
| 배심원 14명 중 순위 | 1 / 1 | 1 / 1 | 1 / 1 | — |
| 모델 | KorSTS 기준 → R1 → R2 | KLUE-STS 기준 → R1 → R2 | STS-B 기준 → R1 → R2 |
|---|---|---|---|
| gemini-2.5-flash | 0.740 → 0.718 → 0.774 | 0.751 → 0.657 → 0.726 | 0.809 → 0.737 → 0.778 |
| gemma-4 (8B) | 0.685 → 0.724 → 0.804 | 0.778 → 0.766 → 0.831 | 0.764 → 0.759 → 0.837 |
| exaone-3.5 (7.8B) | 0.795 → 0.760 → 0.787 | 0.822 → 0.801 → 0.831 | 0.859 → 0.853 → 0.825 |
| gpt-4o-mini | 0.815 → 0.794 → 0.823 | 0.841 → 0.837 → 0.842 | 0.851 → 0.834 → 0.840 |
| gpt-oss-120b | 0.785 → 0.793 → 0.812 | 0.843 → 0.839 → 0.819 | 0.818 → 0.804 → 0.834 |
| claude-haiku-4.5 | 0.811 → 0.817 → 0.808 | 0.837 → 0.842 → 0.841 | 0.811 → 0.833 → 0.844 |
| llama-3.1 (8B) | 0.478 → 0.522 → 0.639 | 0.537 → 0.484 → 0.622 | 0.592 → 0.708 → 0.809 |
| solar-pro4 | 0.809 → 0.806 → 0.814 | 0.832 → 0.824 → 0.837 | 0.875 → 0.865 → 0.828 |
| GLM-5.3-Flash | 0.801 → 0.778 → 0.817 | 0.804 → 0.756 → 0.811 | 0.789 → 0.803 → 0.812 |
| Kimi-K2.6 | 0.793 → 0.794 → 0.806 | 0.802 → 0.794 → 0.804 | 0.808 → 0.836 → 0.825 |
| gemma-3-27b | 0.800 → 0.789 → 0.816 | 0.818 → 0.805 → 0.819 | 0.802 → 0.781 → 0.832 |
| DeepSeek-V4-Flash | 0.780 → 0.821 → 0.821 | 0.724 → 0.827 → 0.807 | 0.837 → 0.863 → 0.841 |
| Qwen3.5-9B | 0.784 → 0.769 → 0.792 | 0.807 → 0.768 → 0.792 | 0.861 → 0.811 → 0.801 |
| 문항 | 손상 | 길이 변화 |
|---|---|---|
| stsb-0049 | 뒤따르는 7줄이 문장 2에 붙음 | 75 → 1,871자 |
| stsb-0322 | 뒤따르는 11줄이 문장 2에 붙음 | 135 → 2,405자 |
| stsb-0279 | 뒤따르는 줄이 문장 2에 붙음 | 87 → 244자 |
| stsb-0361 | 두 문장이 필드 1에, 문장 2 비어 있음 | 문장 2: 0자 |
판정 원자료 260,923건(근거 텍스트 포함)·프롬프트·집계·조합 탐색·부트스트랩·그림 코드·결과 표를 담은 익명 재현 패키지: repro_package_v10.zip (18 MB). API 키와 서버 정보는 포함하지 않는다.
2026-09-16 교수님 의논 이후 일주일 동안 지표·집계·앵커·모델 수·가설을 바꾸고 원고 v10까지 마쳤다. 그 전(9월 9~14일)의 일은 11 이전 기록에 있다.
09-16 · 서열상관 재분석
지표를 정확일치 → 스피어만 ρ(피어슨 병기), 배심원을 중앙값 → 평균으로 바꿔 7모델 판정을 다시 계산. 등급 변환 불일치·STS-B 손상 4문항 확인. 정답+1 앵커 폐기, 무작위 앵커 결과 정리.
09-17 · 6모델 추가 → 13모델
solar-pro4·GLM-5.3-Flash·Kimi-K2.6·gemma-3-27b·DeepSeek-V4-Flash·Qwen3.5-9B 판정 58,752건 수집(4조건). 13모델 조합 8,191개 전수 탐색, 코퍼스 교차 검증, 홀수 크기 5·7·9·11 합의 조합, 저가 조합.
09-18 · 의견 교환(델파이) 실험
13모델 × 2,444쌍, 무루브릭·루브릭 각 2라운드 + KLUE-STS 3라운드 = 판정 133,835건. 수렴 지표·라운드별 ρ·부트스트랩 구간.
09-19 · 원고 v10 (영문, IP&M)
서론부터 새로 씀. 가설 1~4, 표 12, 그림 6(300 dpi), 부록 A~D, 참고문헌 36편. 익명 원고·제목 페이지 분리, 투고 체크리스트 점검.
09-19 · 재현 패키지 v10
문항 파일·판정 260,923건·프롬프트·코드·결과·그림·README, 122파일 151 MB(zip 18 MB). 경로·키·서버명 익명화, 검사 0건.
09-20~23 · 발표 자료
국문 10장 슬라이드·발표 스크립트(PDF). 슬라이드 8에 라운드 수렴 표 추가.
09-23 · 포털 v10 개편
이 페이지. 00~09를 원고 v10 흐름으로 다시 쓰고 옛 페이지를 11절에 보존.
분석과 원고는 끝났다. 남은 것은 교수님 확정과 투고 절차다.
제목 확정 (교수님 상의)
가제 「Independent Votes Beat the Best Judge: Rank Correlation with Human Similarity Ratings for LLM Juries, Rubrics, Random Anchors and Deliberation」. 확정되면 원고·제목 페이지·슬라이드·이 포털을 한 번에 고친다.
OSF 기탁
재현 패키지를 OSF에 올려 익명 열람 링크를 받고 원고의 자료 가용성 문구 자리에 넣는다.
저자 정보·선언문
제목 페이지의 저자·소속·교신 정보, 이해관계·AI 사용 선언, 커버레터.
투고
Information Processing & Management (SCIE/SSCI). 국문 논문은 쓰지 않는다(2026-09-02 결정).
APA 7판 형식, 영문 알파벳순. 원고 본문에서 인용한 문헌만 남겼다.
교수님 피드백을 받을 때마다 확인한 사실과 다시 계산한 결과를 날짜별로 남긴다. 정해진 내용은 본문(03 가설·04 방법·06 결과)과 원고 v10에 반영했고, 여기에는 이력과 상세 페이지를 둔다.
2026-09-09~14의 설계(7모델 · 정확일치 · 중앙값 투표 · 정답+1 앵커 · 난이도–이득 가설)로 쓴 페이지들이다. 결론이 지금과 다르지만(당시: 중앙값 투표는 개별 모델을 못 이긴다) 연구가 어떻게 바뀌어 왔는지를 보여 주므로 지우지 않고 그대로 둔다. 링크는 예전 그대로 열린다.
포털 v7 · 2026-09-18까지의 첫 화면
LLM 배심원 연구 (v7 포털)
7모델·정확일치·중앙값 투표 기준의 00~10절 전체. 다국면 Rasch, 등급별 배심원 이득, 개별 모델 정확일치 표가 여기에 있다.
열기 →
논문 해설 노트 · 2026-09-09
LLM 배심원을 어떻게 사용해야 할까? — 난이도·루브릭·앵커로 본 중앙값 투표의 조건
원고 v7 「Do LLM Juries Beat Their Own Members?」의 논리를 12개 절로 푼 해설. H1 기각·H2 지지·H3 부분 지지.
열기 →
추가 분석 노트 · 2026-09-14
배심원을 살리는 조건 — 치우침을 빼고, 앵커를 정답과 떼어 놓으면
배심원이 진 이유(공통 위쪽 치우침)와 분위수 보정, 무작위 앵커 재실험. 무작위 앵커는 가설 3으로 이어졌고 보정은 v10에서 제외.
열기 →
교수님과의 의논 · 2026-09-16~18
교수님 질문 아홉 개에 대한 답 — 서열상관으로 다시 본 배심원
v7에서 v10으로 넘어온 근거 전부. 질문 (1)~(9)별 표·그래프, 13모델 조합, 가설 4 델파이 실험.
열기 →
v7 → v10에서 바뀐 것