← LLM 배심원 연구 포털  ·  추가 분석 노트  ·  논문 해설 노트 교수님과의 의논 · 2026-09-16
LLM 배심원 연구 · 교수님과의 의논검토용 · 논문 미반영

교수님 질문 아홉 개에 대한 답
— 서열상관으로 다시 본 배심원

2026-09-16 오전에 주신 말씀을 아홉 갈래로 나누고, 각 번호마다 확인한 사실과 다시 계산한 결과를 붙였습니다. 지표는 말씀대로 사람 연속 점수와의 서열상관(스피어만 ρ, 피어슨 r 병기)이고, 배심원은 모델 판정의 평균이며, 정수화와 보정은 쓰지 않았습니다. 머리글의 수치는 세 코퍼스 공통으로 고른 최적 조합의 성과입니다.

갱신 기록 · 9/17 추가 4번 13모델 조합 탐색, 크기 5·7·9·11 표, 8번 후보 6모델 결과 · 9/18 추가 10번 상호정보 교환 앵커(가설 4). 배지가 붙은 소제목이 새로 들어간 부분입니다.

2026-09-16 기준(13모델 부분은 2026-09-17 추가). 기존 판정(본실험 68,544건 + 무작위 앵커 34,272건)을 다시 계산했고, 8번의 후보 6모델 판정 58,752건을 새로 받았습니다. STS-B는 손상 4문항을 제외해 546쌍입니다. 스크립트 rankcorr_formal.py, 결과 rankcorr_formal.json, 검증 check_grade_conversion.py · check_stsb_corruption.py는 재현 패키지와 같은 폴더에 있습니다.

0한 장 요약

최적 조합(7모델 평균)의 ρ · 블라인드 (KorSTS / KLUE / STS-B)
0.860 / 0.879 / 0.902최고 단일 모델 0.815 / 0.843 / 0.875
같은 조합 · 루브릭
0.875 / 0.886 / 0.916최고 단일 모델 0.831 / 0.857 / 0.878
값싼 5모델 조합 · 블라인드
0.854 / 0.871 / 0.901exaone-3.5 7.8B + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B
무작위 앵커를 주면 (배심원 Δρ)
-0.04 / -0.04 / -0.03KorSTS / KLUE / STS-B · 모두 하락
세 줄

최적 조합으로 만든 배심원(exaone + gpt-4o-mini + gpt-oss + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B, 7모델 평균)은 사람 점수와의 순위상관에서 세 코퍼스 모두 어떤 단일 모델보다 높고, 루브릭을 주면 더 높아집니다. 이 조합은 한 코퍼스에서 고른 것이 아니라 세 코퍼스에 같은 조합을 쓴다는 조건으로 고른 것이라 다른 자료에도 그대로 갑니다.

지표를 정확일치에서 서열상관으로, 집계를 중앙값에서 평균으로 바꾼 것이 출발점입니다. 그 기준에서는 7모델 전부의 평균도, 후보 6모델을 더한 13모델 평균도 모든 조건에서 개별 모델을 제치고 1위이며, 값싼 모델만의 5모델 조합도 최고 단일 모델을 넘습니다.

정답+1 앵커는 서열상관을 올리고(정답 누설), 정답과 무관한 무작위 앵커는 개별 모델과 배심원 모두의 서열상관을 세 코퍼스에서 확실하게 떨어뜨립니다.

1원본은 0~5점인데 1~5등급으로 어떻게 바꿨나

교수님: 실제 원본은 0에서 5점인 것 같던데, 1에서 5점으로 어떻게 바꾼 건가요?

답: 사람 평균 점수를 반올림한 뒤 0점을 1등급으로 잘랐고, 그 등급으로 층화 표집했습니다.

본실험 문항 파일(korsts_items · klue_items · stsb_items)의 level 필드가 만들어진 방식. 원본 파일과 전수 대조해 확인했다.
코퍼스표본원본 점수적용된 변환예시0점 문항
KorSTStest 분할 1,379쌍평가자 5명 평균 0~5 (0.2 단위)round(점수) → 0은 1로2.4 → 2, 2.5 → 2, 2.6 → 3, 0.0 → 1112쌍
KLUE-STSdev 519쌍평가자 7명 평균 0~5int(점수 + 0.5) → 0은 1로2.4 → 2, 2.5 → 3, 2.6 → 30쌍 (최소 0.14)
STS-Bdev 1,500쌍 중 등급별 110쌍 = 550쌍평가자 5명 평균 0~5round(점수) → 0은 1로2.4 → 2, 2.5 → 2, 2.6 → 3, 0.0 → 132쌍

등급을 만든 이유는 두 가지였습니다. 등급별로 문항 수를 맞춰 표집하려는 것과, 모델의 1~5 정수 답과 같은 눈금에서 정확일치를 세려는 것입니다. 그런데 반올림 방식이 코퍼스마다 달랐다는 것을 이번에 확인했습니다(5번). 새 분석에서는 등급을 쓰지 않고 사람 점수를 연속값 그대로 씁니다.

2정확도 대신 사람 정답과의 서열상관으로, 등급 전환 과정은 빼고

교수님: 정확도보다는 인간 정답과의 서열상관성으로 보는 것이 맞는 것 같습니다. 인간 정답 수준으로 전환하는 과정은 넣지 말고 서열상관으로만 평가해 보세요.

결과: 배심원 평균이 세 코퍼스·모든 조건에서 8명 중 1위입니다.

사람 점수와의 스피어만 ρ개별 모델 7개와 배심원 평균 · 블라인드와 루브릭
ρ = 사람 연속 점수와의 스피어만 순위상관. 차이의 CI는 같은 문항을 다시 뽑는 짝 부트스트랩 1,000회. STS-B는 손상 4문항 제외(n = 546).
코퍼스조건최고 단일 모델 ρ배심원 평균 ρ [95% CI]차이 [95% CI]판정8명 중 순위
KorSTS블라인드0.815 (gpt-4o-mini)0.837 [0.816, 0.853]+0.022 [+0.011, +0.032]확실1위
KorSTS루브릭0.815 (gpt-4o-mini)0.860 [0.842, 0.874]+0.045 [+0.034, +0.058]확실1위
KLUE-STS블라인드0.843 (gpt-oss-120b)0.861 [0.832, 0.884]+0.018 [-0.003, +0.040]경계1위
KLUE-STS루브릭0.850 (gpt-4o-mini)0.875 [0.852, 0.896]+0.026 [+0.009, +0.041]확실1위
STS-B블라인드0.859 (exaone-3.5 7.8B)0.883 [0.860, 0.902]+0.024 [+0.007, +0.041]확실1위
STS-B루브릭0.864 (gpt-4o-mini)0.904 [0.885, 0.921]+0.041 [+0.027, +0.053]확실1위
개별 모델 7개의 ρ 전체 표
모델KorSTS 블라인드KorSTS 루브릭KLUE 블라인드KLUE 루브릭STS-B 블라인드STS-B 루브릭
gemini-2.5-flash0.7400.7890.7510.8310.8090.849
gemma-4 8B0.6850.7760.7780.8130.7640.825
exaone-3.5 7.8B0.7950.7980.8220.8280.8590.853
gpt-4o-mini0.8150.8150.8410.8500.8510.864
gpt-oss-120b0.7850.7980.8430.8280.8180.827
claude-haiku-4.50.8110.8130.8370.8490.8110.854
llama-3.1 8B0.4780.5520.5370.5010.5920.673
배심원 평균0.8370.8600.8610.8750.8830.904
예로 보면: 서열상관은 무엇을 세나

문장쌍 두 개를 놓고 봅니다. 쌍 A "한 남자가 기타를 치고 있다 / 남자가 기타를 연주한다"는 사람 점수 4.8, 쌍 B "한 남자가 기타를 치고 있다 / 한 여자가 피아노를 친다"는 사람 점수 1.2입니다. 사람은 A가 B보다 비슷하다고 했습니다.

모델이 A에 5점, B에 3점을 줬다면 점수는 사람보다 높지만 "A가 B보다 비슷하다"는 판단은 같습니다. 순서가 맞은 것입니다. A에 3점, B에 4점을 줬다면 순서가 뒤집힌 것이고, 둘 다 4점을 줬다면 구분을 못 한 것입니다. ρ는 이 비교를 문항 전체에서 한꺼번에 해서 사람의 순서와 모델의 순서가 얼마나 같은지를 −1~+1 하나의 숫자로 요약합니다.

문항 셋으로 보면 더 분명합니다. 사람이 2·3·4점을 준 세 쌍에 모델이 3·4·5점을 주면 정확일치는 0/3이지만 순서는 완전히 같아 ρ = 1입니다. 사람이 1·3·5인데 모델이 2·4·5여도 ρ = 1입니다. 간격이 다르거나 전체가 위로 밀려 있어도 상관없습니다. 값이 내려가는 것은 순서가 뒤집힐 때(2·5·4)와 동점으로 구분을 못 할 때(4·5·5)뿐입니다. 배심원 평균이 개별 모델보다 ρ가 높은 이유가 여기 있습니다. 7개를 평균 내면 동점이 풀려서 사람이 가른 순서를 더 세밀하게 따라갑니다.

정확일치에서는 왜 안 보였나
7모델은 사람보다 0.8~1.3등급 높게 주는 공통 치우침이 있습니다. 정확일치는 이 치우침을 그대로 벌점으로 매기므로, 치우침이 평균에도 남는 배심원이 불리했습니다. 서열상관은 "어느 쌍이 더 비슷한가"의 순서만 보므로 치우침에 영향을 받지 않고, 추가 분석 노트에서 하던 분위수 보정도 필요 없어집니다. 그 노트의 보정 부분은 부록으로 내리고 이 분석이 본론이 됩니다.

3사람 정답이 평균이니 배심원도 평균으로. 피어슨·스피어만 둘 다

교수님: 인간 정답지가 중위수가 아니라 평균이던 것 같은데, 맞나요? 그렇다면 우리도 평균으로 해야 할 것 같습니다. 상관계수는 피어슨과 스피어만 둘 다 보도록 합니다. 평균으로 할 거면 굳이 정수화할 필요 없습니다.

확인: 맞습니다. 사람 정답은 평가자 평균(KLUE 7명, KorSTS·STS-B 5명)이고, 평균 집계가 중앙값 집계보다 모든 칸에서 ρ가 높습니다.

같은 7개 판정을 중앙값으로 합칠 때와 평균으로 합칠 때. 스피어만 ρ와 피어슨 r 병기.
코퍼스조건중앙값 집계 ρ평균 집계 ρ평균 − 중앙값평균 집계 r (피어슨)중앙값 집계 r
KorSTS블라인드0.8090.837+0.0280.8430.815
KorSTS루브릭0.8370.860+0.0220.8630.841
KLUE-STS블라인드0.8470.861+0.0140.8450.815
KLUE-STS루브릭0.8600.875+0.0160.8660.839
STS-B블라인드0.8400.883+0.0430.8750.843
STS-B루브릭0.8680.904+0.0360.8940.867
예로 보면: 평균과 중앙값은 무엇이 다른가

문항 세 개에 사람이 2.0, 2.4, 2.8점을 줬다고 합시다. 사람은 셋을 구분했습니다. 7모델 판정이 문항 1은 3·3·3·3·3·4·4, 문항 2는 3·3·3·3·4·4·4, 문항 3은 3·3·3·4·4·4·5라고 합시다.

중앙값은 가운데 표 하나만 보므로 셋 다 3입니다. 세 문항을 구분하지 못했으니 사람의 순서와 견줄 것이 없어 ρ가 내려갑니다. 평균은 3.29, 3.43, 3.71로 사람과 같은 순서가 나와 ρ = 1입니다. 나머지 여섯 표의 정보를 버리지 않기 때문입니다. 정수 표 7개의 중앙값은 다시 1~5 정수라 동점이 많고, 평균은 0.14 단위로 갈라져 사람 점수의 미세한 차이를 따라갑니다.

피어슨 r은 등수가 아니라 값 자체로 계산합니다. 위 예에서 평균(3.29 → 3.43 → 3.71)은 사람 점수(2.0 → 2.4 → 2.8)와 함께 직선으로 오르므로 r이 높고, 중앙값(3, 3, 3)은 변화가 없어 r을 계산할 수 없거나 낮습니다. 그래서 두 지표가 같은 방향을 가리킵니다. 실제 자료에서도 평균 집계의 ρ가 중앙값 집계보다 0.01~0.06 높았고, 위 표의 18칸 모두 그랬습니다.

정수 판정 7개의 중앙값은 다시 정수가 되어 동점이 많고, 그만큼 순위 정보가 뭉개집니다. 평균은 0.14 단위의 연속값이 되어 사람 점수의 미세한 순서를 따라갑니다. 피어슨 r도 같은 방향이며, 이 페이지의 모든 결과는 평균 집계, 정수화 없음 기준입니다.

4개별 LLM 모두보다 서열상관이 높은 조합을 시간을 참고해 찾기

교수님: 서열상관성과 시간을 참고하여 어떤 조합의 중위수(→ 평균)가 가장 인간 정답과 서열상관성이 높은지, 그리고 개별 LLM들과의 서열상관성보다도 높은 조합을 찾아 주세요.

결과: 세 코퍼스 공통 최적은 exaone + gpt-4o-mini + gpt-oss + haiku(블라인드), llama를 뺀 6개(루브릭)입니다.

배심원 크기별 최고 ρ각 크기에서 가장 좋은 조합 · 점선은 최고 단일 모델
2인 이상 조합 120개 중 개수. 오른쪽 열은 각 크기에서 가장 좋은 조합의 ρ.
코퍼스조건최고 단일 모델을 넘는 조합자기 멤버 최고를 넘는 조합크기 1 → 7 의 최고 ρ
KorSTS블라인드85 / 120100 / 1200.815 → 0.838 → 0.846 → 0.851 → 0.848 → 0.843 → 0.837
KorSTS루브릭113 / 120114 / 1200.815 → 0.845 → 0.855 → 0.860 → 0.863 → 0.863 → 0.860
KLUE-STS블라인드81 / 12087 / 1200.843 → 0.871 → 0.876 → 0.879 → 0.878 → 0.878 → 0.861
KLUE-STS루브릭99 / 120106 / 1200.850 → 0.873 → 0.880 → 0.883 → 0.885 → 0.884 → 0.875
STS-B블라인드89 / 120115 / 1200.859 → 0.885 → 0.890 → 0.890 → 0.889 → 0.887 → 0.883
STS-B루브릭115 / 120120 / 1200.864 → 0.887 → 0.896 → 0.900 → 0.902 → 0.903 → 0.904

교차코퍼스 검증

한 코퍼스에서 가장 좋았던 조합을 다른 코퍼스에 그대로 적용했을 때. 같은 자료로 고르고 평가하는 낙관을 피하기 위한 검증.
조건조합을 고른 코퍼스고른 조합고른 코퍼스에서의 ρ나머지 코퍼스에서 평가
블라인드KorSTSexaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.50.851KLUE-STS 0.879 vs 최고 단일 0.843 (넘음) · STS-B 0.888 vs 최고 단일 0.859 (넘음)
블라인드KLUE-STSexaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.50.879KorSTS 0.851 vs 최고 단일 0.815 (넘음) · STS-B 0.888 vs 최고 단일 0.859 (넘음)
블라인드STS-Bgemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b0.890KorSTS 0.842 vs 최고 단일 0.815 (넘음) · KLUE-STS 0.875 vs 최고 단일 0.843 (넘음)
블라인드세 코퍼스 평균 최대exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5KorSTS 0.851 (넘음) · KLUE-STS 0.879 (넘음) · STS-B 0.888 (넘음)
루브릭KorSTSgemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.50.863KLUE-STS 0.884 vs 최고 단일 0.850 (넘음) · STS-B 0.903 vs 최고 단일 0.864 (넘음)
루브릭KLUE-STSgemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.50.885KorSTS 0.863 vs 최고 단일 0.815 (넘음) · STS-B 0.899 vs 최고 단일 0.864 (넘음)
루브릭STS-Bgemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + llama-3.1 8B0.904KorSTS 0.860 vs 최고 단일 0.815 (넘음) · KLUE-STS 0.875 vs 최고 단일 0.850 (넘음)
루브릭세 코퍼스 평균 최대gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5KorSTS 0.863 (넘음) · KLUE-STS 0.884 (넘음) · STS-B 0.903 (넘음)
코퍼스별 상위 5개 조합 (블라인드)

KorSTS · 블라인드 상위 5개 조합

조합크기ρ유료 API 수단가 합 (입력 / 출력, $/1M 토큰)가장 느린 모델의 응답 (초)
exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.540.85131.40 / 6.290.8
gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.550.84841.70 / 8.791.0
gpt-4o-mini + gpt-oss-120b + claude-haiku-4.530.84631.40 / 6.290.8
exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + llama-3.1 8B50.84531.40 / 6.290.8
exaone-3.5 7.8B + gpt-4o-mini + claude-haiku-4.530.84521.15 / 5.600.8

KLUE-STS · 블라인드 상위 5개 조합

조합크기ρ유료 API 수단가 합 (입력 / 출력, $/1M 토큰)가장 느린 모델의 응답 (초)
exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.540.87931.40 / 6.290.8
gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.550.87841.70 / 8.791.0
gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.560.87841.70 / 8.791.1
gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.550.87831.40 / 6.291.1
gemini-2.5-flash + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.540.87741.70 / 8.791.0

STS-B · 블라인드 상위 5개 조합

조합크기ρ유료 API 수단가 합 (입력 / 출력, $/1M 토큰)가장 느린 모델의 응답 (초)
gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b40.89030.70 / 3.790.9
exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b30.89020.40 / 1.290.6
gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.550.88941.70 / 8.790.9
exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.540.88831.40 / 6.290.8
gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b50.88730.70 / 3.791.1

13모델로 넓힌 조합 탐색9/17 추가

후보 6모델을 더해 13모델로 다시 찾아도 결론은 같고, 배심원은 더 좋아집니다. 13모델 평균은 세 코퍼스·네 조건 모두 14명 중 1위이고, 7모델 평균보다도 높습니다.

배심원 크기별 최고 ρ, 13모델블라인드 · 전체 조합 vs 값싼 모델만 · 점선은 최고 단일 모델
13모델 = 기존 7 + 후보 6. 조합은 2인 이상 8,178개 전부(평균 집계). '값싼'은 입력 단가 0.10 $/1M 토큰 이하 또는 무료인 모델만으로 만든 조합.
코퍼스조건최고 단일 (13개 중)7모델 평균13모델 평균13평균 − 최고 단일 [CI]14명 중 순위최고 단일 넘는 조합 / 전체최고 조합 (크기 · ρ)값싼 최고 조합 (크기 · ρ)
KorSTS블라인드0.815 (gpt-4o-mini)0.8370.852+0.038 [+0.027, +0.049]1위8,018 / 8,1789개 · 0.8606개 · 0.855
KorSTS루브릭0.831 (GLM-5.3-Flash)0.8600.873+0.042 [+0.029, +0.055]1위8,122 / 8,1789개 · 0.8776개 · 0.874
KLUE-STS블라인드0.843 (gpt-oss-120b)0.8610.866+0.023 [+0.002, +0.045]1위7,504 / 8,1787개 · 0.8845개 · 0.874
KLUE-STS루브릭0.857 (gemma-3-27b)0.8750.883+0.026 [+0.007, +0.046]1위7,842 / 8,1789개 · 0.8935개 · 0.888
STS-B블라인드0.875 (solar-pro4)0.8830.893+0.019 [+0.006, +0.031]1위7,048 / 8,1785개 · 0.9044개 · 0.904
STS-B루브릭0.878 (solar-pro4)0.9040.915+0.037 [+0.024, +0.049]1위8,114 / 8,17810개 · 0.9177개 · 0.917

세 코퍼스 공통 조합 (13모델)9/17 추가

세 코퍼스에서 같은 조합을 쓴다는 조건으로 고른 것. 한 코퍼스에서 고른 조합을 다른 코퍼스에 적용해도 세 코퍼스 모두 최고 단일 모델을 넘는다.
조건후보 범위세 코퍼스 평균 ρ가 가장 높은 조합크기코퍼스별 ρ (최고 단일 대비)입력 단가 합 ($/1M)
블라인드전체 13개 중exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B8KorSTS 0.860 (넘음) · KLUE-STS 0.881 (넘음) · STS-B 0.901 (넘음)1.77
블라인드값싼 모델만exaone-3.5 7.8B + solar-pro4 + GLM-5.3-Flash + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B6KorSTS 0.855 (넘음) · KLUE-STS 0.874 (넘음) · STS-B 0.898 (넘음)0.45
루브릭전체 13개 중exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B9KorSTS 0.877 (넘음) · KLUE-STS 0.891 (넘음) · STS-B 0.914 (넘음)1.80
루브릭값싼 모델만exaone-3.5 7.8B + solar-pro4 + GLM-5.3-Flash + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B6KorSTS 0.874 (넘음) · KLUE-STS 0.888 (넘음) · STS-B 0.914 (넘음)0.45

크기 5·7·9·11에서 고른 최적 조합 — 평균 집계 vs 중앙값 집계9/17 추가

교수님 지시대로 배심원 크기를 5·7·9·11로 제한해 다시 골랐습니다. 평균 집계는 네 크기 모두 최고 단일 모델을 크게 넘고 7명에서 거의 정점입니다. 중앙값 집계는 평균보다 0.02~0.04 낮고 영어 STS-B에서는 solar-pro4 하나를 거의 넘지 못합니다.

13모델 중 크기 5·7·9·11 조합 전부(1,287 · 1,716 · 715 · 78개)를 평균 집계와 중앙값 집계로 각각 평가하고, 세 코퍼스 평균 ρ가 가장 높은 것을 고른 표. 최고 단일 모델은 코퍼스마다 다름(블라인드 KorSTS gpt-4o-mini 0.815, KLUE gpt-oss 0.843, STS-B solar-pro4 0.875).
조건집계크기세 코퍼스 평균 ρ가 가장 높은 조합ρ (KorSTS / KLUE / STS-B)최고 단일 모델을 넘음입력 단가 합 ($/1M)
블라인드평균5exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + solar-pro4 + Qwen3.5-9B0.854 / 0.876 / 0.902○ / ○ / ○0.59
블라인드평균7exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B0.860 / 0.879 / 0.902○ / ○ / ○0.77
블라인드평균9exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + solar-pro4 + GLM-5.3-Flash + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B0.860 / 0.881 / 0.898○ / ○ / ○1.85
블라인드평균11gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + solar-pro4 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B0.858 / 0.880 / 0.898○ / ○ / ○3.10
블라인드중앙값5exaone-3.5 7.8B + gpt-4o-mini + solar-pro4 + gemma-3-27b + Qwen3.5-9B0.828 / 0.860 / 0.880○ / ○ / ○0.42
블라인드중앙값7exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + solar-pro4 + gemma-3-27b + Qwen3.5-9B0.828 / 0.865 / 0.871○ / ○ / ×1.67
블라인드중앙값9gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + llama-3.1 8B + solar-pro4 + gemma-3-27b + Qwen3.5-9B0.824 / 0.860 / 0.869○ / ○ / ×1.97
블라인드중앙값11exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + llama-3.1 8B + solar-pro4 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B0.827 / 0.859 / 0.864○ / ○ / ×2.80
루브릭평균5exaone-3.5 7.8B + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B0.872 / 0.885 / 0.916○ / ○ / ○0.37
루브릭평균7exaone-3.5 7.8B + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B0.876 / 0.888 / 0.914○ / ○ / ○0.70
루브릭평균9exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B0.877 / 0.891 / 0.914○ / ○ / ○1.80
루브릭평균11gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B0.875 / 0.890 / 0.915○ / ○ / ○2.10
루브릭중앙값5gpt-4o-mini + claude-haiku-4.5 + GLM-5.3-Flash + gemma-3-27b + Qwen3.5-9B0.850 / 0.872 / 0.873○ / ○ / ×1.42
루브릭중앙값7exaone-3.5 7.8B + gpt-4o-mini + llama-3.1 8B + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B0.849 / 0.868 / 0.878○ / ○ / ×0.52
루브릭중앙값9exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B0.850 / 0.874 / 0.867○ / ○ / ×2.71
루브릭중앙값11gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B0.848 / 0.866 / 0.872○ / ○ / ×3.01
코퍼스별 · 크기별 최고 ρ와 최고 단일 모델을 넘는 조합 수 (평균 · 중앙값)
코퍼스조건집계최고 단일k=5 최고 ρ (넘는 조합 수/전체)k=7 최고 ρ (넘는 조합 수/전체)k=9 최고 ρ (넘는 조합 수/전체)k=11 최고 ρ (넘는 조합 수/전체)
KorSTS블라인드평균0.8150.857 (1,269/1,287)0.860 (1,716/1,716)0.860 (715/715)0.858 (78/78)
KorSTS블라인드중앙값0.8150.830 (496/1,287)0.832 (899/1,716)0.831 (517/715)0.827 (72/78)
KorSTS루브릭평균0.8310.872 (1,287/1,287)0.876 (1,716/1,716)0.877 (715/715)0.876 (78/78)
KorSTS루브릭중앙값0.8310.852 (1,106/1,287)0.855 (1,714/1,716)0.856 (715/715)0.853 (78/78)
KLUE-STS블라인드평균0.8430.883 (1,067/1,287)0.884 (1,689/1,716)0.884 (715/715)0.882 (78/78)
KLUE-STS블라인드중앙값0.8430.867 (577/1,287)0.866 (1,079/1,716)0.864 (570/715)0.861 (72/78)
KLUE-STS루브릭평균0.8570.890 (1,196/1,287)0.892 (1,716/1,716)0.893 (715/715)0.892 (78/78)
KLUE-STS루브릭중앙값0.8570.875 (766/1,287)0.874 (1,396/1,716)0.874 (675/715)0.871 (78/78)
STS-B블라인드평균0.8750.904 (995/1,287)0.903 (1,619/1,716)0.901 (712/715)0.898 (78/78)
STS-B블라인드중앙값0.8750.888 (25/1,287)0.880 (9/1,716)0.872 (0/715)0.869 (0/78)
STS-B루브릭평균0.8780.916 (1,287/1,287)0.917 (1,716/1,716)0.917 (715/715)0.917 (78/78)
STS-B루브릭중앙값0.8780.883 (25/1,287)0.887 (12/1,716)0.879 (1/715)0.876 (0/78)

값싼 모델만으로 만든 조합(연구실 서버 3개 + solar-pro4 · GLM-5.3-Flash · gemma-3-27b · DeepSeek-V4-Flash · Qwen3.5-9B)도 세 코퍼스 모두에서 최고 단일 모델을 넘고, 전체 최적 조합과의 차이는 0.01 안쪽입니다. 교수님의 값싼 배심원 가설은 이 자료에서 성립합니다.

시간과 비용

응답 시간은 블라인드 조건 판정 1건의 중앙값. 단가는 포털 표 3과 같음(2026-09-11 공식 가격표).
모델KorSTS 응답 (초)KLUE 응답 (초)STS-B 응답 (초)단가 입력 / 출력 ($/1M 토큰)실행 위치
gemini-2.5-flash1.031.000.920.30 / 2.50유료 API
gemma-4 8B1.131.141.130.00 / 0.00연구실 서버 (무료)
exaone-3.5 7.8B0.450.450.460.00 / 0.00연구실 서버 (무료)
gpt-4o-mini0.660.650.650.15 / 0.60유료 API
gpt-oss-120b0.450.450.450.25 / 0.69유료 API
claude-haiku-4.50.750.830.801.00 / 5.00유료 API
llama-3.1 8B0.670.670.680.00 / 0.00연구실 서버 (무료)

배심원은 병렬로 호출하므로 소요 시간은 가장 느린 모델이 정합니다. 네 모델 조합은 유료 API가 셋(gpt-4o-mini·gpt-oss·haiku)이고 exaone은 연구실 서버라 비용이 없습니다. 무료 모델만으로는(exaone·gemma·llama) 최고 단일 모델을 넘지 못했습니다.

5변환 규칙이 코퍼스마다 다르다는 지적

교수님: 변환 규칙이 일관되지 않다는 클로드의 지적이 있네요. 한번 살펴봐 주세요.

확인: 지적이 맞습니다. KorSTS·STS-B는 .5를 짝수 쪽으로, KLUE는 위로 반올림했습니다.

원본 파일 전수 대조(check_grade_conversion.py). KorSTS의 1건 차이는 원본에 같은 문장쌍이 점수만 다르게 두 번 있는 경우.
코퍼스실제 적용된 규칙규칙과 일치한 문항.5점 처리일반 반올림으로 바꾸면 등급이 오르는 문항0점 → 1등급
KorSTS파이썬 round() (.5는 짝수 쪽)1,378 / 1,3792.5 → 2, 4.5 → 4, 1.5 → 2, 3.5 → 415쌍 (2.5점 9, 4.5점 6)112쌍
STS-B파이썬 round() (.5는 짝수 쪽)550 / 5502.5 → 2, 4.5 → 46쌍 (2.5점 3, 4.5점 3)32쌍
KLUE-STSint(점수 + 0.5) (.5는 올림)519 / 5192.5 → 3, 4.5 → 50쌍 (일반 반올림과 같음)0쌍

어디에 영향이 있나

영향 받는 곳크기설명
판정 값 자체없음블라인드·루브릭 프롬프트에는 사람 등급이 들어가지 않는다. 모델은 같은 두 문장을 보고 같은 답을 냈다.
정확일치 등 등급 기준 지표21쌍의 채점이 한 칸 이동이전 노트의 수치에 소수점 첫째 자리 이하 영향. 새 분석(서열상관)은 등급을 쓰지 않아 영향 없음.
정답+1 앵커 조건21쌍의 앵커값이 한 칸 다름정답+1 앵커는 정답 누설 문제로 어차피 대체 대상. 무작위 앵커는 정답과 무관해 영향 없음.
등급별 층화 표집STS-B 표집 때 2.5점 3쌍·4.5점 3쌍이 다른 등급 통에서 뽑혔을 것STS-B는 원본 1,500쌍을 등급별 110쌍씩 뽑아 550쌍을 만들었다. 그때 등급을 round()로 만들었으므로 2.5점은 2등급 통, 4.5점은 4등급 통에서 추첨됐고, 일반 반올림이었다면 3등급·5등급 통에서 추첨돼 지금과 조금 다른 550쌍이 뽑혔을 수 있다. 다만 표집은 2026년 8월에 끝났고 그 550쌍에 대한 7모델 판정도 끝났으므로 표본과 판정은 그대로 쓴다. 등급별로 고르게 뽑는다는 표집 목적은 6쌍이 어느 통에 있든 달성됐다. 새 분석은 새로 수집한 것이 아니라 같은 판정을 지표만 바꿔 다시 계산한 것이고, 난이도를 나눌 때도 등급이 아니라 사람 점수를 1.67·3.33에서 자른 3층을 쓰므로(9번 참조) 반올림 규칙이 결과에 끼어들 자리가 없다. 논문에는 표집 때 쓴 규칙을 그대로 적는다.

6STS-B 문장이 손상됐다는 지적

교수님: 문장이 손상되었다고도 하네요.

확인: 550쌍 중 4쌍이 손상됐습니다. 이 페이지의 STS-B 수치는 4쌍을 뺀 546쌍입니다.

원인: 원본 TSV를 읽을 때 따옴표로 시작하는 문장을 인용부호로 해석해 다음 따옴표까지 여러 행을 한 칸으로 합침. 그 밖에 앞뒤 따옴표만 빠진 문항 14건은 뜻이 같아 그대로 둔다.
문항손상 유형길이 변화
stsb-0049문장2에 다음 행 7개가 통째로 붙음75자 → 1,871자
stsb-0322문장2에 다음 행 11개가 붙음135자 → 2,405자
stsb-0279문장2에 다음 행이 붙음87자 → 244자
stsb-0361문장1에 두 문장이 탭으로 붙고 문장2가 비어 있음문장2 0자

손상 문항의 블라인드 정확일치는 39.3%(28건 중 11건)로 나머지 35.1%와 비슷해 결과를 흔들지는 않았지만, 프롬프트가 잘못된 문항이므로 제외가 맞습니다. 논문 원고에는 제외 사실과 원인을 한 줄로 적습니다.

7앵커는 어떻게 줄지, 지금은 사람 등급+1인가

교수님: 앵커는 어떻게 줄 건지 다시 생각해 봅시다. 지금은 사람 등급 +1(5등급은 4)로 주었나요?

답: 예, 본실험은 사람 등급+1(5는 4)이었습니다. 이 앵커는 정답을 누설해 서열상관을 올리므로, 정답과 무관한 무작위 앵커(1~5 균등)로 7모델 34,272건을 이미 다시 돌렸습니다.

앵커를 더했을 때 ρ 변화블라인드 대비 · 정답+1 앵커 vs 무작위 앵커
같은 문항에 앵커만 더했을 때의 ρ 변화. 정답+1 앵커는 올리고(정답 누설), 무작위 앵커는 내린다.
코퍼스비교개별 모델 평균 ρΔρ [95% CI]배심원 평균 ρΔρ [95% CI]
KorSTS블라인드 → 정답+1 앵커0.730 → 0.763+0.034 [+0.021, +0.045]0.837 → 0.883+0.046 [+0.032, +0.060]
KorSTS블라인드 → 무작위 앵커0.730 → 0.644-0.086 [-0.099, -0.072]0.837 → 0.792-0.045 [-0.059, -0.031]
KorSTS루브릭 → 루브릭 + 정답+1 앵커0.763 → 0.775+0.012 [+0.004, +0.020]0.860 → 0.882+0.023 [+0.015, +0.031]
KorSTS루브릭 → 루브릭 + 무작위 앵커0.763 → 0.738-0.025 [-0.034, -0.017]0.860 → 0.846-0.014 [-0.023, -0.007]
KLUE-STS블라인드 → 정답+1 앵커0.773 → 0.819+0.046 [+0.030, +0.062]0.861 → 0.901+0.040 [+0.022, +0.059]
KLUE-STS블라인드 → 무작위 앵커0.773 → 0.680-0.092 [-0.115, -0.072]0.861 → 0.821-0.040 [-0.065, -0.017]
KLUE-STS루브릭 → 루브릭 + 정답+1 앵커0.786 → 0.801+0.016 [+0.005, +0.027]0.875 → 0.902+0.026 [+0.014, +0.040]
KLUE-STS루브릭 → 루브릭 + 무작위 앵커0.786 → 0.770-0.016 [-0.028, -0.005]0.875 → 0.874-0.001 [-0.015, +0.012]
STS-B블라인드 → 정답+1 앵커0.786 → 0.782-0.005 [-0.018, +0.008]0.883 → 0.892+0.009 [-0.006, +0.023]
STS-B블라인드 → 무작위 앵커0.786 → 0.724-0.062 [-0.078, -0.048]0.883 → 0.849-0.034 [-0.051, -0.019]
STS-B루브릭 → 루브릭 + 정답+1 앵커0.821 → 0.824+0.003 [-0.006, +0.013]0.904 → 0.906+0.002 [-0.010, +0.014]
STS-B루브릭 → 루브릭 + 무작위 앵커0.821 → 0.787-0.034 [-0.045, -0.024]0.904 → 0.894-0.010 [-0.021, +0.000]
앵커를 어떻게 줄 것인가
정답+1 앵커는 "정답에서 한 칸 떨어진 값"이라 정답 정보가 들어가고, 앵커에 끌릴수록 정답에 가까워져 서열상관이 올라갑니다. 앵커의 해악을 보려면 앵커가 정답과 독립이어야 하므로 무작위 앵커가 맞는 설계이고, 그 결과는 세 코퍼스 모두에서 개별 모델과 배심원의 ρ 하락입니다. 배심원은 개별 모델보다 덜 떨어져 완충 역할을 합니다. 논문에서는 정답+1 앵커를 본문에서 내리고 무작위 앵커를 앵커 조건으로 씁니다.

811개 LLM으로 최적 조합 탐색

교수님: Cerebras, Upstage, DeepInfra, Together 같은 오픈소스 LLM 포함하여 API 키를 정리했습니다. 11개 LLM도 활용하여 최적의 조합을 탐색해 보고 있습니다. 상현도 찾아 보세요.

결과: 여섯 모델을 3코퍼스 × 4조건(블라인드 · 루브릭 · 무작위 앵커 · 루브릭+무작위 앵커)에 모두 돌렸습니다. 58,752건, 실패 0건. 13모델 조합 탐색은 4번 절 아래에 있습니다.

후보 6모델의 ρ. 단가는 OpenRouter 게시가(2026-09-17) 참고치, 응답은 KorSTS 블라인드 1건 중앙값. STS-B는 손상 4문항 제외.
모델공급자단가 입력 / 출력 ($/1M)응답 (초)KorSTS 블라인드KorSTS 루브릭KLUE 블라인드KLUE 루브릭STS-B 블라인드STS-B 루브릭
solar-pro4Upstage0.09 / 0.360.40.8090.8250.8320.8340.8750.878
GLM-5.3-FlashDeepInfra0.09 / 0.302.20.8010.8310.8040.8410.7890.856
Kimi-K2.6OpenRouter0.95 / 4.001.20.7930.8030.8020.8400.8080.824
gemma-3-27bDeepInfra0.08 / 0.451.00.8000.8220.8180.8570.8020.849
DeepSeek-V4-FlashDeepInfra0.09 / 0.171.00.7800.7940.7240.8010.8370.846
Qwen3.5-9BTogether0.10 / 0.150.50.7840.8070.8070.8250.8610.870
기존 7개 중 최고0.8150.8150.8430.8500.8590.864
13모델 평균0.8520.8730.8660.8830.8930.915

교수님 표의 GLM-4.7-Flash는 DeepInfra 목록에서 내려가 후속 GLM-5.3-Flash를, Kimi-K2는 K2.6을 썼습니다(DeepInfra는 과부하, Together는 미배포라 OpenRouter 경유). solar-pro4와 GLM은 추론 기능을 꺼야 숫자만 답합니다. 프롬프트·루브릭·무작위 앵커 값은 기존 7모델과 같습니다.

개별 모델로는 solar-pro4가 영어 STS-B에서 13개 중 1위(블라인드·루브릭 모두)이고, GLM-5.3-Flash가 KorSTS 루브릭과 무작위 앵커 조건에서 1위입니다. 한국어 KorSTS 블라인드에서는 여전히 gpt-4o-mini가 최고입니다. 기존 7개보다 후보 6개의 평균 ρ가 높고, 그래서 13모델 배심원이 7모델 배심원보다 좋아집니다.

후보 6모델의 앵커 끌림9/17 추가

블라인드 → 무작위 앵커. 후보 6모델도 같은 방향으로 끌린다.
코퍼스기존 7 평균 Δρ후보 6 평균 Δρ13모델 배심원 Δρ [CI]후보 6 개별 Δρ
KorSTS-0.086-0.109-0.052 [-0.067, -0.038]solar-pro4 -0.145 · GLM-5.3-Flash -0.007 · Kimi-K2.6 -0.029 · gemma-3-27b -0.086 · DeepSeek-V4-Flash -0.356 · Qwen3.5-9B -0.033
KLUE-STS-0.092-0.061-0.032 [-0.054, -0.010]solar-pro4 -0.125 · GLM-5.3-Flash +0.017 · Kimi-K2.6 -0.008 · gemma-3-27b -0.090 · DeepSeek-V4-Flash -0.147 · Qwen3.5-9B -0.014
STS-B-0.062-0.021-0.015 [-0.027, -0.003]solar-pro4 -0.009 · GLM-5.3-Flash +0.025 · Kimi-K2.6 +0.029 · gemma-3-27b -0.043 · DeepSeek-V4-Flash -0.114 · Qwen3.5-9B -0.013
교수님이 항체 제형 과제에서 돌리신 11개 LLM 표. ρ는 사람 정답이 아니라 '자기를 뺀 나머지 배심 평균'과의 상관이라 우리 지표와 다르지만, 후보 모델과 속도의 근거로 쓴다. 우리 규모는 3코퍼스 2,448문항 × 블라인드·루브릭 2조건. 무작위 앵커 2조건을 더하면 두 배.
모델제품 / 공급자교수님 표 ρ (배심 평균과의 상관)교수님 표 가동 시간 (6만 편)우리 규모 환산 (4,896건, 같은 속도)우리 연구에서
claude-haiku-4.5Anthropic API0.711.6시간약 8분배심원에 있음
gpt-oss-120bCerebras Cloud0.7157분약 5분배심원에 있음
gpt-5-mini (비교)OpenAI API0.692.0시간약 10분고급 패널에서 블라인드만 실험
solar-pro4Upstage Console0.681.6시간약 8분후보 1 · 한국어 강점
GLM-4.7-FlashDeepInfra0.681.3시간약 6분후보 2
Kimi-K2DeepInfra0.671.6시간약 8분후보 3
gemini-2.5-flashGoogle AI Studio0.6248분약 4분배심원에 있음
gpt-4o-miniOpenAI API0.5839분약 3분배심원에 있음
Qwen3.5-9BTogether AI0.572.1시간약 10분후보 4
gemma-3-27bDeepInfra0.562.1시간약 10분후보 5
Llama-3.1-8BDeepInfra0.512.7시간약 13분배심원에 있음 (연구실 서버)
DeepSeek-V4-FlashDeepInfra0.4452분약 4분후보 6

9등급별·난이도별도 서열상관으로, 왜 서열상관인지 설명

교수님: 등급별 혹은 난이도별 정확도는 이 서열상관계수로 판단하는 것이 좋을 것 같아요. 왜 서열상관계수를 써야 하는지에 대한 설명이 있으면 좋겠네요.

난이도 층 안에서도 배심원 평균이 대부분 최고 단일 모델보다 높습니다. 다만 층 안에서는 ρ가 전체보다 크게 낮아지므로 읽을 때 주의가 필요합니다.

사람 점수 3층 안에서의 ρ블라인드 · 하(0~1.67) / 중(1.67~3.33) / 상(3.33~5)
층별 수치 전체 표 (KLUE 평가자 불일치 3층 포함)
블라인드. '최고 단일'은 전체에서 1위였던 모델을 층 안에서 그대로 평가. 층 안에서는 사람 점수 폭이 좁아 ρ가 전체보다 낮게 나오는 것이 정상(범위 제한).
코퍼스층 기준층n층 안 사람 점수 SD최고 단일 ρ개별 평균 ρ배심원 평균 ρ배심원 − 최고 단일 [CI]
KorSTS사람 점수 3층하 (0~1.67)4070.540.5480.5400.669+0.120 [+0.084, +0.160]
KorSTS사람 점수 3층중 (1.67~3.33)4380.470.4640.3810.504+0.040 [+0.002, +0.089]
KorSTS사람 점수 3층상 (3.33~5)5340.540.3650.3120.428+0.063 [+0.018, +0.107]
KLUE-STS사람 점수 3층하 (0~1.67)1780.480.5320.4210.534+0.002 [-0.075, +0.087]
KLUE-STS사람 점수 3층중 (1.67~3.33)1650.490.4950.3730.508+0.013 [-0.066, +0.098]
KLUE-STS사람 점수 3층상 (3.33~5)1760.470.0600.2340.308+0.248 [+nan, +nan]
KLUE-STS평가자 불일치 3층낮음 (쉬움)1981.840.8850.8320.881-0.004 [-0.037, +0.023]
KLUE-STS평가자 불일치 3층중간1491.400.8020.7660.866+0.064 [+0.023, +0.114]
KLUE-STS평가자 불일치 3층높음 (어려움)1720.980.7190.6040.717-0.002 [-0.055, +0.055]
STS-B사람 점수 3층하 (0~1.67)1290.580.7030.6390.751+0.048 [-0.005, +0.097]
STS-B사람 점수 3층중 (1.67~3.33)1850.500.4860.3790.499+0.013 [-0.070, +0.098]
STS-B사람 점수 3층상 (3.33~5)2320.550.6110.4160.608-0.003 [-0.082, +0.072]
층을 나눌 때의 주의
정수 등급 하나로 층을 자르면 그 안의 사람 점수 폭이 0.5점뿐이어서 순위상관이 정의상 낮아지고 잡음이 커집니다(범위 제한). 그래서 층은 연속 점수 3층처럼 넓게 나누고, 층 안 ρ는 전체 ρ와 함께 보이며, "층 안에서도 배심원이 개별 모델보다 앞서는가"를 읽는 용도로 씁니다. KLUE는 평가자 불일치(표준편차) 3층도 함께 냈습니다.

왜 서열상관인가 (설명 초안)

1. 사람 정답이 연속값이다여러 평가자 평균(0~5)이므로 정수 등급으로 자르면 정보가 사라지고, 5번에서 본 것처럼 반올림 규칙에 따라 등급이 흔들린다. 순위상관은 원점수를 그대로 쓴다.
2. 배심원의 쓰임은 순서 판단이다LLM 배심원이 할 일은 "어느 쌍이 더 비슷한가"를 가르는 것이지 절대 등급표를 재현하는 것이 아니다. 선별·정렬·우선순위 매기기가 모두 순서 문제다.
3. 절대값 비교는 척도 편향을 잰다모델마다 관대함이 달라 같은 판단력이라도 점수 눈금이 다르다. 정확일치는 이 눈금 차이를 오답으로 세고, 서열상관은 단조 변환에 불변이라 판단력만 잰다.
4. 연구자 자의성이 들어갈 자리가 없다치우침 보정이나 등급 대응표를 어떻게 잡느냐에 따라 정확도는 달라지지만, 순위상관은 어떤 보정을 해도 같은 값이다. 피어슨 r은 선형 일치 확인용으로 병기한다.

10상호정보 교환 앵커 — 가설 49/18 추가

교수님 (9월 17일): 이번에는 앵커를 상호정보를 교환하는 형태로 줘 보세요. 라운드를 거치면서 의견을 수렴할 수 있는지에 대한 가능성입니다. 각 LLM에게 판단 근거를 작성하라고 하고, 판단 결과와 정보를 공유한 다음에 다시 결정하는 형태로 앵커 효과를 보는 겁니다. 세 번째와 관련은 있는데 네 번째 연구가설로 만드는 것이 더 좋을 것 같습니다.

결과: 의견은 강하게 수렴하고 약한 개별 모델은 좋아지지만, 배심원의 ρ는 세 코퍼스 모두 내려갑니다. 루브릭을 넣어도, 3라운드까지 가도 같습니다.

기준선근거 없이 점수만 (기존 판정)
R1근거 한두 문장 + 점수
R2자기 R1 점수·근거 + 다른 12명의 R1 점수·근거(익명) → 재판정
R3 (KLUE만)R2 결과를 다시 공유 → 재판정

13모델 × 2,444문항을 루브릭 없음·있음 두 조건으로 돌렸습니다(라운드 판정 133,835건, 실패 0). 다른 판정자의 순서는 문항마다 고정 무작위이고 모델 이름은 가리며, 점수를 바꿔도 유지해도 된다고 명시했습니다. 온도 0.

라운드별 ρ기준선 → R1 → R2(→ R3) · 배심원 13 평균 · 개별 평균 · 최고 단일 · 루브릭 없음(실선) / 있음(점선)
기준선 = 근거 없이 점수만 받은 기존 판정 → R1 = 근거 작성 → R2 = 다른 12명의 점수·근거를 보고 재판정 (KLUE 루브릭 없음은 → R3까지). 13모델 × 2,444문항, STS-B 손상 4문항 제외.
조건코퍼스개별 평균 ρ최고 단일 ρ배심원 13 평균 ρ14명 중 순위최적 7 조합 ρR1 → R2 배심원 Δρ [CI]
루브릭 없음KorSTS0.760 → 0.760 → 0.7930.815 → 0.821 → 0.8230.852 → 0.863 → 0.8481 → 1 → 10.860 → 0.866 → 0.850-0.015 [-0.020, -0.008]
루브릭 없음KLUE-STS0.784 → 0.769 → 0.798 → 0.8140.843 → 0.842 → 0.842 → 0.8350.866 → 0.862 → 0.831 → 0.8351 → 1 → 5 → 20.879 → 0.879 → 0.857 → 0.839-0.032 [-0.049, -0.015]
루브릭 없음STS-B0.806 → 0.807 → 0.8230.875 → 0.865 → 0.8440.893 → 0.893 → 0.8631 → 1 → 10.902 → 0.900 → 0.862-0.030 [-0.040, -0.020]
루브릭 있음KorSTS0.786 → 0.780 → 0.8090.831 → 0.813 → 0.8290.873 → 0.872 → 0.8571 → 1 → 10.875 → 0.869 → 0.858-0.015 [-0.022, -0.009]
루브릭 있음KLUE-STS0.808 → 0.804 → 0.8210.857 → 0.844 → 0.8500.883 → 0.877 → 0.8441 → 1 → 20.886 → 0.880 → 0.870-0.034 [-0.054, -0.017]
루브릭 있음STS-B0.836 → 0.834 → 0.8400.878 → 0.860 → 0.8590.915 → 0.906 → 0.8771 → 1 → 10.916 → 0.901 → 0.877-0.029 [-0.042, -0.016]

수렴: 얼마나, 어느 쪽으로

수렴은 강하지만 방향은 다수 쪽이다. 바뀐 판정 가운데 정답에 가까워진 것은 3분의 1 남짓.
조건코퍼스단계문항별 13모델 점수 SD만장일치 문항바뀐 판정그중 다른 판정자 쪽그중 정답에 가까워짐 / 멀어짐평균 점수 (사람 평균)
루브릭 없음KorSTSR1 → R20.59 → 0.345% → 21%30%98%41% / 58%3.66 → 3.78 (2.61)
루브릭 없음KLUE-STSR1 → R20.49 → 0.2716% → 35%23%98%33% / 67%4.09 → 4.19 (2.48)
루브릭 없음KLUE-STSR2 → R30.27 → 0.1035% → 72%11%100%40% / 59%4.19 → 4.22 (2.48)
루브릭 없음STS-BR1 → R20.47 → 0.224% → 45%28%99%40% / 60%3.83 → 3.96 (2.86)
루브릭 있음KorSTSR1 → R20.55 → 0.325% → 32%30%96%40% / 58%3.67 → 3.78 (2.61)
루브릭 있음KLUE-STSR1 → R20.46 → 0.259% → 43%23%96%33% / 67%4.05 → 4.15 (2.48)
루브릭 있음STS-BR1 → R20.43 → 0.219% → 47%25%98%38% / 62%3.82 → 3.94 (2.86)

3라운드까지 가면 (KLUE)

KLUE-STS, 루브릭 없음, 519문항. R2 → R3 배심원 Δρ [-0.013, +0.021]. 만장일치 35% → 72%.
단계개별 평균 ρ최고 단일 ρ배심원 13 평균 ρ14명 중 순위최적 7 조합 ρ
기준선0.7840.8430.86610.879
R10.7690.8420.86210.879
R20.7980.8420.83150.857
R30.8140.8350.83520.839
모델별 ρ 변화 (루브릭 없음)
루브릭 없음. 약한 모델(llama, gemma-4)이 크게 오르고 강한 모델은 제자리거나 내려간다.
모델KorSTS 기준선 → R1 → R2KLUE 기준선 → R1 → R2STS-B 기준선 → R1 → R2
gemini-2.5-flash0.740 → 0.718 → 0.7740.751 → 0.657 → 0.7260.809 → 0.737 → 0.778
gemma-4 8B0.685 → 0.724 → 0.8040.778 → 0.766 → 0.8310.764 → 0.759 → 0.837
exaone-3.5 7.8B0.795 → 0.760 → 0.7870.822 → 0.801 → 0.8310.859 → 0.853 → 0.825
gpt-4o-mini0.815 → 0.794 → 0.8230.841 → 0.837 → 0.8420.851 → 0.834 → 0.840
gpt-oss-120b0.785 → 0.793 → 0.8120.843 → 0.839 → 0.8190.818 → 0.804 → 0.834
claude-haiku-4.50.811 → 0.817 → 0.8080.837 → 0.842 → 0.8410.811 → 0.833 → 0.844
llama-3.1 8B0.478 → 0.522 → 0.6390.537 → 0.484 → 0.6220.592 → 0.708 → 0.809
solar-pro40.809 → 0.806 → 0.8140.832 → 0.824 → 0.8370.875 → 0.865 → 0.828
GLM-5.3-Flash0.801 → 0.778 → 0.8170.804 → 0.756 → 0.8110.789 → 0.803 → 0.812
Kimi-K2.60.793 → 0.794 → 0.8060.802 → 0.794 → 0.8040.808 → 0.836 → 0.825
gemma-3-27b0.800 → 0.789 → 0.8160.818 → 0.805 → 0.8190.802 → 0.781 → 0.832
DeepSeek-V4-Flash0.780 → 0.821 → 0.8210.724 → 0.827 → 0.8070.837 → 0.863 → 0.841
Qwen3.5-9B0.784 → 0.769 → 0.7920.807 → 0.768 → 0.7920.861 → 0.811 → 0.801
읽는 법

수렴은 분명합니다. 문항별 13모델 점수의 표준편차가 절반 이하로 줄고 만장일치 문항이 4~16%에서 21~47%로, 3라운드에서는 72%까지 늘어납니다. 바뀐 판정의 96~99%가 다른 판정자들 쪽으로 움직였습니다.

그러나 수렴의 방향은 정답이 아니라 다수입니다. 바뀐 판정 가운데 정답에 가까워진 것은 33~41%, 멀어진 것은 58~67%입니다. 개별 모델은 다수를 따라가서 평균 ρ가 오르고 특히 약한 모델(llama-3.1, gemma-4)이 크게 오르지만, 강한 모델은 제자리거나 내려갑니다. 그 결과 13모델이 "같은 의견 13개"가 되어, 평균을 낼 때 서로 상쇄되던 독립적인 오차가 사라지고 배심원 ρ가 내려갑니다. 최적 7모델 조합도 같이 내려갑니다.

루브릭은 이 효과를 막지 못했고(하락 폭이 거의 같음), 라운드를 더 돌려도 회복되지 않습니다(KLUE R3: 만장일치 72%, 배심원 ρ 제자리, 최적 조합은 더 하락). 근거를 쓰게 하는 것 자체(R1)는 배심원에 이롭지 않았습니다.

가설 4 문안(초안): 판단 근거를 공유하는 라운드는 배심원의 의견을 수렴시키고 약한 개별 모델을 끌어올리지만, 배심원 전체의 사람 정답과의 서열상관은 낮추며, 이 효과는 루브릭 유무와 라운드 수에 무관하다. 정답+1 앵커(누설), 무작위 앵커(끌림), 상호정보 교환(동조)은 모두 배심원의 독립성을 깨뜨리는 방향으로 작용한다. 배심원은 서로 모르고 판정할 때 가장 좋다.