0한 장 요약
최적 조합으로 만든 배심원(exaone + gpt-4o-mini + gpt-oss + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B, 7모델 평균)은 사람 점수와의 순위상관에서 세 코퍼스 모두 어떤 단일 모델보다 높고, 루브릭을 주면 더 높아집니다. 이 조합은 한 코퍼스에서 고른 것이 아니라 세 코퍼스에 같은 조합을 쓴다는 조건으로 고른 것이라 다른 자료에도 그대로 갑니다.
지표를 정확일치에서 서열상관으로, 집계를 중앙값에서 평균으로 바꾼 것이 출발점입니다. 그 기준에서는 7모델 전부의 평균도, 후보 6모델을 더한 13모델 평균도 모든 조건에서 개별 모델을 제치고 1위이며, 값싼 모델만의 5모델 조합도 최고 단일 모델을 넘습니다.
정답+1 앵커는 서열상관을 올리고(정답 누설), 정답과 무관한 무작위 앵커는 개별 모델과 배심원 모두의 서열상관을 세 코퍼스에서 확실하게 떨어뜨립니다.
1원본은 0~5점인데 1~5등급으로 어떻게 바꿨나
답: 사람 평균 점수를 반올림한 뒤 0점을 1등급으로 잘랐고, 그 등급으로 층화 표집했습니다.
| 코퍼스 | 표본 | 원본 점수 | 적용된 변환 | 예시 | 0점 문항 |
|---|---|---|---|---|---|
| KorSTS | test 분할 1,379쌍 | 평가자 5명 평균 0~5 (0.2 단위) | round(점수) → 0은 1로 | 2.4 → 2, 2.5 → 2, 2.6 → 3, 0.0 → 1 | 112쌍 |
| KLUE-STS | dev 519쌍 | 평가자 7명 평균 0~5 | int(점수 + 0.5) → 0은 1로 | 2.4 → 2, 2.5 → 3, 2.6 → 3 | 0쌍 (최소 0.14) |
| STS-B | dev 1,500쌍 중 등급별 110쌍 = 550쌍 | 평가자 5명 평균 0~5 | round(점수) → 0은 1로 | 2.4 → 2, 2.5 → 2, 2.6 → 3, 0.0 → 1 | 32쌍 |
등급을 만든 이유는 두 가지였습니다. 등급별로 문항 수를 맞춰 표집하려는 것과, 모델의 1~5 정수 답과 같은 눈금에서 정확일치를 세려는 것입니다. 그런데 반올림 방식이 코퍼스마다 달랐다는 것을 이번에 확인했습니다(5번). 새 분석에서는 등급을 쓰지 않고 사람 점수를 연속값 그대로 씁니다.
2정확도 대신 사람 정답과의 서열상관으로, 등급 전환 과정은 빼고
결과: 배심원 평균이 세 코퍼스·모든 조건에서 8명 중 1위입니다.
| 코퍼스 | 조건 | 최고 단일 모델 ρ | 배심원 평균 ρ [95% CI] | 차이 [95% CI] | 판정 | 8명 중 순위 |
|---|---|---|---|---|---|---|
| KorSTS | 블라인드 | 0.815 (gpt-4o-mini) | 0.837 [0.816, 0.853] | +0.022 [+0.011, +0.032] | 확실 | 1위 |
| KorSTS | 루브릭 | 0.815 (gpt-4o-mini) | 0.860 [0.842, 0.874] | +0.045 [+0.034, +0.058] | 확실 | 1위 |
| KLUE-STS | 블라인드 | 0.843 (gpt-oss-120b) | 0.861 [0.832, 0.884] | +0.018 [-0.003, +0.040] | 경계 | 1위 |
| KLUE-STS | 루브릭 | 0.850 (gpt-4o-mini) | 0.875 [0.852, 0.896] | +0.026 [+0.009, +0.041] | 확실 | 1위 |
| STS-B | 블라인드 | 0.859 (exaone-3.5 7.8B) | 0.883 [0.860, 0.902] | +0.024 [+0.007, +0.041] | 확실 | 1위 |
| STS-B | 루브릭 | 0.864 (gpt-4o-mini) | 0.904 [0.885, 0.921] | +0.041 [+0.027, +0.053] | 확실 | 1위 |
개별 모델 7개의 ρ 전체 표
| 모델 | KorSTS 블라인드 | KorSTS 루브릭 | KLUE 블라인드 | KLUE 루브릭 | STS-B 블라인드 | STS-B 루브릭 |
|---|---|---|---|---|---|---|
| gemini-2.5-flash | 0.740 | 0.789 | 0.751 | 0.831 | 0.809 | 0.849 |
| gemma-4 8B | 0.685 | 0.776 | 0.778 | 0.813 | 0.764 | 0.825 |
| exaone-3.5 7.8B | 0.795 | 0.798 | 0.822 | 0.828 | 0.859 | 0.853 |
| gpt-4o-mini | 0.815 | 0.815 | 0.841 | 0.850 | 0.851 | 0.864 |
| gpt-oss-120b | 0.785 | 0.798 | 0.843 | 0.828 | 0.818 | 0.827 |
| claude-haiku-4.5 | 0.811 | 0.813 | 0.837 | 0.849 | 0.811 | 0.854 |
| llama-3.1 8B | 0.478 | 0.552 | 0.537 | 0.501 | 0.592 | 0.673 |
| 배심원 평균 | 0.837 | 0.860 | 0.861 | 0.875 | 0.883 | 0.904 |
문장쌍 두 개를 놓고 봅니다. 쌍 A "한 남자가 기타를 치고 있다 / 남자가 기타를 연주한다"는 사람 점수 4.8, 쌍 B "한 남자가 기타를 치고 있다 / 한 여자가 피아노를 친다"는 사람 점수 1.2입니다. 사람은 A가 B보다 비슷하다고 했습니다.
모델이 A에 5점, B에 3점을 줬다면 점수는 사람보다 높지만 "A가 B보다 비슷하다"는 판단은 같습니다. 순서가 맞은 것입니다. A에 3점, B에 4점을 줬다면 순서가 뒤집힌 것이고, 둘 다 4점을 줬다면 구분을 못 한 것입니다. ρ는 이 비교를 문항 전체에서 한꺼번에 해서 사람의 순서와 모델의 순서가 얼마나 같은지를 −1~+1 하나의 숫자로 요약합니다.
문항 셋으로 보면 더 분명합니다. 사람이 2·3·4점을 준 세 쌍에 모델이 3·4·5점을 주면 정확일치는 0/3이지만 순서는 완전히 같아 ρ = 1입니다. 사람이 1·3·5인데 모델이 2·4·5여도 ρ = 1입니다. 간격이 다르거나 전체가 위로 밀려 있어도 상관없습니다. 값이 내려가는 것은 순서가 뒤집힐 때(2·5·4)와 동점으로 구분을 못 할 때(4·5·5)뿐입니다. 배심원 평균이 개별 모델보다 ρ가 높은 이유가 여기 있습니다. 7개를 평균 내면 동점이 풀려서 사람이 가른 순서를 더 세밀하게 따라갑니다.
3사람 정답이 평균이니 배심원도 평균으로. 피어슨·스피어만 둘 다
확인: 맞습니다. 사람 정답은 평가자 평균(KLUE 7명, KorSTS·STS-B 5명)이고, 평균 집계가 중앙값 집계보다 모든 칸에서 ρ가 높습니다.
| 코퍼스 | 조건 | 중앙값 집계 ρ | 평균 집계 ρ | 평균 − 중앙값 | 평균 집계 r (피어슨) | 중앙값 집계 r |
|---|---|---|---|---|---|---|
| KorSTS | 블라인드 | 0.809 | 0.837 | +0.028 | 0.843 | 0.815 |
| KorSTS | 루브릭 | 0.837 | 0.860 | +0.022 | 0.863 | 0.841 |
| KLUE-STS | 블라인드 | 0.847 | 0.861 | +0.014 | 0.845 | 0.815 |
| KLUE-STS | 루브릭 | 0.860 | 0.875 | +0.016 | 0.866 | 0.839 |
| STS-B | 블라인드 | 0.840 | 0.883 | +0.043 | 0.875 | 0.843 |
| STS-B | 루브릭 | 0.868 | 0.904 | +0.036 | 0.894 | 0.867 |
문항 세 개에 사람이 2.0, 2.4, 2.8점을 줬다고 합시다. 사람은 셋을 구분했습니다. 7모델 판정이 문항 1은 3·3·3·3·3·4·4, 문항 2는 3·3·3·3·4·4·4, 문항 3은 3·3·3·4·4·4·5라고 합시다.
중앙값은 가운데 표 하나만 보므로 셋 다 3입니다. 세 문항을 구분하지 못했으니 사람의 순서와 견줄 것이 없어 ρ가 내려갑니다. 평균은 3.29, 3.43, 3.71로 사람과 같은 순서가 나와 ρ = 1입니다. 나머지 여섯 표의 정보를 버리지 않기 때문입니다. 정수 표 7개의 중앙값은 다시 1~5 정수라 동점이 많고, 평균은 0.14 단위로 갈라져 사람 점수의 미세한 차이를 따라갑니다.
피어슨 r은 등수가 아니라 값 자체로 계산합니다. 위 예에서 평균(3.29 → 3.43 → 3.71)은 사람 점수(2.0 → 2.4 → 2.8)와 함께 직선으로 오르므로 r이 높고, 중앙값(3, 3, 3)은 변화가 없어 r을 계산할 수 없거나 낮습니다. 그래서 두 지표가 같은 방향을 가리킵니다. 실제 자료에서도 평균 집계의 ρ가 중앙값 집계보다 0.01~0.06 높았고, 위 표의 18칸 모두 그랬습니다.
정수 판정 7개의 중앙값은 다시 정수가 되어 동점이 많고, 그만큼 순위 정보가 뭉개집니다. 평균은 0.14 단위의 연속값이 되어 사람 점수의 미세한 순서를 따라갑니다. 피어슨 r도 같은 방향이며, 이 페이지의 모든 결과는 평균 집계, 정수화 없음 기준입니다.
4개별 LLM 모두보다 서열상관이 높은 조합을 시간을 참고해 찾기
결과: 세 코퍼스 공통 최적은 exaone + gpt-4o-mini + gpt-oss + haiku(블라인드), llama를 뺀 6개(루브릭)입니다.
| 코퍼스 | 조건 | 최고 단일 모델을 넘는 조합 | 자기 멤버 최고를 넘는 조합 | 크기 1 → 7 의 최고 ρ |
|---|---|---|---|---|
| KorSTS | 블라인드 | 85 / 120 | 100 / 120 | 0.815 → 0.838 → 0.846 → 0.851 → 0.848 → 0.843 → 0.837 |
| KorSTS | 루브릭 | 113 / 120 | 114 / 120 | 0.815 → 0.845 → 0.855 → 0.860 → 0.863 → 0.863 → 0.860 |
| KLUE-STS | 블라인드 | 81 / 120 | 87 / 120 | 0.843 → 0.871 → 0.876 → 0.879 → 0.878 → 0.878 → 0.861 |
| KLUE-STS | 루브릭 | 99 / 120 | 106 / 120 | 0.850 → 0.873 → 0.880 → 0.883 → 0.885 → 0.884 → 0.875 |
| STS-B | 블라인드 | 89 / 120 | 115 / 120 | 0.859 → 0.885 → 0.890 → 0.890 → 0.889 → 0.887 → 0.883 |
| STS-B | 루브릭 | 115 / 120 | 120 / 120 | 0.864 → 0.887 → 0.896 → 0.900 → 0.902 → 0.903 → 0.904 |
교차코퍼스 검증
| 조건 | 조합을 고른 코퍼스 | 고른 조합 | 고른 코퍼스에서의 ρ | 나머지 코퍼스에서 평가 |
|---|---|---|---|---|
| 블라인드 | KorSTS | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 0.851 | KLUE-STS 0.879 vs 최고 단일 0.843 (넘음) · STS-B 0.888 vs 최고 단일 0.859 (넘음) |
| 블라인드 | KLUE-STS | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 0.879 | KorSTS 0.851 vs 최고 단일 0.815 (넘음) · STS-B 0.888 vs 최고 단일 0.859 (넘음) |
| 블라인드 | STS-B | gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b | 0.890 | KorSTS 0.842 vs 최고 단일 0.815 (넘음) · KLUE-STS 0.875 vs 최고 단일 0.843 (넘음) |
| 블라인드 | 세 코퍼스 평균 최대 | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | KorSTS 0.851 (넘음) · KLUE-STS 0.879 (넘음) · STS-B 0.888 (넘음) | |
| 루브릭 | KorSTS | gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 0.863 | KLUE-STS 0.884 vs 최고 단일 0.850 (넘음) · STS-B 0.903 vs 최고 단일 0.864 (넘음) |
| 루브릭 | KLUE-STS | gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 0.885 | KorSTS 0.863 vs 최고 단일 0.815 (넘음) · STS-B 0.899 vs 최고 단일 0.864 (넘음) |
| 루브릭 | STS-B | gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + llama-3.1 8B | 0.904 | KorSTS 0.860 vs 최고 단일 0.815 (넘음) · KLUE-STS 0.875 vs 최고 단일 0.850 (넘음) |
| 루브릭 | 세 코퍼스 평균 최대 | gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | KorSTS 0.863 (넘음) · KLUE-STS 0.884 (넘음) · STS-B 0.903 (넘음) |
코퍼스별 상위 5개 조합 (블라인드)
KorSTS · 블라인드 상위 5개 조합
| 조합 | 크기 | ρ | 유료 API 수 | 단가 합 (입력 / 출력, $/1M 토큰) | 가장 느린 모델의 응답 (초) |
|---|---|---|---|---|---|
| exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 4 | 0.851 | 3 | 1.40 / 6.29 | 0.8 |
| gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 5 | 0.848 | 4 | 1.70 / 8.79 | 1.0 |
| gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 3 | 0.846 | 3 | 1.40 / 6.29 | 0.8 |
| exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + llama-3.1 8B | 5 | 0.845 | 3 | 1.40 / 6.29 | 0.8 |
| exaone-3.5 7.8B + gpt-4o-mini + claude-haiku-4.5 | 3 | 0.845 | 2 | 1.15 / 5.60 | 0.8 |
KLUE-STS · 블라인드 상위 5개 조합
| 조합 | 크기 | ρ | 유료 API 수 | 단가 합 (입력 / 출력, $/1M 토큰) | 가장 느린 모델의 응답 (초) |
|---|---|---|---|---|---|
| exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 4 | 0.879 | 3 | 1.40 / 6.29 | 0.8 |
| gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 5 | 0.878 | 4 | 1.70 / 8.79 | 1.0 |
| gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 6 | 0.878 | 4 | 1.70 / 8.79 | 1.1 |
| gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 5 | 0.878 | 3 | 1.40 / 6.29 | 1.1 |
| gemini-2.5-flash + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 4 | 0.877 | 4 | 1.70 / 8.79 | 1.0 |
STS-B · 블라인드 상위 5개 조합
| 조합 | 크기 | ρ | 유료 API 수 | 단가 합 (입력 / 출력, $/1M 토큰) | 가장 느린 모델의 응답 (초) |
|---|---|---|---|---|---|
| gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b | 4 | 0.890 | 3 | 0.70 / 3.79 | 0.9 |
| exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b | 3 | 0.890 | 2 | 0.40 / 1.29 | 0.6 |
| gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 5 | 0.889 | 4 | 1.70 / 8.79 | 0.9 |
| exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 | 4 | 0.888 | 3 | 1.40 / 6.29 | 0.8 |
| gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b | 5 | 0.887 | 3 | 0.70 / 3.79 | 1.1 |
13모델로 넓힌 조합 탐색9/17 추가
후보 6모델을 더해 13모델로 다시 찾아도 결론은 같고, 배심원은 더 좋아집니다. 13모델 평균은 세 코퍼스·네 조건 모두 14명 중 1위이고, 7모델 평균보다도 높습니다.
| 코퍼스 | 조건 | 최고 단일 (13개 중) | 7모델 평균 | 13모델 평균 | 13평균 − 최고 단일 [CI] | 14명 중 순위 | 최고 단일 넘는 조합 / 전체 | 최고 조합 (크기 · ρ) | 값싼 최고 조합 (크기 · ρ) |
|---|---|---|---|---|---|---|---|---|---|
| KorSTS | 블라인드 | 0.815 (gpt-4o-mini) | 0.837 | 0.852 | +0.038 [+0.027, +0.049] | 1위 | 8,018 / 8,178 | 9개 · 0.860 | 6개 · 0.855 |
| KorSTS | 루브릭 | 0.831 (GLM-5.3-Flash) | 0.860 | 0.873 | +0.042 [+0.029, +0.055] | 1위 | 8,122 / 8,178 | 9개 · 0.877 | 6개 · 0.874 |
| KLUE-STS | 블라인드 | 0.843 (gpt-oss-120b) | 0.861 | 0.866 | +0.023 [+0.002, +0.045] | 1위 | 7,504 / 8,178 | 7개 · 0.884 | 5개 · 0.874 |
| KLUE-STS | 루브릭 | 0.857 (gemma-3-27b) | 0.875 | 0.883 | +0.026 [+0.007, +0.046] | 1위 | 7,842 / 8,178 | 9개 · 0.893 | 5개 · 0.888 |
| STS-B | 블라인드 | 0.875 (solar-pro4) | 0.883 | 0.893 | +0.019 [+0.006, +0.031] | 1위 | 7,048 / 8,178 | 5개 · 0.904 | 4개 · 0.904 |
| STS-B | 루브릭 | 0.878 (solar-pro4) | 0.904 | 0.915 | +0.037 [+0.024, +0.049] | 1위 | 8,114 / 8,178 | 10개 · 0.917 | 7개 · 0.917 |
세 코퍼스 공통 조합 (13모델)9/17 추가
| 조건 | 후보 범위 | 세 코퍼스 평균 ρ가 가장 높은 조합 | 크기 | 코퍼스별 ρ (최고 단일 대비) | 입력 단가 합 ($/1M) |
|---|---|---|---|---|---|
| 블라인드 | 전체 13개 중 | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B | 8 | KorSTS 0.860 (넘음) · KLUE-STS 0.881 (넘음) · STS-B 0.901 (넘음) | 1.77 |
| 블라인드 | 값싼 모델만 | exaone-3.5 7.8B + solar-pro4 + GLM-5.3-Flash + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B | 6 | KorSTS 0.855 (넘음) · KLUE-STS 0.874 (넘음) · STS-B 0.898 (넘음) | 0.45 |
| 루브릭 | 전체 13개 중 | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B | 9 | KorSTS 0.877 (넘음) · KLUE-STS 0.891 (넘음) · STS-B 0.914 (넘음) | 1.80 |
| 루브릭 | 값싼 모델만 | exaone-3.5 7.8B + solar-pro4 + GLM-5.3-Flash + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B | 6 | KorSTS 0.874 (넘음) · KLUE-STS 0.888 (넘음) · STS-B 0.914 (넘음) | 0.45 |
크기 5·7·9·11에서 고른 최적 조합 — 평균 집계 vs 중앙값 집계9/17 추가
교수님 지시대로 배심원 크기를 5·7·9·11로 제한해 다시 골랐습니다. 평균 집계는 네 크기 모두 최고 단일 모델을 크게 넘고 7명에서 거의 정점입니다. 중앙값 집계는 평균보다 0.02~0.04 낮고 영어 STS-B에서는 solar-pro4 하나를 거의 넘지 못합니다.
| 조건 | 집계 | 크기 | 세 코퍼스 평균 ρ가 가장 높은 조합 | ρ (KorSTS / KLUE / STS-B) | 최고 단일 모델을 넘음 | 입력 단가 합 ($/1M) |
|---|---|---|---|---|---|---|
| 블라인드 | 평균 | 5 | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + solar-pro4 + Qwen3.5-9B | 0.854 / 0.876 / 0.902 | ○ / ○ / ○ | 0.59 |
| 블라인드 | 평균 | 7 | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B | 0.860 / 0.879 / 0.902 | ○ / ○ / ○ | 0.77 |
| 블라인드 | 평균 | 9 | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + solar-pro4 + GLM-5.3-Flash + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B | 0.860 / 0.881 / 0.898 | ○ / ○ / ○ | 1.85 |
| 블라인드 | 평균 | 11 | gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + solar-pro4 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B | 0.858 / 0.880 / 0.898 | ○ / ○ / ○ | 3.10 |
| 블라인드 | 중앙값 | 5 | exaone-3.5 7.8B + gpt-4o-mini + solar-pro4 + gemma-3-27b + Qwen3.5-9B | 0.828 / 0.860 / 0.880 | ○ / ○ / ○ | 0.42 |
| 블라인드 | 중앙값 | 7 | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + solar-pro4 + gemma-3-27b + Qwen3.5-9B | 0.828 / 0.865 / 0.871 | ○ / ○ / × | 1.67 |
| 블라인드 | 중앙값 | 9 | gemini-2.5-flash + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + llama-3.1 8B + solar-pro4 + gemma-3-27b + Qwen3.5-9B | 0.824 / 0.860 / 0.869 | ○ / ○ / × | 1.97 |
| 블라인드 | 중앙값 | 11 | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + llama-3.1 8B + solar-pro4 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B | 0.827 / 0.859 / 0.864 | ○ / ○ / × | 2.80 |
| 루브릭 | 평균 | 5 | exaone-3.5 7.8B + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B | 0.872 / 0.885 / 0.916 | ○ / ○ / ○ | 0.37 |
| 루브릭 | 평균 | 7 | exaone-3.5 7.8B + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B | 0.876 / 0.888 / 0.914 | ○ / ○ / ○ | 0.70 |
| 루브릭 | 평균 | 9 | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B | 0.877 / 0.891 / 0.914 | ○ / ○ / ○ | 1.80 |
| 루브릭 | 평균 | 11 | gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + solar-pro4 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B | 0.875 / 0.890 / 0.915 | ○ / ○ / ○ | 2.10 |
| 루브릭 | 중앙값 | 5 | gpt-4o-mini + claude-haiku-4.5 + GLM-5.3-Flash + gemma-3-27b + Qwen3.5-9B | 0.850 / 0.872 / 0.873 | ○ / ○ / × | 1.42 |
| 루브릭 | 중앙값 | 7 | exaone-3.5 7.8B + gpt-4o-mini + llama-3.1 8B + solar-pro4 + GLM-5.3-Flash + DeepSeek-V4-Flash + Qwen3.5-9B | 0.849 / 0.868 / 0.878 | ○ / ○ / × | 0.52 |
| 루브릭 | 중앙값 | 9 | exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B | 0.850 / 0.874 / 0.867 | ○ / ○ / × | 2.71 |
| 루브릭 | 중앙값 | 11 | gemini-2.5-flash + gemma-4 8B + exaone-3.5 7.8B + gpt-4o-mini + gpt-oss-120b + claude-haiku-4.5 + GLM-5.3-Flash + Kimi-K2.6 + gemma-3-27b + DeepSeek-V4-Flash + Qwen3.5-9B | 0.848 / 0.866 / 0.872 | ○ / ○ / × | 3.01 |
코퍼스별 · 크기별 최고 ρ와 최고 단일 모델을 넘는 조합 수 (평균 · 중앙값)
| 코퍼스 | 조건 | 집계 | 최고 단일 | k=5 최고 ρ (넘는 조합 수/전체) | k=7 최고 ρ (넘는 조합 수/전체) | k=9 최고 ρ (넘는 조합 수/전체) | k=11 최고 ρ (넘는 조합 수/전체) |
|---|---|---|---|---|---|---|---|
| KorSTS | 블라인드 | 평균 | 0.815 | 0.857 (1,269/1,287) | 0.860 (1,716/1,716) | 0.860 (715/715) | 0.858 (78/78) |
| KorSTS | 블라인드 | 중앙값 | 0.815 | 0.830 (496/1,287) | 0.832 (899/1,716) | 0.831 (517/715) | 0.827 (72/78) |
| KorSTS | 루브릭 | 평균 | 0.831 | 0.872 (1,287/1,287) | 0.876 (1,716/1,716) | 0.877 (715/715) | 0.876 (78/78) |
| KorSTS | 루브릭 | 중앙값 | 0.831 | 0.852 (1,106/1,287) | 0.855 (1,714/1,716) | 0.856 (715/715) | 0.853 (78/78) |
| KLUE-STS | 블라인드 | 평균 | 0.843 | 0.883 (1,067/1,287) | 0.884 (1,689/1,716) | 0.884 (715/715) | 0.882 (78/78) |
| KLUE-STS | 블라인드 | 중앙값 | 0.843 | 0.867 (577/1,287) | 0.866 (1,079/1,716) | 0.864 (570/715) | 0.861 (72/78) |
| KLUE-STS | 루브릭 | 평균 | 0.857 | 0.890 (1,196/1,287) | 0.892 (1,716/1,716) | 0.893 (715/715) | 0.892 (78/78) |
| KLUE-STS | 루브릭 | 중앙값 | 0.857 | 0.875 (766/1,287) | 0.874 (1,396/1,716) | 0.874 (675/715) | 0.871 (78/78) |
| STS-B | 블라인드 | 평균 | 0.875 | 0.904 (995/1,287) | 0.903 (1,619/1,716) | 0.901 (712/715) | 0.898 (78/78) |
| STS-B | 블라인드 | 중앙값 | 0.875 | 0.888 (25/1,287) | 0.880 (9/1,716) | 0.872 (0/715) | 0.869 (0/78) |
| STS-B | 루브릭 | 평균 | 0.878 | 0.916 (1,287/1,287) | 0.917 (1,716/1,716) | 0.917 (715/715) | 0.917 (78/78) |
| STS-B | 루브릭 | 중앙값 | 0.878 | 0.883 (25/1,287) | 0.887 (12/1,716) | 0.879 (1/715) | 0.876 (0/78) |
값싼 모델만으로 만든 조합(연구실 서버 3개 + solar-pro4 · GLM-5.3-Flash · gemma-3-27b · DeepSeek-V4-Flash · Qwen3.5-9B)도 세 코퍼스 모두에서 최고 단일 모델을 넘고, 전체 최적 조합과의 차이는 0.01 안쪽입니다. 교수님의 값싼 배심원 가설은 이 자료에서 성립합니다.
시간과 비용
| 모델 | KorSTS 응답 (초) | KLUE 응답 (초) | STS-B 응답 (초) | 단가 입력 / 출력 ($/1M 토큰) | 실행 위치 |
|---|---|---|---|---|---|
| gemini-2.5-flash | 1.03 | 1.00 | 0.92 | 0.30 / 2.50 | 유료 API |
| gemma-4 8B | 1.13 | 1.14 | 1.13 | 0.00 / 0.00 | 연구실 서버 (무료) |
| exaone-3.5 7.8B | 0.45 | 0.45 | 0.46 | 0.00 / 0.00 | 연구실 서버 (무료) |
| gpt-4o-mini | 0.66 | 0.65 | 0.65 | 0.15 / 0.60 | 유료 API |
| gpt-oss-120b | 0.45 | 0.45 | 0.45 | 0.25 / 0.69 | 유료 API |
| claude-haiku-4.5 | 0.75 | 0.83 | 0.80 | 1.00 / 5.00 | 유료 API |
| llama-3.1 8B | 0.67 | 0.67 | 0.68 | 0.00 / 0.00 | 연구실 서버 (무료) |
배심원은 병렬로 호출하므로 소요 시간은 가장 느린 모델이 정합니다. 네 모델 조합은 유료 API가 셋(gpt-4o-mini·gpt-oss·haiku)이고 exaone은 연구실 서버라 비용이 없습니다. 무료 모델만으로는(exaone·gemma·llama) 최고 단일 모델을 넘지 못했습니다.
5변환 규칙이 코퍼스마다 다르다는 지적
확인: 지적이 맞습니다. KorSTS·STS-B는 .5를 짝수 쪽으로, KLUE는 위로 반올림했습니다.
| 코퍼스 | 실제 적용된 규칙 | 규칙과 일치한 문항 | .5점 처리 | 일반 반올림으로 바꾸면 등급이 오르는 문항 | 0점 → 1등급 |
|---|---|---|---|---|---|
| KorSTS | 파이썬 round() (.5는 짝수 쪽) | 1,378 / 1,379 | 2.5 → 2, 4.5 → 4, 1.5 → 2, 3.5 → 4 | 15쌍 (2.5점 9, 4.5점 6) | 112쌍 |
| STS-B | 파이썬 round() (.5는 짝수 쪽) | 550 / 550 | 2.5 → 2, 4.5 → 4 | 6쌍 (2.5점 3, 4.5점 3) | 32쌍 |
| KLUE-STS | int(점수 + 0.5) (.5는 올림) | 519 / 519 | 2.5 → 3, 4.5 → 5 | 0쌍 (일반 반올림과 같음) | 0쌍 |
어디에 영향이 있나
| 영향 받는 곳 | 크기 | 설명 |
|---|---|---|
| 판정 값 자체 | 없음 | 블라인드·루브릭 프롬프트에는 사람 등급이 들어가지 않는다. 모델은 같은 두 문장을 보고 같은 답을 냈다. |
| 정확일치 등 등급 기준 지표 | 21쌍의 채점이 한 칸 이동 | 이전 노트의 수치에 소수점 첫째 자리 이하 영향. 새 분석(서열상관)은 등급을 쓰지 않아 영향 없음. |
| 정답+1 앵커 조건 | 21쌍의 앵커값이 한 칸 다름 | 정답+1 앵커는 정답 누설 문제로 어차피 대체 대상. 무작위 앵커는 정답과 무관해 영향 없음. |
| 등급별 층화 표집 | STS-B 표집 때 2.5점 3쌍·4.5점 3쌍이 다른 등급 통에서 뽑혔을 것 | STS-B는 원본 1,500쌍을 등급별 110쌍씩 뽑아 550쌍을 만들었다. 그때 등급을 round()로 만들었으므로 2.5점은 2등급 통, 4.5점은 4등급 통에서 추첨됐고, 일반 반올림이었다면 3등급·5등급 통에서 추첨돼 지금과 조금 다른 550쌍이 뽑혔을 수 있다. 다만 표집은 2026년 8월에 끝났고 그 550쌍에 대한 7모델 판정도 끝났으므로 표본과 판정은 그대로 쓴다. 등급별로 고르게 뽑는다는 표집 목적은 6쌍이 어느 통에 있든 달성됐다. 새 분석은 새로 수집한 것이 아니라 같은 판정을 지표만 바꿔 다시 계산한 것이고, 난이도를 나눌 때도 등급이 아니라 사람 점수를 1.67·3.33에서 자른 3층을 쓰므로(9번 참조) 반올림 규칙이 결과에 끼어들 자리가 없다. 논문에는 표집 때 쓴 규칙을 그대로 적는다. |
6STS-B 문장이 손상됐다는 지적
확인: 550쌍 중 4쌍이 손상됐습니다. 이 페이지의 STS-B 수치는 4쌍을 뺀 546쌍입니다.
| 문항 | 손상 유형 | 길이 변화 |
|---|---|---|
| stsb-0049 | 문장2에 다음 행 7개가 통째로 붙음 | 75자 → 1,871자 |
| stsb-0322 | 문장2에 다음 행 11개가 붙음 | 135자 → 2,405자 |
| stsb-0279 | 문장2에 다음 행이 붙음 | 87자 → 244자 |
| stsb-0361 | 문장1에 두 문장이 탭으로 붙고 문장2가 비어 있음 | 문장2 0자 |
손상 문항의 블라인드 정확일치는 39.3%(28건 중 11건)로 나머지 35.1%와 비슷해 결과를 흔들지는 않았지만, 프롬프트가 잘못된 문항이므로 제외가 맞습니다. 논문 원고에는 제외 사실과 원인을 한 줄로 적습니다.
7앵커는 어떻게 줄지, 지금은 사람 등급+1인가
답: 예, 본실험은 사람 등급+1(5는 4)이었습니다. 이 앵커는 정답을 누설해 서열상관을 올리므로, 정답과 무관한 무작위 앵커(1~5 균등)로 7모델 34,272건을 이미 다시 돌렸습니다.
| 코퍼스 | 비교 | 개별 모델 평균 ρ | Δρ [95% CI] | 배심원 평균 ρ | Δρ [95% CI] |
|---|---|---|---|---|---|
| KorSTS | 블라인드 → 정답+1 앵커 | 0.730 → 0.763 | +0.034 [+0.021, +0.045] | 0.837 → 0.883 | +0.046 [+0.032, +0.060] |
| KorSTS | 블라인드 → 무작위 앵커 | 0.730 → 0.644 | -0.086 [-0.099, -0.072] | 0.837 → 0.792 | -0.045 [-0.059, -0.031] |
| KorSTS | 루브릭 → 루브릭 + 정답+1 앵커 | 0.763 → 0.775 | +0.012 [+0.004, +0.020] | 0.860 → 0.882 | +0.023 [+0.015, +0.031] |
| KorSTS | 루브릭 → 루브릭 + 무작위 앵커 | 0.763 → 0.738 | -0.025 [-0.034, -0.017] | 0.860 → 0.846 | -0.014 [-0.023, -0.007] |
| KLUE-STS | 블라인드 → 정답+1 앵커 | 0.773 → 0.819 | +0.046 [+0.030, +0.062] | 0.861 → 0.901 | +0.040 [+0.022, +0.059] |
| KLUE-STS | 블라인드 → 무작위 앵커 | 0.773 → 0.680 | -0.092 [-0.115, -0.072] | 0.861 → 0.821 | -0.040 [-0.065, -0.017] |
| KLUE-STS | 루브릭 → 루브릭 + 정답+1 앵커 | 0.786 → 0.801 | +0.016 [+0.005, +0.027] | 0.875 → 0.902 | +0.026 [+0.014, +0.040] |
| KLUE-STS | 루브릭 → 루브릭 + 무작위 앵커 | 0.786 → 0.770 | -0.016 [-0.028, -0.005] | 0.875 → 0.874 | -0.001 [-0.015, +0.012] |
| STS-B | 블라인드 → 정답+1 앵커 | 0.786 → 0.782 | -0.005 [-0.018, +0.008] | 0.883 → 0.892 | +0.009 [-0.006, +0.023] |
| STS-B | 블라인드 → 무작위 앵커 | 0.786 → 0.724 | -0.062 [-0.078, -0.048] | 0.883 → 0.849 | -0.034 [-0.051, -0.019] |
| STS-B | 루브릭 → 루브릭 + 정답+1 앵커 | 0.821 → 0.824 | +0.003 [-0.006, +0.013] | 0.904 → 0.906 | +0.002 [-0.010, +0.014] |
| STS-B | 루브릭 → 루브릭 + 무작위 앵커 | 0.821 → 0.787 | -0.034 [-0.045, -0.024] | 0.904 → 0.894 | -0.010 [-0.021, +0.000] |
811개 LLM으로 최적 조합 탐색
결과: 여섯 모델을 3코퍼스 × 4조건(블라인드 · 루브릭 · 무작위 앵커 · 루브릭+무작위 앵커)에 모두 돌렸습니다. 58,752건, 실패 0건. 13모델 조합 탐색은 4번 절 아래에 있습니다.
| 모델 | 공급자 | 단가 입력 / 출력 ($/1M) | 응답 (초) | KorSTS 블라인드 | KorSTS 루브릭 | KLUE 블라인드 | KLUE 루브릭 | STS-B 블라인드 | STS-B 루브릭 |
|---|---|---|---|---|---|---|---|---|---|
| solar-pro4 | Upstage | 0.09 / 0.36 | 0.4 | 0.809 | 0.825 | 0.832 | 0.834 | 0.875 | 0.878 |
| GLM-5.3-Flash | DeepInfra | 0.09 / 0.30 | 2.2 | 0.801 | 0.831 | 0.804 | 0.841 | 0.789 | 0.856 |
| Kimi-K2.6 | OpenRouter | 0.95 / 4.00 | 1.2 | 0.793 | 0.803 | 0.802 | 0.840 | 0.808 | 0.824 |
| gemma-3-27b | DeepInfra | 0.08 / 0.45 | 1.0 | 0.800 | 0.822 | 0.818 | 0.857 | 0.802 | 0.849 |
| DeepSeek-V4-Flash | DeepInfra | 0.09 / 0.17 | 1.0 | 0.780 | 0.794 | 0.724 | 0.801 | 0.837 | 0.846 |
| Qwen3.5-9B | Together | 0.10 / 0.15 | 0.5 | 0.784 | 0.807 | 0.807 | 0.825 | 0.861 | 0.870 |
| 기존 7개 중 최고 | 0.815 | 0.815 | 0.843 | 0.850 | 0.859 | 0.864 | |||
| 13모델 평균 | 0.852 | 0.873 | 0.866 | 0.883 | 0.893 | 0.915 |
교수님 표의 GLM-4.7-Flash는 DeepInfra 목록에서 내려가 후속 GLM-5.3-Flash를, Kimi-K2는 K2.6을 썼습니다(DeepInfra는 과부하, Together는 미배포라 OpenRouter 경유). solar-pro4와 GLM은 추론 기능을 꺼야 숫자만 답합니다. 프롬프트·루브릭·무작위 앵커 값은 기존 7모델과 같습니다.
개별 모델로는 solar-pro4가 영어 STS-B에서 13개 중 1위(블라인드·루브릭 모두)이고, GLM-5.3-Flash가 KorSTS 루브릭과 무작위 앵커 조건에서 1위입니다. 한국어 KorSTS 블라인드에서는 여전히 gpt-4o-mini가 최고입니다. 기존 7개보다 후보 6개의 평균 ρ가 높고, 그래서 13모델 배심원이 7모델 배심원보다 좋아집니다.
후보 6모델의 앵커 끌림9/17 추가
| 코퍼스 | 기존 7 평균 Δρ | 후보 6 평균 Δρ | 13모델 배심원 Δρ [CI] | 후보 6 개별 Δρ |
|---|---|---|---|---|
| KorSTS | -0.086 | -0.109 | -0.052 [-0.067, -0.038] | solar-pro4 -0.145 · GLM-5.3-Flash -0.007 · Kimi-K2.6 -0.029 · gemma-3-27b -0.086 · DeepSeek-V4-Flash -0.356 · Qwen3.5-9B -0.033 |
| KLUE-STS | -0.092 | -0.061 | -0.032 [-0.054, -0.010] | solar-pro4 -0.125 · GLM-5.3-Flash +0.017 · Kimi-K2.6 -0.008 · gemma-3-27b -0.090 · DeepSeek-V4-Flash -0.147 · Qwen3.5-9B -0.014 |
| STS-B | -0.062 | -0.021 | -0.015 [-0.027, -0.003] | solar-pro4 -0.009 · GLM-5.3-Flash +0.025 · Kimi-K2.6 +0.029 · gemma-3-27b -0.043 · DeepSeek-V4-Flash -0.114 · Qwen3.5-9B -0.013 |
| 모델 | 제품 / 공급자 | 교수님 표 ρ (배심 평균과의 상관) | 교수님 표 가동 시간 (6만 편) | 우리 규모 환산 (4,896건, 같은 속도) | 우리 연구에서 |
|---|---|---|---|---|---|
| claude-haiku-4.5 | Anthropic API | 0.71 | 1.6시간 | 약 8분 | 배심원에 있음 |
| gpt-oss-120b | Cerebras Cloud | 0.71 | 57분 | 약 5분 | 배심원에 있음 |
| gpt-5-mini (비교) | OpenAI API | 0.69 | 2.0시간 | 약 10분 | 고급 패널에서 블라인드만 실험 |
| solar-pro4 | Upstage Console | 0.68 | 1.6시간 | 약 8분 | 후보 1 · 한국어 강점 |
| GLM-4.7-Flash | DeepInfra | 0.68 | 1.3시간 | 약 6분 | 후보 2 |
| Kimi-K2 | DeepInfra | 0.67 | 1.6시간 | 약 8분 | 후보 3 |
| gemini-2.5-flash | Google AI Studio | 0.62 | 48분 | 약 4분 | 배심원에 있음 |
| gpt-4o-mini | OpenAI API | 0.58 | 39분 | 약 3분 | 배심원에 있음 |
| Qwen3.5-9B | Together AI | 0.57 | 2.1시간 | 약 10분 | 후보 4 |
| gemma-3-27b | DeepInfra | 0.56 | 2.1시간 | 약 10분 | 후보 5 |
| Llama-3.1-8B | DeepInfra | 0.51 | 2.7시간 | 약 13분 | 배심원에 있음 (연구실 서버) |
| DeepSeek-V4-Flash | DeepInfra | 0.44 | 52분 | 약 4분 | 후보 6 |
9등급별·난이도별도 서열상관으로, 왜 서열상관인지 설명
난이도 층 안에서도 배심원 평균이 대부분 최고 단일 모델보다 높습니다. 다만 층 안에서는 ρ가 전체보다 크게 낮아지므로 읽을 때 주의가 필요합니다.
층별 수치 전체 표 (KLUE 평가자 불일치 3층 포함)
| 코퍼스 | 층 기준 | 층 | n | 층 안 사람 점수 SD | 최고 단일 ρ | 개별 평균 ρ | 배심원 평균 ρ | 배심원 − 최고 단일 [CI] |
|---|---|---|---|---|---|---|---|---|
| KorSTS | 사람 점수 3층 | 하 (0~1.67) | 407 | 0.54 | 0.548 | 0.540 | 0.669 | +0.120 [+0.084, +0.160] |
| KorSTS | 사람 점수 3층 | 중 (1.67~3.33) | 438 | 0.47 | 0.464 | 0.381 | 0.504 | +0.040 [+0.002, +0.089] |
| KorSTS | 사람 점수 3층 | 상 (3.33~5) | 534 | 0.54 | 0.365 | 0.312 | 0.428 | +0.063 [+0.018, +0.107] |
| KLUE-STS | 사람 점수 3층 | 하 (0~1.67) | 178 | 0.48 | 0.532 | 0.421 | 0.534 | +0.002 [-0.075, +0.087] |
| KLUE-STS | 사람 점수 3층 | 중 (1.67~3.33) | 165 | 0.49 | 0.495 | 0.373 | 0.508 | +0.013 [-0.066, +0.098] |
| KLUE-STS | 사람 점수 3층 | 상 (3.33~5) | 176 | 0.47 | 0.060 | 0.234 | 0.308 | +0.248 [+nan, +nan] |
| KLUE-STS | 평가자 불일치 3층 | 낮음 (쉬움) | 198 | 1.84 | 0.885 | 0.832 | 0.881 | -0.004 [-0.037, +0.023] |
| KLUE-STS | 평가자 불일치 3층 | 중간 | 149 | 1.40 | 0.802 | 0.766 | 0.866 | +0.064 [+0.023, +0.114] |
| KLUE-STS | 평가자 불일치 3층 | 높음 (어려움) | 172 | 0.98 | 0.719 | 0.604 | 0.717 | -0.002 [-0.055, +0.055] |
| STS-B | 사람 점수 3층 | 하 (0~1.67) | 129 | 0.58 | 0.703 | 0.639 | 0.751 | +0.048 [-0.005, +0.097] |
| STS-B | 사람 점수 3층 | 중 (1.67~3.33) | 185 | 0.50 | 0.486 | 0.379 | 0.499 | +0.013 [-0.070, +0.098] |
| STS-B | 사람 점수 3층 | 상 (3.33~5) | 232 | 0.55 | 0.611 | 0.416 | 0.608 | -0.003 [-0.082, +0.072] |
왜 서열상관인가 (설명 초안)
10상호정보 교환 앵커 — 가설 49/18 추가
결과: 의견은 강하게 수렴하고 약한 개별 모델은 좋아지지만, 배심원의 ρ는 세 코퍼스 모두 내려갑니다. 루브릭을 넣어도, 3라운드까지 가도 같습니다.
13모델 × 2,444문항을 루브릭 없음·있음 두 조건으로 돌렸습니다(라운드 판정 133,835건, 실패 0). 다른 판정자의 순서는 문항마다 고정 무작위이고 모델 이름은 가리며, 점수를 바꿔도 유지해도 된다고 명시했습니다. 온도 0.
| 조건 | 코퍼스 | 개별 평균 ρ | 최고 단일 ρ | 배심원 13 평균 ρ | 14명 중 순위 | 최적 7 조합 ρ | R1 → R2 배심원 Δρ [CI] |
|---|---|---|---|---|---|---|---|
| 루브릭 없음 | KorSTS | 0.760 → 0.760 → 0.793 | 0.815 → 0.821 → 0.823 | 0.852 → 0.863 → 0.848 | 1 → 1 → 1 | 0.860 → 0.866 → 0.850 | -0.015 [-0.020, -0.008] |
| 루브릭 없음 | KLUE-STS | 0.784 → 0.769 → 0.798 → 0.814 | 0.843 → 0.842 → 0.842 → 0.835 | 0.866 → 0.862 → 0.831 → 0.835 | 1 → 1 → 5 → 2 | 0.879 → 0.879 → 0.857 → 0.839 | -0.032 [-0.049, -0.015] |
| 루브릭 없음 | STS-B | 0.806 → 0.807 → 0.823 | 0.875 → 0.865 → 0.844 | 0.893 → 0.893 → 0.863 | 1 → 1 → 1 | 0.902 → 0.900 → 0.862 | -0.030 [-0.040, -0.020] |
| 루브릭 있음 | KorSTS | 0.786 → 0.780 → 0.809 | 0.831 → 0.813 → 0.829 | 0.873 → 0.872 → 0.857 | 1 → 1 → 1 | 0.875 → 0.869 → 0.858 | -0.015 [-0.022, -0.009] |
| 루브릭 있음 | KLUE-STS | 0.808 → 0.804 → 0.821 | 0.857 → 0.844 → 0.850 | 0.883 → 0.877 → 0.844 | 1 → 1 → 2 | 0.886 → 0.880 → 0.870 | -0.034 [-0.054, -0.017] |
| 루브릭 있음 | STS-B | 0.836 → 0.834 → 0.840 | 0.878 → 0.860 → 0.859 | 0.915 → 0.906 → 0.877 | 1 → 1 → 1 | 0.916 → 0.901 → 0.877 | -0.029 [-0.042, -0.016] |
수렴: 얼마나, 어느 쪽으로
| 조건 | 코퍼스 | 단계 | 문항별 13모델 점수 SD | 만장일치 문항 | 바뀐 판정 | 그중 다른 판정자 쪽 | 그중 정답에 가까워짐 / 멀어짐 | 평균 점수 (사람 평균) |
|---|---|---|---|---|---|---|---|---|
| 루브릭 없음 | KorSTS | R1 → R2 | 0.59 → 0.34 | 5% → 21% | 30% | 98% | 41% / 58% | 3.66 → 3.78 (2.61) |
| 루브릭 없음 | KLUE-STS | R1 → R2 | 0.49 → 0.27 | 16% → 35% | 23% | 98% | 33% / 67% | 4.09 → 4.19 (2.48) |
| 루브릭 없음 | KLUE-STS | R2 → R3 | 0.27 → 0.10 | 35% → 72% | 11% | 100% | 40% / 59% | 4.19 → 4.22 (2.48) |
| 루브릭 없음 | STS-B | R1 → R2 | 0.47 → 0.22 | 4% → 45% | 28% | 99% | 40% / 60% | 3.83 → 3.96 (2.86) |
| 루브릭 있음 | KorSTS | R1 → R2 | 0.55 → 0.32 | 5% → 32% | 30% | 96% | 40% / 58% | 3.67 → 3.78 (2.61) |
| 루브릭 있음 | KLUE-STS | R1 → R2 | 0.46 → 0.25 | 9% → 43% | 23% | 96% | 33% / 67% | 4.05 → 4.15 (2.48) |
| 루브릭 있음 | STS-B | R1 → R2 | 0.43 → 0.21 | 9% → 47% | 25% | 98% | 38% / 62% | 3.82 → 3.94 (2.86) |
3라운드까지 가면 (KLUE)
| 단계 | 개별 평균 ρ | 최고 단일 ρ | 배심원 13 평균 ρ | 14명 중 순위 | 최적 7 조합 ρ |
|---|---|---|---|---|---|
| 기준선 | 0.784 | 0.843 | 0.866 | 1 | 0.879 |
| R1 | 0.769 | 0.842 | 0.862 | 1 | 0.879 |
| R2 | 0.798 | 0.842 | 0.831 | 5 | 0.857 |
| R3 | 0.814 | 0.835 | 0.835 | 2 | 0.839 |
모델별 ρ 변화 (루브릭 없음)
| 모델 | KorSTS 기준선 → R1 → R2 | KLUE 기준선 → R1 → R2 | STS-B 기준선 → R1 → R2 |
|---|---|---|---|
| gemini-2.5-flash | 0.740 → 0.718 → 0.774 | 0.751 → 0.657 → 0.726 | 0.809 → 0.737 → 0.778 |
| gemma-4 8B | 0.685 → 0.724 → 0.804 | 0.778 → 0.766 → 0.831 | 0.764 → 0.759 → 0.837 |
| exaone-3.5 7.8B | 0.795 → 0.760 → 0.787 | 0.822 → 0.801 → 0.831 | 0.859 → 0.853 → 0.825 |
| gpt-4o-mini | 0.815 → 0.794 → 0.823 | 0.841 → 0.837 → 0.842 | 0.851 → 0.834 → 0.840 |
| gpt-oss-120b | 0.785 → 0.793 → 0.812 | 0.843 → 0.839 → 0.819 | 0.818 → 0.804 → 0.834 |
| claude-haiku-4.5 | 0.811 → 0.817 → 0.808 | 0.837 → 0.842 → 0.841 | 0.811 → 0.833 → 0.844 |
| llama-3.1 8B | 0.478 → 0.522 → 0.639 | 0.537 → 0.484 → 0.622 | 0.592 → 0.708 → 0.809 |
| solar-pro4 | 0.809 → 0.806 → 0.814 | 0.832 → 0.824 → 0.837 | 0.875 → 0.865 → 0.828 |
| GLM-5.3-Flash | 0.801 → 0.778 → 0.817 | 0.804 → 0.756 → 0.811 | 0.789 → 0.803 → 0.812 |
| Kimi-K2.6 | 0.793 → 0.794 → 0.806 | 0.802 → 0.794 → 0.804 | 0.808 → 0.836 → 0.825 |
| gemma-3-27b | 0.800 → 0.789 → 0.816 | 0.818 → 0.805 → 0.819 | 0.802 → 0.781 → 0.832 |
| DeepSeek-V4-Flash | 0.780 → 0.821 → 0.821 | 0.724 → 0.827 → 0.807 | 0.837 → 0.863 → 0.841 |
| Qwen3.5-9B | 0.784 → 0.769 → 0.792 | 0.807 → 0.768 → 0.792 | 0.861 → 0.811 → 0.801 |
수렴은 분명합니다. 문항별 13모델 점수의 표준편차가 절반 이하로 줄고 만장일치 문항이 4~16%에서 21~47%로, 3라운드에서는 72%까지 늘어납니다. 바뀐 판정의 96~99%가 다른 판정자들 쪽으로 움직였습니다.
그러나 수렴의 방향은 정답이 아니라 다수입니다. 바뀐 판정 가운데 정답에 가까워진 것은 33~41%, 멀어진 것은 58~67%입니다. 개별 모델은 다수를 따라가서 평균 ρ가 오르고 특히 약한 모델(llama-3.1, gemma-4)이 크게 오르지만, 강한 모델은 제자리거나 내려갑니다. 그 결과 13모델이 "같은 의견 13개"가 되어, 평균을 낼 때 서로 상쇄되던 독립적인 오차가 사라지고 배심원 ρ가 내려갑니다. 최적 7모델 조합도 같이 내려갑니다.
루브릭은 이 효과를 막지 못했고(하락 폭이 거의 같음), 라운드를 더 돌려도 회복되지 않습니다(KLUE R3: 만장일치 72%, 배심원 ρ 제자리, 최적 조합은 더 하락). 근거를 쓰게 하는 것 자체(R1)는 배심원에 이롭지 않았습니다.
가설 4 문안(초안): 판단 근거를 공유하는 라운드는 배심원의 의견을 수렴시키고 약한 개별 모델을 끌어올리지만, 배심원 전체의 사람 정답과의 서열상관은 낮추며, 이 효과는 루브릭 유무와 라운드 수에 무관하다. 정답+1 앵커(누설), 무작위 앵커(끌림), 상호정보 교환(동조)은 모두 배심원의 독립성을 깨뜨리는 방향으로 작용한다. 배심원은 서로 모르고 판정할 때 가장 좋다.