0한 장 요약
배심원이 진 이유는 실수가 무작위가 아니라서입니다. 7개 모델이 모두 사람보다 0.8~1.3등급 높게 주고, 중앙값은 그 공통 치우침을 그대로 물려받습니다.
합치기 전에 각 모델의 척도를 사람 등급 분포에 맞추면(다른 코퍼스에서 추정한 보정) 배심원은 세 코퍼스 모두 개별 모델 평균을 넘고, 순위 지표에서는 1위이며, 배심원을 늘릴수록 좋아지는 곡선이 처음으로 나타납니다.
앵커를 정답과 무관한 무작위 값으로 바꾸면, 판정의 30%가 앵커 쪽으로 끌리고 순위 상관이 떨어지는 "독립성 붕괴"가 어떤 지표에서도 보입니다. 정확도가 오르내리는 방향은 앵커가 모델의 치우침과 같은 쪽인지에 달려 있습니다.
1진단: 왜 배심원이 졌나
사람 등급과 7모델 점수의 분포를 겹쳐 보면 원인이 바로 보입니다. 사람은 1~2등급을 많이 주는데 모델은 4~5점을 몰아줍니다. 7개가 같은 방향으로 틀리면 중앙값도 같은 방향으로 틀립니다.
| 모델 | KorSTS | KLUE-STS | STS-B |
|---|---|---|---|
| gemini | +1.18 | +1.66 | +0.94 |
| gemma | +1.17 | +1.57 | +0.79 |
| exaone | +0.66 | +1.23 | +0.63 |
| gpt-4o-mini | +0.57 | +1.21 | +0.67 |
| gpt-oss | +1.14 | +1.52 | +1.06 |
| haiku | +0.66 | +1.26 | +0.76 |
| llama | +0.50 | +0.90 | +0.81 |
| 7모델 평균 | +0.84 | +1.34 | +0.81 |
| 사람 등급 평균 → 모델 점수 평균 | 2.74 → 3.58 | 2.64 → 3.98 | 3.00 → 3.81 |
이 치우침은 모델 능력의 문제가 아닙니다. 8명 중 순위를 보면 중앙값 투표는 정확일치에서 4~6위이지만 순서를 맞히는 ρ에서는 1~3위입니다. 순서는 잘 매기는데 눈금이 위로 밀려 있는 것입니다.
| 코퍼스 | 정확일치 순위 | ρ 순위 | QWK 순위 | 중앙값 투표 정확일치 | 개별 모델 평균 | 최고 개별 모델 |
|---|---|---|---|---|---|---|
| KorSTS | 4위 | 3위 | 4위 | 30.6 | 30.8 | 39.9 (haiku) |
| KLUE-STS | 6위 | 1위 | 4위 | 14.3 | 17.6 | 26.2 (llama) |
| STS-B | 4위 | 3위 | 4위 | 36.4 | 35.1 | 42.4 (exaone) |
2처방: 합치기 전에 척도를 맞춘다
치우침이 원인이면 처방은 눈금을 맞추는 것입니다. 여기서 쓴 방법은 분위수 대응입니다. 7개 모델 점수의 평균(1~5 사이 29단계)을 구한 뒤, 그 값이 상위 몇 %인지에 따라 사람 등급 분포에서 같은 위치의 등급을 줍니다. 결과의 등급 분포가 사람 분포와 같아지도록 눈금을 옮기는 것뿐이고, 어느 문항이 어느 등급인지는 건드리지 않습니다.
| 코퍼스 | 사람 등급 분포 1/2/3/4/5 (%) | 보정 전 중앙값 투표 출력 | 보정 배심원 출력 |
|---|---|---|---|
| KorSTS | 27/18/21/23/11 | 6/12/20/42/20 | 35/18/29/10/8 |
| KLUE-STS | 31/17/20/21/11 | 2/9/16/31/43 | 19/17/16/15/34 |
| STS-B | 20/20/20/20/20 | 6/7/12/47/27 | 23/10/25/27/14 |
출력 분포가 사람 분포에 가까워졌고, 이전 시도(척도 보정)에서 0%가 됐던 5등급이 다시 살아났습니다(3절 등급별 표).
3결과 A: 보정 배심원 vs 개별 모델
| 코퍼스 | 배심원 (중앙값 → 보정) | 개별 모델 평균 (보정 전 → 후) | 최고 개별 모델 (보정 전 → 후) | 이득 = 배심원 − 개별 평균 | 앞서는 개별 모델 수 |
|---|---|---|---|---|---|
| KorSTS | 30.6 → 50.0 | 30.8 → 45.2 | 39.9 → 50.3 (gpt-4o-mini) | -0.2 → +4.8 | 4/7 → 6/7 |
| KLUE-STS | 14.3 → 40.5 | 17.6 → 37.6 | 26.2 → 45.1 (gpt-oss) | -3.3 → +2.9 | 0/7 → 5/7 |
| STS-B | 36.4 → 56.4 | 35.1 → 42.9 | 42.4 → 57.3 (exaone) | +1.3 → +13.4 | 4/7 → 6/7 |
배심원을 늘리면 좋아지는가
보정 전에는 1명에서 7명으로 늘려도 평평하거나 내려갔습니다. 보정 후에는 세 코퍼스 모두 올라갑니다. 치우침을 빼고 나면 "여럿이 모이면 낫다"는 원리가 처음으로 작동합니다.
8명 중 순위 (보정 전 → 후)
| 코퍼스 | 정확일치 | ±1 | MAE | ρ | QWK |
|---|---|---|---|---|---|
| KorSTS | 4위 → 2위 | 4위 → 3위 | 4위 → 2위 | 3위 → 1위 | 4위 → 1위 |
| KLUE-STS | 6위 → 3위 | 5위 → 2위 | 5위 → 3위 | 1위 → 1위 | 4위 → 1위 |
| STS-B | 4위 → 2위 | 4위 → 2위 | 4위 → 1위 | 3위 → 1위 | 4위 → 1위 |
등급별 정확일치 — 5등급이 살아 있는가
보정 배심원은 등급마다 고르게 맞힙니다. 정확일치 총점에서 근소하게 앞서는 최고 개별 모델은 특정 등급을 통째로 포기한 형태(0%)라, 등급별 평균으로 보면 배심원이 같거나 낫습니다.
| 1등급 | 2등급 | 3등급 | 4등급 | 5등급 | |
|---|---|---|---|---|---|
| KorSTS | |||||
| 보정 전 중앙값 | 20.3 | 7.0 | 11.3 | 56.7 | 73.1 |
| 보정 배심원 | 89.3 | 33.9 | 50.4 | 22.3 | 37.8 |
| 최고 개별 모델(보정, gpt-4o-mini) | 78.9 | 43.0 | 63.0 | 35.9 | 0.0 |
| KLUE-STS | |||||
| 보정 전 중앙값 | 4.4 | 2.2 | 1.9 | 9.1 | 96.4 |
| 보정 배심원 | 57.2 | 31.5 | 21.7 | 18.2 | 87.3 |
| 최고 개별 모델(보정, gpt-oss) | 61.6 | 0.0 | 26.4 | 98.2 | 0.0 |
| STS-B | |||||
| 보정 전 중앙값 | 30.9 | 3.6 | 5.5 | 58.2 | 83.6 |
| 보정 배심원 | 88.2 | 32.7 | 56.4 | 52.7 | 51.8 |
| 최고 개별 모델(보정, exaone) | 84.5 | 39.1 | 80.9 | 0.0 | 81.8 |
루브릭 효과 (보정 후)
| 코퍼스 | 보정 배심원 (블라인드 → 루브릭) | 개별 모델 평균 (보정) | 보정 전 중앙값 투표 |
|---|---|---|---|
| KorSTS | 50.0 → 51.2 (+1.2) | 45.2 → 47.1 (+1.9) | 30.6 → 33.9 (+3.3) |
| KLUE-STS | 40.5 → 45.3 (+4.8) | 37.6 → 41.1 (+3.5) | 14.3 → 15.8 (+1.5) |
| STS-B | 56.4 → 61.1 (+4.7) | 42.9 → 44.5 (+1.6) | 36.4 → 38.4 (+2.0) |
4결과 B: 조합을 바꾸면
7개 모델에서 홀수 개를 뽑는 57개 조합 전부에 대해 같은 보정을 적용했습니다. 막대는 "조합의 배심원 − 조합 멤버 평균"의 분포입니다. 0보다 오른쪽이면 그 조합에서 배심원이 임의의 멤버 하나보다 낫다는 뜻입니다.
| 판정 (보정 전 → 후) | KorSTS | KLUE-STS | STS-B | 세 코퍼스 모두 |
|---|---|---|---|---|
| (1) 조합 멤버 평균보다 좋음 | 28 → 50 | 1 → 39 | 39 → 56 | 1 → 34 |
| (1)+(2) 루브릭이면 더 좋음 | 26 → 40 | 1 → 39 | 31 → 48 | 1 → 24 |
| (4) 조합 멤버 중 최고 이상 | 0 → 18 | 0 → 10 | 0 → 33 | 0 → 2 |
| (1)+(2)+(4) | 0 → 17 | 0 → 10 | 0 → 27 | 0 → 1 |
교체 시뮬레이션 (보정 후, 블라인드 정확일치: 조합 배심원 / 멤버 평균 / 멤버 최고)
| 조합 | KorSTS | KLUE-STS | STS-B |
|---|---|---|---|
| 상위 3 (exaone, gpt-4o-mini, haiku) | 51.1 / 48.4 / 50.3 | 38.7 / 38.3 / 38.7 | 60.4 / 50.5 / 57.3 |
| 하위 3 (gemini, gemma, gpt-oss) | 45.9 / 45.5 / 48.0 | 38.5 / 40.7 / 45.1 | 39.6 / 41.3 / 42.7 |
| 상위 3 뺀 하위 5 | 46.8 / 43.9 / 48.0 | 39.9 / 37.4 / 45.1 | 55.3 / 39.1 / 46.4 |
| 하위 gemma·gpt-oss 뺀 5 | 50.0 / 45.6 / 50.3 | 40.5 / 36.8 / 42.8 | 58.4 / 43.7 / 57.3 |
| 7개 전체 | 50.0 / 45.2 / 50.3 | 40.5 / 37.6 / 45.1 | 56.4 / 42.9 / 57.3 |
같은 표, 보정 전
| 조합 | KorSTS | KLUE-STS | STS-B |
|---|---|---|---|
| 상위 3 (exaone, gpt-4o-mini, haiku) | 39.1 / 38.3 / 39.9 | 16.4 / 18.0 / 18.5 | 40.5 / 40.7 / 42.4 |
| 하위 3 (gemini, gemma, gpt-oss) | 23.4 / 24.8 / 26.9 | 12.9 / 14.4 / 14.6 | 34.4 / 33.9 / 35.6 |
| 상위 3 뺀 하위 5 | 25.7 / 28.1 / 39.9 | 14.3 / 17.3 / 26.2 | 34.4 / 32.3 / 37.8 |
| 하위 gemma·gpt-oss 뺀 5 | 36.5 / 33.6 / 39.9 | 15.6 / 19.0 / 26.2 | 38.2 / 36.0 / 42.4 |
| 7개 전체 | 30.6 / 30.8 / 39.9 | 14.3 / 17.6 / 26.2 | 36.4 / 35.1 / 42.4 |
5결과 C: 앵커를 정답과 떼어 놓으면
기존 앵커는 "정답 + 1"이었습니다. 정확일치는 크게 깎지만 정답과 거의 같이 움직이는 값이라, 순위 지표에서는 앵커를 따라갈수록 점수가 오르고 보정과 겹치면 정답을 흘립니다. 그래서 앵커를 1~5 균등 무작위(정답과 독립, 문항마다 고정)로 바꿔 7모델 × 2조건을 다시 받았습니다.
KorSTS (n = 1379, 앵커 = 정답인 문항 283건)
| 무작위 앵커 · 정확일치 | 블라인드 → 앵커 | 효과 [95% CI] | ρ | QWK | 루브릭 있을 때 효과 | 루브릭의 완화 |
|---|---|---|---|---|---|---|
| 개별 모델 평균 | 30.8 → 28.8 | -2.0 [-3.2, -0.8]* | 0.71 → 0.63 | 0.54 → 0.48 | +0.1 | +2.1 |
| 중앙값 투표 | 30.6 → 30.5 | -0.1 [-2.8, +2.2] | 0.79 → 0.72 | 0.61 → 0.54 | +2.1 | +2.2 |
| 보정 배심원 | 50.0 → 41.4 | -8.6 [-11.2, -5.9]* | 0.80 → 0.73 | 0.76 → 0.65 | -5.4 | +3.2 |
| 앵커가 정답인가로 나눠 보면 (정확일치, 블라인드 → 앵커) | 앵커 = 정답 (n=283) | 앵커 ≠ 정답 (n=1096) |
|---|---|---|
| 개별 모델 평균 | 29.9 → 38.7 | 31.0 → 26.2 |
| 중앙값 투표 | 30.0 → 40.6 | 30.7 → 27.9 |
| 보정 배심원 | 56.5 → 49.5 | 48.4 → 39.3 |
| 끌림 지표 | 무작위 앵커 | 정답+1 앵커 (기존) |
|---|---|---|
| 앵커 쪽으로 움직인 판정 / 반대쪽 | 30.2% / 2.2% | 26.0% / 0.4% |
| 표 = 앵커값 비율 (개별 모델, 블라인드 → 앵커) | 21.1% → 28.9% | 38.8% → 52.0% |
| 표 = 앵커값 비율 (중앙값 투표) | 21.2% → 32.6% | 46.4% → 65.8% |
| 평균 이동 (앵커 방향 +, 등급) | +0.31 | +0.27 |
| ρ 변화 (개별 / 중앙값 / 보정) | -0.08 / -0.07 / -0.07 | +0.05 / +0.07 / +0.06 |
KLUE-STS (n = 519, 앵커 = 정답인 문항 116건)
| 무작위 앵커 · 정확일치 | 블라인드 → 앵커 | 효과 [95% CI] | ρ | QWK | 루브릭 있을 때 효과 | 루브릭의 완화 |
|---|---|---|---|---|---|---|
| 개별 모델 평균 | 17.6 → 20.1 | +2.5 [+0.9, +4.0]* | 0.76 → 0.67 | 0.42 → 0.39 | +1.7 | -0.8 |
| 중앙값 투표 | 14.3 → 18.3 | +4.0 [+1.2, +6.6]* | 0.83 → 0.77 | 0.44 → 0.45 | +0.8 | -3.3 |
| 보정 배심원 | 40.5 → 46.4 | +6.0 [+0.6, +10.6]* | 0.85 → 0.80 | 0.76 → 0.77 | +4.8 | -1.2 |
| 앵커가 정답인가로 나눠 보면 (정확일치, 블라인드 → 앵커) | 앵커 = 정답 (n=116) | 앵커 ≠ 정답 (n=403) |
|---|---|---|
| 개별 모델 평균 | 18.0 → 27.0 | 17.5 → 18.1 |
| 중앙값 투표 | 14.7 → 22.4 | 14.1 → 17.1 |
| 보정 배심원 | 47.4 → 70.7 | 38.5 → 39.5 |
| 끌림 지표 | 무작위 앵커 | 정답+1 앵커 (기존) |
|---|---|---|
| 앵커 쪽으로 움직인 판정 / 반대쪽 | 29.9% / 1.7% | 24.3% / 0.4% |
| 표 = 앵커값 비율 (개별 모델, 블라인드 → 앵커) | 21.2% → 29.1% | 35.9% → 47.3% |
| 표 = 앵커값 비율 (중앙값 투표) | 20.8% → 30.6% | 37.0% → 49.5% |
| 평균 이동 (앵커 방향 +, 등급) | +0.31 | +0.25 |
| ρ 변화 (개별 / 중앙값 / 보정) | -0.09 / -0.06 / -0.05 | +0.06 / +0.05 / +0.05 |
STS-B (n = 550, 앵커 = 정답인 문항 101건)
| 무작위 앵커 · 정확일치 | 블라인드 → 앵커 | 효과 [95% CI] | ρ | QWK | 루브릭 있을 때 효과 | 루브릭의 완화 |
|---|---|---|---|---|---|---|
| 개별 모델 평균 | 35.1 → 35.2 | +0.1 [-1.6, +1.8] | 0.77 → 0.71 | 0.58 → 0.57 | +1.7 | +1.6 |
| 중앙값 투표 | 36.4 → 36.9 | +0.5 [-2.9, +4.0] | 0.83 → 0.79 | 0.63 → 0.65 | +2.4 | +1.8 |
| 보정 배심원 | 56.4 → 49.1 | -7.3 [-11.6, -2.9]* | 0.85 → 0.81 | 0.85 → 0.79 | -6.4 | +0.9 |
| 앵커가 정답인가로 나눠 보면 (정확일치, 블라인드 → 앵커) | 앵커 = 정답 (n=101) | 앵커 ≠ 정답 (n=449) |
|---|---|---|
| 개별 모델 평균 | 36.6 → 41.7 | 34.8 → 33.8 |
| 중앙값 투표 | 37.6 → 44.6 | 36.1 → 35.2 |
| 보정 배심원 | 57.4 → 71.3 | 56.1 → 44.1 |
| 끌림 지표 | 무작위 앵커 | 정답+1 앵커 (기존) |
|---|---|---|
| 앵커 쪽으로 움직인 판정 / 반대쪽 | 20.6% / 2.2% | 12.1% / 0.3% |
| 표 = 앵커값 비율 (개별 모델, 블라인드 → 앵커) | 19.1% → 20.8% | 39.7% → 41.9% |
| 표 = 앵커값 비율 (중앙값 투표) | 19.8% → 21.6% | 40.0% → 44.0% |
| 평균 이동 (앵커 방향 +, 등급) | +0.20 | +0.12 |
| ρ 변화 (개별 / 중앙값 / 보정) | -0.06 / -0.04 / -0.04 | +0.00 / +0.02 / +0.01 |
끌림은 분명합니다. 판정의 20~30%(KorSTS 30%, KLUE 30%, STS-B 21%)가 앵커 쪽으로 움직이고 반대쪽은 2%뿐이며, 순위 상관 ρ는 세 코퍼스의 개별 모델·중앙값 투표·보정 배심원 모두에서 떨어집니다(−0.04~−0.09). 정답+1 앵커에서 ρ가 올랐던 문제가 사라졌습니다.
정확도는 앵커가 모델의 치우침과 같은 방향인지에 달려 있습니다. 앵커가 틀렸을 때(앵커 ≠ 정답) KorSTS는 개별 −5.0, 보정 배심원 −9.0으로 내려가고, STS-B도 보정 배심원이 56.1 → 44.1로 크게 내려갑니다(개별·중앙값은 −1 안팎). KLUE는 모델이 위로 가장 심하게 치우친 코퍼스라 평균 3인 무작위 앵커가 점수를 아래로 끌어내려 우연히 정답에 가까워지고, 앵커 ≠ 정답 문항만 보면 변화가 거의 없습니다. 보정 배심원이 세 코퍼스 모두에서 가장 크게 다치는 이유는, 보정이 모델의 원래 치우침을 전제로 하는데 앵커가 그 치우침 자체를 바꿔 놓기 때문입니다.
중앙값 투표는 무작위 앵커에는 개별 모델보다 덜 흔들립니다(KorSTS 개별 −2.0 vs 중앙값 −0.1, STS-B +0.1 vs +0.5). 무작위 앵커는 30%만 움직이므로 중앙값을 뒤집으려면 4표 이상이 움직여야 하고, 배심원이 완충 역할을 합니다. 정답+1 앵커에서는 7표가 같은 방향으로 한꺼번에 쏠려 중앙값이 더 크게 무너졌습니다.
6정리: 세 문장은 어디서 성립하나
| 교수님 문장 | 보정 전 · 정확일치 | 보정 전 · 순위 지표(ρ·QWK) | 보정 배심원 (분위수 대응) |
|---|---|---|---|
| (1) 임의의 하나보다 좋다 | 부분 KorSTS·STS-B 비김, KLUE 짐 | 성립 세 코퍼스 유의 | 성립 +5.5 / +2.2 / +7.6, 7·5·6개 모델 앞섬 |
| (2) 루브릭이면 더 좋다 | 성립 | 성립 | 성립 +1.2 / +4.8 / +4.7 |
| (3) 앵커가 섞이면 나빠진다 | 성립 정답+1 앵커 | 반대 정답+1 앵커는 순위를 올림 | 부분 무작위 앵커: 끌림·ρ 하락은 모두 확인, 정확도는 KorSTS 하락·KLUE 상승 |
| (4) 최고 개별 모델을 넘는다 | 불성립 60셀 중 0 | 부분 ρ에서 최고와 동률 | 부분 정확일치 0.3~4.6점 차, ρ·QWK 1위, 등급별로는 더 고름 |
7부록: 시도했지만 안 된 것
보정에 이르기 전에 해 본 것들입니다. 심사 때 같은 질문이 나올 수 있어 기록으로 남깁니다.
지표를 바꿔 보기 (정확일치 → ±1, MAE, ρ, QWK, 민감도·특이도·F1)
| 지표 | KorSTS | KLUE-STS | STS-B |
|---|---|---|---|
| 정확일치 | 4위 | 6위 | 4위 |
| ±1 | 4위 | 5위 | 4위 |
| MAE | 4위 | 5위 | 4위 |
| ρ | 3위 | 1위 | 3위 |
| QWK | 4위 | 4위 | 4위 |
| 민감도 | 3위 | 3위 | 1위 |
| 특이도 | 5위 | 5위 | 3위 |
| F1 | 4위 | 5위 | 3위 |
상위 모델을 넣어 보기 (gpt-5.1, sonnet-5, gemini-3.7-flash, sonnet-4.6, kimi-k2.6, glm-5.3 블라인드 판정)
고급 6개를 섞어 13개 모델로 3·5명 조합 1,573개를 만들어도 자기 멤버 최고를 넘는 조합은 사실상 없고, gpt-5.1도 gpt-4o-mini를 넘지 못합니다. 등급을 정확히 맞히는 일은 모델 크기로 오르지 않습니다.
KorSTS (13모델 완전 문항 n = 959) · 3·5명 조합 1573개 중 자기 멤버 최고를 넘는 조합 3개
| 모델 / 배심원 | 정확일치 | ρ | QWK |
|---|---|---|---|
| gemini-3.7-flash (고급) | 46.5 | 0.84 | 0.78 |
| haiku-4.5 (소형) | 46.1 | 0.80 | 0.77 |
| gpt-4o-mini (소형) | 44.7 | 0.80 | 0.77 |
| exaone-3.5 (소형) | 42.5 | 0.79 | 0.73 |
| sonnet-5 (고급) | 42.3 | 0.82 | 0.75 |
| 중앙값 투표 · 13모델 전체 | 38.0 | 0.82 | 0.72 |
| 중앙값 투표 · 소형 7 | 37.2 | 0.80 | 0.70 |
| kimi-k2.6 (고급) | 36.2 | 0.78 | 0.67 |
| 중앙값 투표 · 고급 6 | 35.9 | 0.82 | 0.71 |
| sonnet-4.6 (고급) | 34.9 | 0.82 | 0.70 |
| gpt-5.1 (고급) | 32.7 | 0.82 | 0.68 |
| gemini-2.5-flash (소형) | 32.1 | 0.74 | 0.61 |
| glm-5.3 (고급) | 31.0 | 0.79 | 0.65 |
| llama-3.1 (소형) | 30.8 | 0.51 | 0.38 |
| gpt-oss-120b (소형) | 29.0 | 0.79 | 0.62 |
| gemma-4 (소형) | 28.4 | 0.69 | 0.51 |
KLUE-STS (13모델 완전 문항 n = 310) · 3·5명 조합 1573개 중 자기 멤버 최고를 넘는 조합 0개
| 모델 / 배심원 | 정확일치 | ρ | QWK |
|---|---|---|---|
| llama-3.1 (소형) | 35.2 | 0.38 | 0.32 |
| gpt-4o-mini (소형) | 24.2 | 0.74 | 0.50 |
| exaone-3.5 (소형) | 23.5 | 0.69 | 0.47 |
| sonnet-5 (고급) | 21.6 | 0.74 | 0.46 |
| gemma-4 (소형) | 21.3 | 0.64 | 0.33 |
| haiku-4.5 (소형) | 21.3 | 0.73 | 0.47 |
| 중앙값 투표 · 소형 7 | 20.6 | 0.73 | 0.41 |
| gemini-2.5-flash (소형) | 20.3 | 0.62 | 0.31 |
| gpt-oss-120b (소형) | 20.3 | 0.72 | 0.39 |
| sonnet-4.6 (고급) | 20.3 | 0.72 | 0.41 |
| kimi-k2.6 (고급) | 20.3 | 0.64 | 0.36 |
| glm-5.3 (고급) | 20.3 | 0.68 | 0.35 |
| gpt-5.1 (고급) | 20.0 | 0.72 | 0.45 |
| 중앙값 투표 · 고급 6 | 20.0 | 0.73 | 0.42 |
| gemini-3.7-flash (고급) | 19.7 | 0.75 | 0.45 |
| 중앙값 투표 · 13모델 전체 | 19.7 | 0.74 | 0.41 |
STS-B (13모델 완전 문항 n = 542) · 3·5명 조합 1573개 중 자기 멤버 최고를 넘는 조합 1개
| 모델 / 배심원 | 정확일치 | ρ | QWK |
|---|---|---|---|
| exaone-3.5 (소형) | 42.1 | 0.84 | 0.72 |
| gpt-4o-mini (소형) | 41.9 | 0.84 | 0.74 |
| gemini-3.7-flash (고급) | 41.9 | 0.86 | 0.74 |
| kimi-k2.6 (고급) | 38.6 | 0.81 | 0.64 |
| sonnet-4.6 (고급) | 37.8 | 0.84 | 0.69 |
| haiku-4.5 (소형) | 37.6 | 0.79 | 0.66 |
| glm-5.3 (고급) | 36.5 | 0.82 | 0.66 |
| 중앙값 투표 · 소형 7 | 36.3 | 0.82 | 0.63 |
| gemini-2.5-flash (소형) | 36.0 | 0.79 | 0.60 |
| 중앙값 투표 · 고급 6 | 35.8 | 0.85 | 0.68 |
| gpt-5.1 (고급) | 35.2 | 0.80 | 0.62 |
| 중앙값 투표 · 13모델 전체 | 34.9 | 0.85 | 0.67 |
| sonnet-5 (고급) | 34.5 | 0.84 | 0.65 |
| gemma-4 (소형) | 34.1 | 0.74 | 0.53 |
| gpt-oss-120b (소형) | 32.1 | 0.79 | 0.54 |
| llama-3.1 (소형) | 22.0 | 0.58 | 0.28 |
합치는 규칙 바꾸기 (평균·다수결·절사평균)와 선별 배심원
| 합치는 규칙 (블라인드 정확일치) | KorSTS | KLUE-STS | STS-B |
|---|---|---|---|
| 중앙값 | 30.6 | 14.3 | 36.4 |
| 평균 | 28.9 | 14.5 | 34.5 |
| 다수결 | 32.8 | 15.0 | 36.9 |
| 절사평균 | 29.8 | 14.6 | 36.0 |
| 보정 중앙값 α=0.5 | 40.4 | 24.7 | 34.5 |
| 보정 중앙값 α=1.0 | 48.9 | 38.0 | 42.9 |
| 척도 보정 중앙값 | 51.1 | 43.0 | 49.1 |
| 코퍼스 | 만장일치 비율 | 만장일치일 때 정확일치 | 갈리면 gpt-4o-mini에 넘길 때 최고 성적 | 항상 gpt-4o-mini |
|---|---|---|---|---|
| KorSTS | 3.3% | 58.7 | 39.1 | 39.1 |
| KLUE-STS | 11.8% | 24.6 | 18.5 | 18.5 |
| STS-B | 14.5% | 32.5 | 42.0 | 42.0 |