← LLM 배심원 연구 포털  ·  논문 해설 노트 추가 분석 노트 · 검토용 · 2026-09-15
LLM 배심원 연구 · 추가 분석검토용 · 논문 미반영

배심원을 살리는 조건
— 치우침을 빼고, 앵커를 정답과 떼어 놓으면

논문 해설 노트의 결론은 "7모델 중앙값 투표는 개별 모델을 이기지 못했다"였습니다. 교수님 피드백 이후 왜 그런지 원인을 찾고, 원인을 제거한 설계로 같은 68,544건 판정을 다시 분석했습니다. 이 페이지는 그 설계와 결과를 보여 주고, 결론은 내리지 않습니다.

2026-09-15 기준. 새로 받은 판정은 무작위 앵커 조건(7모델 × 2조건 × 3코퍼스 = 34,272건, 실패 0)뿐이며 나머지는 기존 자료를 다시 계산한 것입니다. 원자료와 스크립트는 연구 포털의 재현 패키지와 같은 폴더에 있습니다.

0한 장 요약

보정 배심원 정확일치 (KorSTS / KLUE / STS-B)
50.0 / 40.5 / 56.4%
개별 모델 평균 (같은 보정)
45.2 / 37.6 / 42.9%
8명 중 순위 (정확일치 · ρ · QWK)
2·1·1위 / 3·1·1위 / 2·1·1위
무작위 앵커: 앵커 쪽으로 움직인 판정 / 반대쪽
30.2% / 2.2%KorSTS
세 줄

배심원이 진 이유는 실수가 무작위가 아니라서입니다. 7개 모델이 모두 사람보다 0.8~1.3등급 높게 주고, 중앙값은 그 공통 치우침을 그대로 물려받습니다.

합치기 전에 각 모델의 척도를 사람 등급 분포에 맞추면(다른 코퍼스에서 추정한 보정) 배심원은 세 코퍼스 모두 개별 모델 평균을 넘고, 순위 지표에서는 1위이며, 배심원을 늘릴수록 좋아지는 곡선이 처음으로 나타납니다.

앵커를 정답과 무관한 무작위 값으로 바꾸면, 판정의 30%가 앵커 쪽으로 끌리고 순위 상관이 떨어지는 "독립성 붕괴"가 어떤 지표에서도 보입니다. 정확도가 오르내리는 방향은 앵커가 모델의 치우침과 같은 쪽인지에 달려 있습니다.

1진단: 왜 배심원이 졌나

사람 등급과 7모델 점수의 분포를 겹쳐 보면 원인이 바로 보입니다. 사람은 1~2등급을 많이 주는데 모델은 4~5점을 몰아줍니다. 7개가 같은 방향으로 틀리면 중앙값도 같은 방향으로 틀립니다.

사람 등급 분포 vs 7모델 점수 분포블라인드, 전체 표
치우침 = 모델 점수 − 사람 등급의 평균(블라인드). 양수면 사람보다 높게 준다.
모델KorSTSKLUE-STSSTS-B
gemini+1.18+1.66+0.94
gemma+1.17+1.57+0.79
exaone+0.66+1.23+0.63
gpt-4o-mini+0.57+1.21+0.67
gpt-oss+1.14+1.52+1.06
haiku+0.66+1.26+0.76
llama+0.50+0.90+0.81
7모델 평균+0.84+1.34+0.81
사람 등급 평균 → 모델 점수 평균2.74 → 3.582.64 → 3.983.00 → 3.81

이 치우침은 모델 능력의 문제가 아닙니다. 8명 중 순위를 보면 중앙값 투표는 정확일치에서 4~6위이지만 순서를 맞히는 ρ에서는 1~3위입니다. 순서는 잘 매기는데 눈금이 위로 밀려 있는 것입니다.

보정 전 7모델 중앙값 투표를 개별 모델 7개와 함께 8명으로 줄 세운 순위(블라인드).
코퍼스정확일치 순위ρ 순위QWK 순위중앙값 투표 정확일치개별 모델 평균최고 개별 모델
KorSTS4위3위4위30.630.839.9 (haiku)
KLUE-STS6위1위4위14.317.626.2 (llama)
STS-B4위3위4위36.435.142.4 (exaone)

2처방: 합치기 전에 척도를 맞춘다

치우침이 원인이면 처방은 눈금을 맞추는 것입니다. 여기서 쓴 방법은 분위수 대응입니다. 7개 모델 점수의 평균(1~5 사이 29단계)을 구한 뒤, 그 값이 상위 몇 %인지에 따라 사람 등급 분포에서 같은 위치의 등급을 줍니다. 결과의 등급 분포가 사람 분포와 같아지도록 눈금을 옮기는 것뿐이고, 어느 문항이 어느 등급인지는 건드리지 않습니다.

17개 모델이 각자 1~5점
27개 점수의 평균 (예: 3.86)
3이 값이 상위 몇 %인가 → 사람 등급 분포의 같은 위치
4배심원 등급 (1~5)
공정성 장치
대응표는 채점할 코퍼스가 아니라 나머지 두 코퍼스의 블라인드 판정에서 만듭니다(KorSTS를 채점할 때는 KLUE와 STS-B에서 추정). 같은 데이터로 맞추고 채점하는 순환이 없고, 영어 STS-B는 한국어 두 코퍼스에서 만든 표로 보정됩니다. 개별 모델을 비교할 때도 같은 방식으로 각 모델을 보정했습니다.
코퍼스사람 등급 분포 1/2/3/4/5 (%)보정 전 중앙값 투표 출력보정 배심원 출력
KorSTS27/18/21/23/116/12/20/42/2035/18/29/10/8
KLUE-STS31/17/20/21/112/9/16/31/4319/17/16/15/34
STS-B20/20/20/20/206/7/12/47/2723/10/25/27/14

출력 분포가 사람 분포에 가까워졌고, 이전 시도(척도 보정)에서 0%가 됐던 5등급이 다시 살아났습니다(3절 등급별 표).

3결과 A: 보정 배심원 vs 개별 모델

보정 전후 정확일치블라인드, 개별 모델도 같은 보정
코퍼스배심원 (중앙값 → 보정)개별 모델 평균 (보정 전 → 후)최고 개별 모델 (보정 전 → 후)이득 = 배심원 − 개별 평균앞서는 개별 모델 수
KorSTS30.6 → 50.030.8 → 45.239.9 → 50.3 (gpt-4o-mini)-0.2 → +4.84/7 → 6/7
KLUE-STS14.3 → 40.517.6 → 37.626.2 → 45.1 (gpt-oss)-3.3 → +2.90/7 → 5/7
STS-B36.4 → 56.435.1 → 42.942.4 → 57.3 (exaone)+1.3 → +13.44/7 → 6/7

배심원을 늘리면 좋아지는가

보정 전에는 1명에서 7명으로 늘려도 평평하거나 내려갔습니다. 보정 후에는 세 코퍼스 모두 올라갑니다. 치우침을 빼고 나면 "여럿이 모이면 낫다"는 원리가 처음으로 작동합니다.

배심원 크기 1 → 3 → 5 → 7같은 크기의 모든 조합 평균

8명 중 순위 (보정 전 → 후)

코퍼스정확일치±1MAEρQWK
KorSTS4위 → 2위4위 → 3위4위 → 2위3위 → 1위4위 → 1위
KLUE-STS6위 → 3위5위 → 2위5위 → 3위1위 → 1위4위 → 1위
STS-B4위 → 2위4위 → 2위4위 → 1위3위 → 1위4위 → 1위

등급별 정확일치 — 5등급이 살아 있는가

보정 배심원은 등급마다 고르게 맞힙니다. 정확일치 총점에서 근소하게 앞서는 최고 개별 모델은 특정 등급을 통째로 포기한 형태(0%)라, 등급별 평균으로 보면 배심원이 같거나 낫습니다.

등급별 정확일치 %(블라인드). 이전 시도의 척도 보정은 5등급이 0%였고, 분위수 대응은 5등급을 되살렸다.
1등급2등급3등급4등급5등급
KorSTS
보정 전 중앙값20.37.011.356.773.1
보정 배심원89.333.950.422.337.8
최고 개별 모델(보정, gpt-4o-mini)78.943.063.035.90.0
KLUE-STS
보정 전 중앙값4.42.21.99.196.4
보정 배심원57.231.521.718.287.3
최고 개별 모델(보정, gpt-oss)61.60.026.498.20.0
STS-B
보정 전 중앙값30.93.65.558.283.6
보정 배심원88.232.756.452.751.8
최고 개별 모델(보정, exaone)84.539.180.90.081.8

루브릭 효과 (보정 후)

루브릭 조건에도 블라인드에서 추정한 같은 대응표를 적용했다.
코퍼스보정 배심원 (블라인드 → 루브릭)개별 모델 평균 (보정)보정 전 중앙값 투표
KorSTS50.0 → 51.2 (+1.2)45.2 → 47.1 (+1.9)30.6 → 33.9 (+3.3)
KLUE-STS40.5 → 45.3 (+4.8)37.6 → 41.1 (+3.5)14.3 → 15.8 (+1.5)
STS-B56.4 → 61.1 (+4.7)42.9 → 44.5 (+1.6)36.4 → 38.4 (+2.0)

4결과 B: 조합을 바꾸면

7개 모델에서 홀수 개를 뽑는 57개 조합 전부에 대해 같은 보정을 적용했습니다. 막대는 "조합의 배심원 − 조합 멤버 평균"의 분포입니다. 0보다 오른쪽이면 그 조합에서 배심원이 임의의 멤버 하나보다 낫다는 뜻입니다.

57개 조합: 배심원 − 멤버 평균 (정확일치 %p)보정 전 vs 보정 후
57개 조합 중 성립하는 조합 수. (1)(2)(4)는 교수님 문장에 대응.
판정 (보정 전 → 후)KorSTSKLUE-STSSTS-B세 코퍼스 모두
(1) 조합 멤버 평균보다 좋음28 → 501 → 3939 → 561 → 34
(1)+(2) 루브릭이면 더 좋음26 → 401 → 3931 → 481 → 24
(4) 조합 멤버 중 최고 이상0 → 180 → 100 → 330 → 2
(1)+(2)+(4)0 → 170 → 100 → 270 → 1

교체 시뮬레이션 (보정 후, 블라인드 정확일치: 조합 배심원 / 멤버 평균 / 멤버 최고)

조합KorSTSKLUE-STSSTS-B
상위 3 (exaone, gpt-4o-mini, haiku)51.1 / 48.4 / 50.338.7 / 38.3 / 38.760.4 / 50.5 / 57.3
하위 3 (gemini, gemma, gpt-oss)45.9 / 45.5 / 48.038.5 / 40.7 / 45.139.6 / 41.3 / 42.7
상위 3 뺀 하위 546.8 / 43.9 / 48.039.9 / 37.4 / 45.155.3 / 39.1 / 46.4
하위 gemma·gpt-oss 뺀 550.0 / 45.6 / 50.340.5 / 36.8 / 42.858.4 / 43.7 / 57.3
7개 전체50.0 / 45.2 / 50.340.5 / 37.6 / 45.156.4 / 42.9 / 57.3
같은 표, 보정 전
조합KorSTSKLUE-STSSTS-B
상위 3 (exaone, gpt-4o-mini, haiku)39.1 / 38.3 / 39.916.4 / 18.0 / 18.540.5 / 40.7 / 42.4
하위 3 (gemini, gemma, gpt-oss)23.4 / 24.8 / 26.912.9 / 14.4 / 14.634.4 / 33.9 / 35.6
상위 3 뺀 하위 525.7 / 28.1 / 39.914.3 / 17.3 / 26.234.4 / 32.3 / 37.8
하위 gemma·gpt-oss 뺀 536.5 / 33.6 / 39.915.6 / 19.0 / 26.238.2 / 36.0 / 42.4
7개 전체30.6 / 30.8 / 39.914.3 / 17.6 / 26.236.4 / 35.1 / 42.4

5결과 C: 앵커를 정답과 떼어 놓으면

기존 앵커는 "정답 + 1"이었습니다. 정확일치는 크게 깎지만 정답과 거의 같이 움직이는 값이라, 순위 지표에서는 앵커를 따라갈수록 점수가 오르고 보정과 겹치면 정답을 흘립니다. 그래서 앵커를 1~5 균등 무작위(정답과 독립, 문항마다 고정)로 바꿔 7모델 × 2조건을 다시 받았습니다.

앵커 효과: 정답+1 vs 무작위블라인드 대비, 정확일치 %p 와 ρ 변화

KorSTS (n = 1379, 앵커 = 정답인 문항 283건)

무작위 앵커 · 정확일치블라인드 → 앵커효과 [95% CI]ρQWK루브릭 있을 때 효과루브릭의 완화
개별 모델 평균30.8 → 28.8-2.0 [-3.2, -0.8]*0.71 → 0.630.54 → 0.48+0.1+2.1
중앙값 투표30.6 → 30.5-0.1 [-2.8, +2.2]0.79 → 0.720.61 → 0.54+2.1+2.2
보정 배심원50.0 → 41.4-8.6 [-11.2, -5.9]*0.80 → 0.730.76 → 0.65-5.4+3.2
앵커가 정답인가로 나눠 보면 (정확일치, 블라인드 → 앵커)앵커 = 정답 (n=283)앵커 ≠ 정답 (n=1096)
개별 모델 평균29.9 → 38.731.0 → 26.2
중앙값 투표30.0 → 40.630.7 → 27.9
보정 배심원56.5 → 49.548.4 → 39.3
끌림 지표무작위 앵커정답+1 앵커 (기존)
앵커 쪽으로 움직인 판정 / 반대쪽30.2% / 2.2%26.0% / 0.4%
표 = 앵커값 비율 (개별 모델, 블라인드 → 앵커)21.1% → 28.9%38.8% → 52.0%
표 = 앵커값 비율 (중앙값 투표)21.2% → 32.6%46.4% → 65.8%
평균 이동 (앵커 방향 +, 등급)+0.31+0.27
ρ 변화 (개별 / 중앙값 / 보정)-0.08 / -0.07 / -0.07+0.05 / +0.07 / +0.06

KLUE-STS (n = 519, 앵커 = 정답인 문항 116건)

무작위 앵커 · 정확일치블라인드 → 앵커효과 [95% CI]ρQWK루브릭 있을 때 효과루브릭의 완화
개별 모델 평균17.6 → 20.1+2.5 [+0.9, +4.0]*0.76 → 0.670.42 → 0.39+1.7-0.8
중앙값 투표14.3 → 18.3+4.0 [+1.2, +6.6]*0.83 → 0.770.44 → 0.45+0.8-3.3
보정 배심원40.5 → 46.4+6.0 [+0.6, +10.6]*0.85 → 0.800.76 → 0.77+4.8-1.2
앵커가 정답인가로 나눠 보면 (정확일치, 블라인드 → 앵커)앵커 = 정답 (n=116)앵커 ≠ 정답 (n=403)
개별 모델 평균18.0 → 27.017.5 → 18.1
중앙값 투표14.7 → 22.414.1 → 17.1
보정 배심원47.4 → 70.738.5 → 39.5
끌림 지표무작위 앵커정답+1 앵커 (기존)
앵커 쪽으로 움직인 판정 / 반대쪽29.9% / 1.7%24.3% / 0.4%
표 = 앵커값 비율 (개별 모델, 블라인드 → 앵커)21.2% → 29.1%35.9% → 47.3%
표 = 앵커값 비율 (중앙값 투표)20.8% → 30.6%37.0% → 49.5%
평균 이동 (앵커 방향 +, 등급)+0.31+0.25
ρ 변화 (개별 / 중앙값 / 보정)-0.09 / -0.06 / -0.05+0.06 / +0.05 / +0.05

STS-B (n = 550, 앵커 = 정답인 문항 101건)

무작위 앵커 · 정확일치블라인드 → 앵커효과 [95% CI]ρQWK루브릭 있을 때 효과루브릭의 완화
개별 모델 평균35.1 → 35.2+0.1 [-1.6, +1.8]0.77 → 0.710.58 → 0.57+1.7+1.6
중앙값 투표36.4 → 36.9+0.5 [-2.9, +4.0]0.83 → 0.790.63 → 0.65+2.4+1.8
보정 배심원56.4 → 49.1-7.3 [-11.6, -2.9]*0.85 → 0.810.85 → 0.79-6.4+0.9
앵커가 정답인가로 나눠 보면 (정확일치, 블라인드 → 앵커)앵커 = 정답 (n=101)앵커 ≠ 정답 (n=449)
개별 모델 평균36.6 → 41.734.8 → 33.8
중앙값 투표37.6 → 44.636.1 → 35.2
보정 배심원57.4 → 71.356.1 → 44.1
끌림 지표무작위 앵커정답+1 앵커 (기존)
앵커 쪽으로 움직인 판정 / 반대쪽20.6% / 2.2%12.1% / 0.3%
표 = 앵커값 비율 (개별 모델, 블라인드 → 앵커)19.1% → 20.8%39.7% → 41.9%
표 = 앵커값 비율 (중앙값 투표)19.8% → 21.6%40.0% → 44.0%
평균 이동 (앵커 방향 +, 등급)+0.20+0.12
ρ 변화 (개별 / 중앙값 / 보정)-0.06 / -0.04 / -0.04+0.00 / +0.02 / +0.01
읽는 법

끌림은 분명합니다. 판정의 20~30%(KorSTS 30%, KLUE 30%, STS-B 21%)가 앵커 쪽으로 움직이고 반대쪽은 2%뿐이며, 순위 상관 ρ는 세 코퍼스의 개별 모델·중앙값 투표·보정 배심원 모두에서 떨어집니다(−0.04~−0.09). 정답+1 앵커에서 ρ가 올랐던 문제가 사라졌습니다.

정확도는 앵커가 모델의 치우침과 같은 방향인지에 달려 있습니다. 앵커가 틀렸을 때(앵커 ≠ 정답) KorSTS는 개별 −5.0, 보정 배심원 −9.0으로 내려가고, STS-B도 보정 배심원이 56.1 → 44.1로 크게 내려갑니다(개별·중앙값은 −1 안팎). KLUE는 모델이 위로 가장 심하게 치우친 코퍼스라 평균 3인 무작위 앵커가 점수를 아래로 끌어내려 우연히 정답에 가까워지고, 앵커 ≠ 정답 문항만 보면 변화가 거의 없습니다. 보정 배심원이 세 코퍼스 모두에서 가장 크게 다치는 이유는, 보정이 모델의 원래 치우침을 전제로 하는데 앵커가 그 치우침 자체를 바꿔 놓기 때문입니다.

중앙값 투표는 무작위 앵커에는 개별 모델보다 덜 흔들립니다(KorSTS 개별 −2.0 vs 중앙값 −0.1, STS-B +0.1 vs +0.5). 무작위 앵커는 30%만 움직이므로 중앙값을 뒤집으려면 4표 이상이 움직여야 하고, 배심원이 완충 역할을 합니다. 정답+1 앵커에서는 7표가 같은 방향으로 한꺼번에 쏠려 중앙값이 더 크게 무너졌습니다.

6정리: 세 문장은 어디서 성립하나

교수님 문장보정 전 · 정확일치보정 전 · 순위 지표(ρ·QWK)보정 배심원 (분위수 대응)
(1) 임의의 하나보다 좋다부분 KorSTS·STS-B 비김, KLUE 짐성립 세 코퍼스 유의성립 +5.5 / +2.2 / +7.6, 7·5·6개 모델 앞섬
(2) 루브릭이면 더 좋다성립성립성립 +1.2 / +4.8 / +4.7
(3) 앵커가 섞이면 나빠진다성립 정답+1 앵커반대 정답+1 앵커는 순위를 올림부분 무작위 앵커: 끌림·ρ 하락은 모두 확인, 정확도는 KorSTS 하락·KLUE 상승
(4) 최고 개별 모델을 넘는다불성립 60셀 중 0부분 ρ에서 최고와 동률부분 정확일치 0.3~4.6점 차, ρ·QWK 1위, 등급별로는 더 고름

이 표는 결론이 아니라 조건표입니다. 어느 칸을 논문의 주장으로 삼을지는 검토 후 정합니다.

7부록: 시도했지만 안 된 것

보정에 이르기 전에 해 본 것들입니다. 심사 때 같은 질문이 나올 수 있어 기록으로 남깁니다.

지표를 바꿔 보기 (정확일치 → ±1, MAE, ρ, QWK, 민감도·특이도·F1)
보정 전 7모델 중앙값 투표의 8명 중 순위(블라인드). 순위 지표(ρ·QWK)에서만 상위.
지표KorSTSKLUE-STSSTS-B
정확일치4위6위4위
±14위5위4위
MAE4위5위4위
ρ3위1위3위
QWK4위4위4위
민감도3위3위1위
특이도5위5위3위
F14위5위3위
상위 모델을 넣어 보기 (gpt-5.1, sonnet-5, gemini-3.7-flash, sonnet-4.6, kimi-k2.6, glm-5.3 블라인드 판정)

고급 6개를 섞어 13개 모델로 3·5명 조합 1,573개를 만들어도 자기 멤버 최고를 넘는 조합은 사실상 없고, gpt-5.1도 gpt-4o-mini를 넘지 못합니다. 등급을 정확히 맞히는 일은 모델 크기로 오르지 않습니다.

KorSTS (13모델 완전 문항 n = 959) · 3·5명 조합 1573개 중 자기 멤버 최고를 넘는 조합 3개

모델 / 배심원정확일치ρQWK
gemini-3.7-flash (고급)46.50.840.78
haiku-4.5 (소형)46.10.800.77
gpt-4o-mini (소형)44.70.800.77
exaone-3.5 (소형)42.50.790.73
sonnet-5 (고급)42.30.820.75
중앙값 투표 · 13모델 전체38.00.820.72
중앙값 투표 · 소형 737.20.800.70
kimi-k2.6 (고급)36.20.780.67
중앙값 투표 · 고급 635.90.820.71
sonnet-4.6 (고급)34.90.820.70
gpt-5.1 (고급)32.70.820.68
gemini-2.5-flash (소형)32.10.740.61
glm-5.3 (고급)31.00.790.65
llama-3.1 (소형)30.80.510.38
gpt-oss-120b (소형)29.00.790.62
gemma-4 (소형)28.40.690.51

KLUE-STS (13모델 완전 문항 n = 310) · 3·5명 조합 1573개 중 자기 멤버 최고를 넘는 조합 0개

모델 / 배심원정확일치ρQWK
llama-3.1 (소형)35.20.380.32
gpt-4o-mini (소형)24.20.740.50
exaone-3.5 (소형)23.50.690.47
sonnet-5 (고급)21.60.740.46
gemma-4 (소형)21.30.640.33
haiku-4.5 (소형)21.30.730.47
중앙값 투표 · 소형 720.60.730.41
gemini-2.5-flash (소형)20.30.620.31
gpt-oss-120b (소형)20.30.720.39
sonnet-4.6 (고급)20.30.720.41
kimi-k2.6 (고급)20.30.640.36
glm-5.3 (고급)20.30.680.35
gpt-5.1 (고급)20.00.720.45
중앙값 투표 · 고급 620.00.730.42
gemini-3.7-flash (고급)19.70.750.45
중앙값 투표 · 13모델 전체19.70.740.41

STS-B (13모델 완전 문항 n = 542) · 3·5명 조합 1573개 중 자기 멤버 최고를 넘는 조합 1개

모델 / 배심원정확일치ρQWK
exaone-3.5 (소형)42.10.840.72
gpt-4o-mini (소형)41.90.840.74
gemini-3.7-flash (고급)41.90.860.74
kimi-k2.6 (고급)38.60.810.64
sonnet-4.6 (고급)37.80.840.69
haiku-4.5 (소형)37.60.790.66
glm-5.3 (고급)36.50.820.66
중앙값 투표 · 소형 736.30.820.63
gemini-2.5-flash (소형)36.00.790.60
중앙값 투표 · 고급 635.80.850.68
gpt-5.1 (고급)35.20.800.62
중앙값 투표 · 13모델 전체34.90.850.67
sonnet-5 (고급)34.50.840.65
gemma-4 (소형)34.10.740.53
gpt-oss-120b (소형)32.10.790.54
llama-3.1 (소형)22.00.580.28
합치는 규칙 바꾸기 (평균·다수결·절사평균)와 선별 배심원
평균·다수결·절사평균은 거의 차이가 없고, 치우침을 빼는 보정만 효과가 있음. 이 표의 '척도 보정'은 5등급이 0%가 되는 부작용이 있어 본문에서는 분위수 대응(B)을 씀.
합치는 규칙 (블라인드 정확일치)KorSTSKLUE-STSSTS-B
중앙값30.614.336.4
평균28.914.534.5
다수결32.815.036.9
절사평균29.814.636.0
보정 중앙값 α=0.540.424.734.5
보정 중앙값 α=1.048.938.042.9
척도 보정 중앙값51.143.049.1
7표의 일치도로 배심원을 믿을지 고르는 선별 배심원. 만장일치도 정확도를 보장하지 않고, 어떤 넘김 정책도 '항상 최고 모델'을 넘지 못함.
코퍼스만장일치 비율만장일치일 때 정확일치갈리면 gpt-4o-mini에 넘길 때 최고 성적항상 gpt-4o-mini
KorSTS3.3%58.739.139.1
KLUE-STS11.8%24.618.518.5
STS-B14.5%32.542.042.0