| 모델 | 구분 | 어디서 돌렸나 | 코드 모양 | 평균 확신도 |
|---|---|---|---|---|
| MedGemma 27B | 의료 특화 | 연구실 서버 (GPU 1) | 43 / 50 | 4.96 |
| Claude Haiku 4.5 | 범용 | API | 50 / 50 | 3.90 |
| Gemini | 범용 | API | 48 / 50 | 4.60 |
| GPT-4o-mini | 범용 | API | 50 / 50 | 5.00 |
| GPT-OSS 20B | 범용 | 연구실 서버 | 35 / 50 | 4.54 |
| Gemma 4 | 범용 | 연구실 서버 | 44 / 50 | 4.22 |
| EXAONE 3.5 | 범용 | 연구실 서버 | 28 / 50 | 4.90 |
| Llama 3.1 | 범용 | 연구실 서버 | 43 / 50 | 5.00 |
코드 모양은 답이 국제 코드의 생김새(영문·숫자 7자리)를 지켰는지만 본 것입니다. 내용이 맞는지는 보지 않았습니다. 그런데도 EXAONE은 절반 넘게 모양조차 틀렸습니다.
의료 특화가 유리하지 않았습니다. MedGemma는 코드 모양을 43/50으로 지켜 중간이고,
확신도는 50건 중 49건이 5점으로 가장 과신했습니다.
오히려 일반 AI인 Haiku가 50/50 모두 모양을 지켰고 확신도도 유일하게 갈렸습니다.
MedGemma
4.96
Haiku 4.5
3.90
Gemini
4.60
GPT-4o-mini
5.00
GPT-OSS
4.54
Gemma 4
4.22
EXAONE 3.5
4.90
Llama 3.1
5.00
1 불명확2 의심
3 그럴듯4 꽤 확신5 확신
GPT-4o-mini와 Llama 3.1은 50건 전부 확신도 5를 줬습니다.
한 번도 망설이지 않았습니다. 이 두 모델의 확신도는 아무 정보도 담고 있지 않습니다.
확신도로 걸러낼 수 있을까요? 없었습니다.
확신도가 높은 수술(4.5 이상)과 낮은 수술을 나눠서 모델 간 합의를 비교했더니
1.1 대 1.0으로 사실상 차이가 없었습니다.
모델이 “확신한다”고 말해도 그게 맞다는 뜻이 아닙니다.
다만 Haiku는 달랐습니다. 평균 3.90에, 확신도 3점 이하를 6건 냈습니다.
여덟 중 유일하게 모르는 걸 모른다고 말한 모델입니다.
전문가에게 넘길 것을 자동으로 골라내려면 이런 성질이 필요합니다.
질문: “Laparoscopic cholecystectomy”(복강경 담낭절제술)의 코드는? 정답은 0FT44ZZ입니다.
| 모델 | 답 | 확신도 | 무엇이 틀렸나 |
|---|---|---|---|
| Claude Haiku 4.5 | 0FT44ZZ | 5 | 정답 |
| Gemini | 0FT44ZZ | 5 | 정답 |
| GPT-4o-mini | 0FB43ZZ | 5 | 부위는 맞으나 ‘일부 절제’로 봄 |
| MedGemma 27B | 0DFA3LZ | 5 | 담도가 아니라 위장관으로 감 |
| Gemma 4 | 0B946ZZ | 5 | 호흡기 계통으로 감 |
| Llama 3.1 | 0BZJLZZ | 5 | 호흡기 계통으로 감 |
| GPT-OSS 20B | 0460230 | 5 | 하지 동맥으로 감 |
| EXAONE 3.5 | 5A61ZZZ | 5 | 수술이 아닌 체외 보조 코드 |
여덟 모델이 여덟 개의 다른 답을 냈고, 여덟 모두 확신도 5였습니다.
맞힌 건 Haiku와 Gemini 둘뿐입니다. 나머지는 담낭이 몸의 어느 계통에 속하는지부터 틀렸습니다 —
호흡기, 하지 동맥, 체외 보조 장치로 갔습니다.
이게 가장 쉬운 문제였습니다. 가장 흔하고, 이름이 명확하고, 교과서에 나오는 수술입니다.
여기서 이 정도면 나머지는 볼 것도 없습니다.
| 수술명 | 병원 건수 | 갈린 답 | 평균 확신도 |
|---|---|---|---|
| TUR-B (방광 종양 경요도 절제) | 2,622 | 8종 | 4.9 |
| Transurethral resection of bladder tumor | 2,295 | 8종 | 4.9 |
| 췌십이지장절제술 (유문보존) | 1,208 | 8종 | 4.6 |
| Right hemicolectomy (우측 결장절제) | 1,187 | 8종 | 4.5 |
| 복강경 원위부 위절제 (Billroth I) | 1,175 | 8종 | 4.8 |
| 복강경 보조 질식 자궁적출 | 1,093 | 8종 | 4.8 |
| ileostomy repair (장루 복원) | 918 | 8종 | 4.8 |
| 생체 간이식 (성인) | 731 | 8종 | 4.9 |
| 간 우엽 절제 | 552 | 8종 | 4.9 |
| 뇌실복강 단락술 | 521 | 8종 | 4.8 |
공통점이 보입니다. 이름 안에 부위·범위·접근법이 겹쳐 들어간 수술들입니다.
‘복강경으로 원위부를 절제하고 Billroth I 방식으로 이었다’ 같은 이름은
7자리 중 서너 자리를 동시에 결정해야 해서, 한 군데만 어긋나도 완전히 다른 코드가 됩니다.
여기서도 확신도는 4.5~4.9로 높습니다.
답이 여덟 갈래로 갈린 수술에서조차 모델들은 확신했습니다.
AI에게 코드를 그냥 물어보면쓸 수 없음
모델이 말하는 확신도는믿을 수 없음
의료 특화 모델이라고 더 낫지않았음
여러 모델을 겹쳐 보면 어려운 수술이드러남
이 결과는 연구 설계가 옳았다는 증거입니다. 처음부터 이 연구는 ‘AI가 코드를 바로 찍어낸다’가 아니라 ‘후보를 추천하고 전문가가 고른다’로 설계돼 있었습니다. 이번 측정이 그 설계가 왜 필요한지를 숫자로 보여줍니다.
쓸 만한 것도 하나 건졌습니다. 여덟 모델의 답이 갈리는 정도는
그 수술이 어려운지를 알려주는 신호입니다. 모델이 스스로 말하는 확신도보다 훨씬 쓸모 있습니다.
전문가 검토가 필요한 수술을 자동으로 골라내는 데 바로 쓸 수 있습니다.
다음으로 할 일. ① 고를 수 있는 코드 목록을 먼저 좁혀서 주고 그 안에서만 고르게 하기,
② 답이 갈리는 수술부터 전문가 정답을 만들기 —
가장 정보가 많은 문제부터 라벨을 붙이는 셈이라 효율이 좋습니다.
한계. 정답셋이 없어서 ‘누가 맞았나’는 담낭절제술 한 건 말고는 확인하지 못했습니다.
여기 있는 건 모델끼리 답이 같았는지와 스스로 얼마나 확신했는지일 뿐, 정확도가 아닙니다.
수술명 50건, 상위 빈도에 치우친 표본이라는 점도 감안해야 합니다.