AIForA Lab · pcsmatch · 모델 비교

여덟 모델에게
같은 수술을 물었습니다

의료 특화 모델 하나(MedGemma)와 범용 모델 일곱 개에게, 가장 흔한 수술명 50건을 국제 수술 코드로 바꿔보라고 했습니다. 확신도도 1~5로 함께 답하게 했습니다.

0건 50건 중 과반(5개 이상)이 같은 코드를 낸 수술은 하나도 없었습니다. 45건은 어느 두 모델도 답이 겹치지 않았습니다.
합의 실패 2026-08-20 수술명 50건 × 모델 8종
세부 카드

다섯 장으로 나눠 봤습니다

어떤 모델을 썼나

의료 특화 1개, 범용 7개. 로컬 5개와 상용 API 3개.

#lineup

모두가 확신했습니다

두 모델은 50건 전부 확신도 5. 답은 다 다른데 말입니다.

#confidence

담낭절제술 한 건

가장 흔하고 가장 쉬운 수술인데도 답이 여덟 갈래로 갈렸습니다.

#chole

분간이 어려운 수술

방광 종양, 췌십이지장절제, 간이식 — 여덟 모델이 여덟 답.

#hard

그래서 무엇을 뜻하나

AI 혼자로는 안 됩니다. 이 연구 설계가 옳았다는 증거입니다.

#verdict

어떤 모델을 썼나

의료 특화가 정말 유리한지 보려고, 특화 1개와 범용 7개를 나란히 놨습니다.

직접경로 #lineup
모델구분어디서 돌렸나코드 모양평균 확신도
MedGemma 27B의료 특화연구실 서버 (GPU 1)43 / 504.96
Claude Haiku 4.5범용API50 / 503.90
Gemini범용API48 / 504.60
GPT-4o-mini범용API50 / 505.00
GPT-OSS 20B범용연구실 서버35 / 504.54
Gemma 4범용연구실 서버44 / 504.22
EXAONE 3.5범용연구실 서버28 / 504.90
Llama 3.1범용연구실 서버43 / 505.00

코드 모양은 답이 국제 코드의 생김새(영문·숫자 7자리)를 지켰는지만 본 것입니다. 내용이 맞는지는 보지 않았습니다. 그런데도 EXAONE은 절반 넘게 모양조차 틀렸습니다.

의료 특화가 유리하지 않았습니다. MedGemma는 코드 모양을 43/50으로 지켜 중간이고, 확신도는 50건 중 49건이 5점으로 가장 과신했습니다. 오히려 일반 AI인 Haiku가 50/50 모두 모양을 지켰고 확신도도 유일하게 갈렸습니다.

모두가 확신했습니다

답은 다 다른데, 스스로는 다 맞다고 합니다.

직접경로 #confidence
MedGemma 4.96
Haiku 4.5 3.90
Gemini 4.60
GPT-4o-mini 5.00
GPT-OSS 4.54
Gemma 4 4.22
EXAONE 3.5 4.90
Llama 3.1 5.00
1 불명확2 의심 3 그럴듯4 꽤 확신5 확신
GPT-4o-mini와 Llama 3.1은 50건 전부 확신도 5를 줬습니다. 한 번도 망설이지 않았습니다. 이 두 모델의 확신도는 아무 정보도 담고 있지 않습니다.
확신도로 걸러낼 수 있을까요? 없었습니다. 확신도가 높은 수술(4.5 이상)과 낮은 수술을 나눠서 모델 간 합의를 비교했더니 1.1 대 1.0으로 사실상 차이가 없었습니다. 모델이 “확신한다”고 말해도 그게 맞다는 뜻이 아닙니다.
다만 Haiku는 달랐습니다. 평균 3.90에, 확신도 3점 이하를 6건 냈습니다. 여덟 중 유일하게 모르는 걸 모른다고 말한 모델입니다. 전문가에게 넘길 것을 자동으로 골라내려면 이런 성질이 필요합니다.

담낭절제술 한 건

이 병원에서 가장 많이 한 수술(7,754건)이고, 코딩 교과서 첫 장에 나오는 예제입니다.

직접경로 #chole

질문: “Laparoscopic cholecystectomy”(복강경 담낭절제술)의 코드는? 정답은 0FT44ZZ입니다.

모델답확신도무엇이 틀렸나
Claude Haiku 4.50FT44ZZ5정답
Gemini0FT44ZZ5정답
GPT-4o-mini0FB43ZZ5부위는 맞으나 ‘일부 절제’로 봄
MedGemma 27B0DFA3LZ5담도가 아니라 위장관으로 감
Gemma 40B946ZZ5호흡기 계통으로 감
Llama 3.10BZJLZZ5호흡기 계통으로 감
GPT-OSS 20B04602305하지 동맥으로 감
EXAONE 3.55A61ZZZ5수술이 아닌 체외 보조 코드
여덟 모델이 여덟 개의 다른 답을 냈고, 여덟 모두 확신도 5였습니다. 맞힌 건 Haiku와 Gemini 둘뿐입니다. 나머지는 담낭이 몸의 어느 계통에 속하는지부터 틀렸습니다 — 호흡기, 하지 동맥, 체외 보조 장치로 갔습니다.
이게 가장 쉬운 문제였습니다. 가장 흔하고, 이름이 명확하고, 교과서에 나오는 수술입니다. 여기서 이 정도면 나머지는 볼 것도 없습니다.

분간이 어려운 수술

모델들이 전혀 합의하지 못한 수술. 전문가 검증이 반드시 필요한 목록입니다.

직접경로 #hard
수술명병원 건수갈린 답평균 확신도
TUR-B (방광 종양 경요도 절제)2,6228종4.9
Transurethral resection of bladder tumor2,2958종4.9
췌십이지장절제술 (유문보존)1,2088종4.6
Right hemicolectomy (우측 결장절제)1,1878종4.5
복강경 원위부 위절제 (Billroth I)1,1758종4.8
복강경 보조 질식 자궁적출1,0938종4.8
ileostomy repair (장루 복원)9188종4.8
생체 간이식 (성인)7318종4.9
간 우엽 절제5528종4.9
뇌실복강 단락술5218종4.8
공통점이 보입니다. 이름 안에 부위·범위·접근법이 겹쳐 들어간 수술들입니다. ‘복강경으로 원위부를 절제하고 Billroth I 방식으로 이었다’ 같은 이름은 7자리 중 서너 자리를 동시에 결정해야 해서, 한 군데만 어긋나도 완전히 다른 코드가 됩니다.
여기서도 확신도는 4.5~4.9로 높습니다. 답이 여덟 갈래로 갈린 수술에서조차 모델들은 확신했습니다.

그래서 무엇을 뜻하나

나쁜 소식처럼 보이지만, 이 연구에는 좋은 소식입니다.

직접경로 #verdict
AI에게 코드를 그냥 물어보면쓸 수 없음
모델이 말하는 확신도는믿을 수 없음
의료 특화 모델이라고 더 낫지않았음
여러 모델을 겹쳐 보면 어려운 수술이드러남

이 결과는 연구 설계가 옳았다는 증거입니다. 처음부터 이 연구는 ‘AI가 코드를 바로 찍어낸다’가 아니라 ‘후보를 추천하고 전문가가 고른다’로 설계돼 있었습니다. 이번 측정이 그 설계가 왜 필요한지를 숫자로 보여줍니다.

쓸 만한 것도 하나 건졌습니다. 여덟 모델의 답이 갈리는 정도는 그 수술이 어려운지를 알려주는 신호입니다. 모델이 스스로 말하는 확신도보다 훨씬 쓸모 있습니다. 전문가 검토가 필요한 수술을 자동으로 골라내는 데 바로 쓸 수 있습니다.
다음으로 할 일. ① 고를 수 있는 코드 목록을 먼저 좁혀서 주고 그 안에서만 고르게 하기, ② 답이 갈리는 수술부터 전문가 정답을 만들기 — 가장 정보가 많은 문제부터 라벨을 붙이는 셈이라 효율이 좋습니다.
한계. 정답셋이 없어서 ‘누가 맞았나’는 담낭절제술 한 건 말고는 확인하지 못했습니다. 여기 있는 건 모델끼리 답이 같았는지와 스스로 얼마나 확신했는지일 뿐, 정확도가 아닙니다. 수술명 50건, 상위 빈도에 치우친 표본이라는 점도 감안해야 합니다.