AIForA Lab · pcsmatch · 1차 자동 분류

코드 일곱 자리마다
근거를 붙입니다

병원 수술명 전체에 코드를 먼저 매칭하고, 여러 대규모 언어모델(Large Language Model)을 배심원으로 두어 자리마다 확실한 근거와 불확실한 사유를 태깅합니다. 이 1차 분류를 의사 전문가가 검토하고, 그 결과로 코드를 한 자리씩 정하는 계층형 분류 모델을 만듭니다.

2026-09-23 시범 표본 1,050건 태그 21종 + 자동 6종 등급 A·B·C·D
전체 흐름

배심원은 독립적으로, 등급은 관찰로

여덟 개 모델 비교에서 복강경 담낭절제술 하나에 여덟 개의 서로 다른 코드가 나왔고, 모두 확신도 5점이었습니다. 모델의 자기 확신은 신호가 되지 못합니다. 그래서 확실성은 배심원 간 일치와 규칙 검사로만 정합니다.

고유 수술명 기록 280,356건 고유 표현 약 9만 개 배심원 독립 판정 서로의 답을 보지 않습니다 수술 개수 → 코드 → 자리별 근거·태그 집계와 교차 검사 자리별 일치도 코드표 실재 여부 어근 사전과의 일치 등급과 태그 A 확실 · B 술기까지 C 계통까지 · D 불확실 확실·불확실 사유 의사 전문가 검토 → 계층형 분류 모델 등급과 사유별로 층화하여 검토합니다. ‘확실’도 일부 검토하여 확실성이 실제로 맞는지 검증합니다. 검토된 표지로 코드를 한 자리씩 정하는 모델을 학습합니다. 등급을 정하는 기준 모델이 스스로 매기는 확신도는 쓰지 않습니다. 배심원 간 일치, 코드표 실재 여부, 규칙 검사처럼 관찰할 수 있는 조건으로만 정합니다.
배심원끼리 서로의 답을 보지 않게 합니다. 독립성이 깨지면 일치도가 신호가 되지 못합니다.
등급

몇째 자리까지 믿을 수 있는가

계층형 모델이 코드를 한 자리씩 정하므로, 등급도 몇째 자리까지 믿을 수 있는지로 매깁니다.

A 확실 — 일곱 자리 모두 80% 이상 일치, 코드표에 실재, 수술 개수 일치, 다수가 지적한 불확실 사유 없음A
B 술기까지 — 분류·계통·술기(1~3자리)가 80% 이상 일치B
C 계통까지 — 분류·계통(1~2자리)이 80% 이상 일치C
D 불확실 — 계통부터 갈림, 또는 배심원 다수의 계통이 어근 사전과 어긋남D
어근 사전 교차 검사. 배심원이 모두 같은 방향으로 틀릴 수 있습니다. 어근 사전은 배심원과 독립된 규칙이므로, 배심원 다수의 계통이 수술명에 든 어떤 어근의 계통과도 맞지 않으면 자동으로 등급을 낮춥니다.
태그

정해진 목록에서만 고릅니다

자유 서술로 받으면 20만 건을 집계할 수 없습니다. 태그마다 어느 자리에 관한 것인지가 정해져 있어 그대로 계층형 모델의 특징이 됩니다.

태그자리뜻
C12·3·4코드표 설명과 직접 대응
C22어근이 계통을 결정
C33절제 범위가 명시됨
C45접근 경로가 명시됨
C54좌우가 명시됨
C66·7장치·한정 없음이 명백
C71의료·외과 부문
U012·3·4약어를 해석할 수 없음
U024좌우 미기재
U033절제 범위 미기재
U045접근 경로 미기재
U056장치·이식편 미기재
U064척추 분절·절단 높이 미기재
U072·4조직 종류가 모호함
U082·4부위 자체가 미기재
U093술기 해석이 갈림
U10전체코드표에 대응 항목 없음
S1~S4범위수술 개수, 시행 여부 불명확, 동반 시술 규약
A1~A6자동배심원 일치·불일치, 코드표 밖 코드, 수술 개수 불일치, 어근 사전과 불일치
시범 표본

고유 수술명 1,050건

배심원 판정은 기록 단위가 아니라 고유 수술명 단위로 합니다.

전문가 3인이 검토한 문항 — ‘확실’이 실제로 맞는지 재는 기준50
빈발 (100건 이상)250
중간 (10~99건)250
드묾 (2~9건)250
한 번만 나온 수술명250

빈도 층을 똑같이 둔 이유가 있습니다. 한 번만 나온 수술명이 전체 기록의 27.8%이므로, 빈발 수술명만으로 평가하면 성능이 부풀려집니다. 각 층 안에서는 해부학적 계통 비율을 유지하였으며, 32개 계통 층이 모두 들어 있습니다.

시험 결과

전문가 판단이 갈린 6문항으로 시험하였습니다

배심원 세 명(Gemini 2.5 Flash, Claude Haiku 4.5, GPT-4o-mini)의 판정을 전문가 세 분의 판정과 대조하였습니다. 세 배심원 모두 6건 전부 형식을 지켰습니다.

수술배심원 주 코드전문가 3인등급무엇이 드러났는가
재발 간세포암 종양절제술0FB00ZZ ×2, 0FB04ZZ0FB00ZZ ×3B접근 경로 미기재(U04)와 좌우 미기재(U02)를 배심원 둘이 지적하였고, 실제로 5번째 자리에서 갈렸습니다.
하르트만 수술0DTN0ZZ ×30DTN0ZZ ×2, 0DBN0ZZB코드는 셋이 같았으나 수술 개수 판단이 갈려(A5) 확실 등급에서 내려갔습니다.
홀뮴레이저 전립선적출술0VB08ZZ ×2, 0VB04ZZ0VB08ZZ ×2, 0VT04ZZB접근 경로에서 갈렸습니다. 다수 답이 사람 다수 답과 같습니다.
흉강경 폐 쐐기절제0BBF4ZZ, 0BTF4ZZ, 0BJ08ZZ0BBF4ZZ ×3C3번째 자리(술기)에서 Excision과 Resection이 갈렸습니다. 가장 흔한 쟁점 그대로입니다.
관절경 회전근개 봉합근육 계통 ×3힘줄 계통 ×2, 근육 ×1D배심원 셋이 모두 근육으로 틀렸습니다. 어근 사전(힘줄)과의 교차 검사(A6)가 잡아냈습니다.
복식 자궁적출술 + 양측 난소난관절제0UT90ZZ ×3코드 개수 1~3개로 갈림B주 코드는 모두 같았고, 동반 시술을 몇 개 코딩할지가 갈렸습니다(A5).
불확실 태그가 실제로 갈린 자리를 가리켰습니다. 접근 경로가 적혀 있지 않은 수술에서 배심원이 U04를 붙였고, 실제로 다섯째 자리에서 답이 갈렸습니다. 태그가 설명이 아니라 예측으로 작동한다는 뜻입니다.
만장일치도 틀릴 수 있습니다. 회전근개 봉합에서 배심원 셋이 모두 근육 계통을 골랐습니다. 배심원 수를 늘리는 것만으로는 막을 수 없으며, 어근 사전 같은 독립된 규칙과 교차 검사해야 합니다.
배심원 구성

제조사가 다른 모델로 구성합니다

같은 회사의 모델은 같은 방향으로 틀리기 쉽습니다. 독립성을 위해 제조사를 나누고, 의료 특화 모델과 한국어 특화 모델을 함께 둡니다.

MedGemma 27B — 의료 특화 · 로컬Google
Gemini 2.5 Flash — 범용 · 건당 약 7초Google
Claude Haiku 4.5 — 범용 · 건당 약 5초Anthropic
GPT-4o-mini — 범용 · 건당 약 4초OpenAI
EXAONE 3.5 — 한국어 특화 · 로컬LG
로컬 배심원은 아직 가동 전입니다. 연구 서버의 그래픽카드가 다른 작업에 쓰이고 있어 MedGemma와 EXAONE이 CPU로 동작합니다. 이 상태에서는 판정 한 건에 수 분이 걸리므로 그래픽카드 배정을 정한 뒤 합류시킵니다.
관련 자료

함께 보실 자료