AIForA Lab · 진행 중인 연구

수술 이름을
세계 공용 번호로

병원에서 의사가 손으로 적은 수술 이름 28만 건을, 전 세계가 함께 쓰는 7자리 코드로 자동으로 바꾸는 연구입니다. 이 페이지는 그 연구가 무엇인지를 그림 일곱 장으로 설명합니다.

진행 중 차의과학대학교 AI헬스케어융합학과 pcsmatch
1

수술이 끝나면, 이름이 남습니다

수술을 마친 의사는 그날 무슨 수술을 했는지 기록에 적습니다. 정해진 양식은 없습니다. 자기가 늘 쓰던 말로 적습니다.

수술기록지 · 2016-03-14 수술명 Laparoscopic cholecystectomy
실제 데이터에 들어 있는 형태 그대로입니다. 사람이 읽으라고 쓴 글자이지, 컴퓨터가 읽으라고 쓴 글자가 아닙니다.
2

같은 수술인데, 이름이 제각각입니다

줄여 쓰기도 하고, 영어로도 한글로도 씁니다. 우리 데이터에 있는 수술 이름은 10만 6천 가지인데, 실제 수술 종류는 그보다 훨씬 적습니다.

Lap. chole Laparoscopic cholecystectomy LC 복강경 담낭절제술 실제로는 모두 같은 수술
표기가 흩어져 있으면 병원끼리, 나라끼리 통계를 맞출 수 없습니다. 그래서 공용 번호가 필요합니다.
3

세계는 번호로 이야기합니다

그 공용 번호가 ICD-10-PCS입니다. 일곱 글자인데, 순서대로 매긴 번호가 아니라 일곱 개의 질문에 대한 답이 한 자리씩 들어간 것입니다.

코드 한 개 0DBJ0ZZ 0 D B J 0 Z Z 큰 갈래 몸의 계통 무엇을 했나 어디를 어떻게 들어갔나 넣은 것 덧붙임 수술·처치 소화기 잘라냄 충수(맹장) 배를 열고 없음 없음 다섯째 자리 하나만 0 → 4 로 바꾸면 0DBJ4ZZ 배를 열지 않고 복강경으로 한 같은 수술이 됩니다
한 글자가 통째로 뜻을 바꿉니다. 좌·우도 넷째 자리에 들어가서, 왼쪽을 오른쪽으로 잘못 적으면 완전히 다른 코드가 됩니다.
4

지금은 사람이 하나씩 손으로 바꿉니다

이름을 보고 코드책을 뒤져 번호를 찾습니다. 숙련된 사람도 한 건에 몇 분이 걸립니다.

✓바꿔야 할 수술 기록280,356건
한 건에 1분만 잡아도4,673시간
하루 8시간 꼬박 한 사람이 한다면약 2.7년

그래서 대부분의 병원은 아예 코드를 붙이지 않고 둡니다. 붙이지 않은 기록은 통계에도, 연구에도 쓰이지 못합니다.

5

그런데 컴퓨터에게 맡기기가 어렵습니다

현장에서 쓰는 말과 코드책에 적힌 말이 거의 겹치지 않기 때문입니다. 글자를 비교하는 방식으로는 풀리지 않습니다.

현장 수술명의 말 4,185단어 코드책의 말 452단어 겹치는 말 ↓ 아주 얇은 이 부분 겹치는 단어는 297개 · 7.1%
수술명에서 가장 많이 쓰이는 말들 — laparoscopic, thyroidectomy, gastrectomy, cholecystectomy — 은 코드 설명문에 아예 등장하지 않습니다.
현장
Laparoscopic cholecystectomy
코드책
Excision of Gallbladder,
Percutaneous Endoscopic Approach
같은 수술입니다. 그런데 겹치는 단어가 하나도 없습니다.
6

그래서 글자 대신 뜻으로 비교합니다

문장의 의미를 좌표로 바꿔주는 AI를 씁니다. 글자가 달라도 뜻이 가까우면 가까운 좌표에 놓입니다. 여기에 전문가의 판단을 계속 먹여서 정확도를 올립니다.

수술 이름 Lap. chole 의미 임베딩 BioBERT 닮은 코드 5개 후보 전문가 확인 맞는 것 고르기 코드 확정 0FB44ZZ 뜻으로 가까운 순 추려서 고른 답 전문가가 고른 답을 다시 학습시킵니다 돌수록 후보가 정확해지고, 결국 1등만 자동으로 붙일 수 있게 됩니다
핵심은 되먹임 고리입니다. 처음부터 완벽한 자동화를 노리지 않고, 사람이 고른 답을 재료로 삼아 모델을 키웁니다.
7

지금 어디까지 왔나

재료는 모였습니다. 그런데 아직 정답지가 없습니다. 이름과 코드가 짝지어진 예시가 있어야 모델을 가르치고 채점할 수 있는데, 그게 0건입니다.

✓현장 수술 이름280,356건
✓국제 수술 코드8,980개
✗이름–코드 정답 짝0건
1단계데이터 모으고 다듬기진행 중
2단계뜻으로 후보 5개 뽑기대기
3단계전문가가 정답 고르기대기
4단계우리 데이터에 맞게 모델 다듬기대기
5단계1등만 자동으로 붙이기대기
6단계성능 재고 병원 시스템에 붙이기대기

그래서 지금 가장 급한 일은 모델을 만드는 것이 아니라, 정답 예시 몇 백 건을 확보하는 일입니다.

측정 결과

지금까지 나온 것

아직 정답셋이 없어서 ‘정확도’는 재지 못합니다. 대신 지금 잴 수 있는 것부터 재고 있습니다.

배심원 판정 시범 설계

여러 대규모 언어모델을 배심원으로 두고 코드 일곱 자리마다 확실한 근거와 불확실한 사유를 태깅합니다. 등급은 배심원 간 일치와 규칙 검사로만 정합니다.

2026-09-23열기 →

코딩 규약 시뮬레이션

코딩 규약 세 가지로 같은 수술 50건을 각각 열 번씩 판정하게 하였습니다. 규약이 답의 절반 이상을 바꾸며, 흔들림의 78%는 코드 내용이 아니라 코딩 범위에서 나옵니다.

2026-08-20열기 →

검토 수집 현황

검토자별 진행 상황과 문항별 상태를 실시간으로 보여줍니다. 검토자 간에 서로 다른 코드가 부여된 문항을 따로 모아 정답셋 확정의 다음 작업을 정할 수 있습니다.

2026-08-20열기 →

수술명에서 코드 후보 추출

병원 수술명 하나에서 코드표 79,115개 가운데 해당 가능성이 있는 코드만 추출하여 제시합니다. 추출 방식과 성능, 전문가 검토 현황입니다.

2026-08-20열기 →

수술 50건, 코드 후보 검토

무작위 수술 50건마다 AI가 내용을 설명하고 실제 코드표에서 후보를 추렸습니다. 전문가는 고르기만 하면 됩니다. 각 페이지에서 AI에게 더 물어볼 수 있습니다.

2026-08-20열기 →

39개 서랍이냐 8,980개 번호냐

AI에게 시킬 일을 정해야 합니다. 수술을 39개 무리로 묶게 할지, 8,980개 번호를 정확히 찍게 할지. 그림으로 풀었습니다.

2026-08-20열기 →

AI 여덟에게 같은 수술을 물었더니

의료 전용 AI 하나와 일반 AI 일곱에게 똑같은 수술 이름을 주고 코드를 매기게 했습니다. 여덟 개의 다른 답이 돌아왔습니다.

2026-08-20열기 →

39개 수술군의 역할

감염 감시를 위한 39개 수술군은 병원 기록의 59.5%만 포괄합니다. 코드를 먼저 확정하고 수술군을 도출하는 구조로 바꾸면 기록의 97.5%에 해부학적 계통이 배정되며, 31개 계통이 모두 사용됩니다.

2026-08-20열기 →
연구 데이터

쓰고 있는 자료 두 가지

현장 수술명 기록

opname_icd_240618_01.csv

건수
280,356
기간
2006-01 ~ 2020-12
고유 이름
105,979
크기
35 MB

국내 한 병원의 15년치 수술 기록. 한 건에 여러 술식이 함께 적힌 경우가 48%입니다.

국제 수술 코드표

icd10-pcs-pcm-nhsn-opc.xlsx

코드
8,980
분류
39개 수술군
기준
2024년판
크기
760 KB

미국 CDC가 공개하는 코드표. 감염 감시 대상 수술만 추린 것이라 전체 코드의 일부입니다.

데이터 받기

연구 참여자용입니다. 암호를 입력하면 받는 곳이 열립니다.