AIForA Lab · pcsmatch · 규약 시뮬레이션

규약이 답의
절반을 바꿉니다

코딩 규약 세 가지를 정해 놓고, 같은 수술 50건을 각각 열 번씩 판정하게 하였습니다. 규약 외의 조건은 모두 동일합니다. 그런데 세 규약의 답이 모두 같은 문항은 50건 중 21건뿐이었습니다. 나머지 29건은 규약이 답을 바꾸었습니다.

2026-08-20 판정 1,500회 규약 3종 × 10회 오류 0회
시험 구성

규약만 바꾸고 나머지는 고정하였습니다

세 유형은 실제 검토자 세 분에게서 관찰된 성향을 그대로 옮긴 것입니다. 한 분은 확실할 때만 코드를 부여하셨고, 한 분은 표준에 가까웠으며, 한 분은 동반 시술까지 폭넓게 부여하셨습니다.

수술 50건 검토 화면과 동일한 문항 유형 1 · 최소 코딩 주 수술 하나만, 최대 1개 유형 2 · 표준 규약 별개 부위만 추가, 최대 2개 유형 3 · 포괄 코딩 동반 시술 모두, 최대 4개 각 10회 반복 동일 조건, 온도 0.8 1,500회 오류 0회 세 유형은 실제 검토자 세 분에게서 관찰된 성향을 그대로 옮긴 것입니다. 규약 외의 조건은 모두 같습니다 — 같은 문항, 같은 후보 목록, 같은 모델.
같은 문항, 같은 후보 목록, 같은 모델을 사용하였습니다. 다른 것은 규약뿐입니다. 열 번 반복한 이유는 판정이 얼마나 흔들리는지 보기 위해서입니다.
결과 하나

규약이 엄격할수록 답이 안정됩니다

규약 유형열 번 모두 같은 답다수답 평균 일치율 정답 없음문항당 코드 수
유형 1최소 코딩 39 / 5096%10건1.00
유형 2표준 규약 34 / 5093%9건1.34
유형 3포괄 코딩 27 / 5086%6건1.66
선택의 문제가 드러납니다. 최소 코딩은 가장 안정적이지만 놓치는 시술이 생깁니다. 포괄 코딩은 많이 담지만 열 번 중 세 번은 다른 답이 나옵니다. 안정성과 포괄성이 맞바꿈 관계에 있으며, 어느 쪽을 택할지는 연구 목적이 정합니다.
결과 둘

흔들림의 대부분은 코딩 범위에서 나옵니다

열 번 중 답이 갈린 문항 50개가 무엇 때문에 갈렸는지 분해하였습니다.

열 번 중 답이 흔들린 문항 50개 (유형 × 문항 150 중)무엇 때문에 갈렸는가코드 개수20정답 없음 여부11복수 코드 조합8접근 경로 (5번째 자리)5한정 (7번째 자리)2장치 (6번째 자리)1술기 (3번째 자리) 관련2코딩 범위 문제 39건 · 78%코드 내용 문제 11건 · 22%
코드를 몇 개 부여할지, 정답 없음으로 둘지, 복수 코드를 어떻게 조합할지 — 이 세 가지가 39건으로 78%입니다. 코드 자체의 내용이 갈린 것은 11건뿐입니다.
이것이 이번 시뮬레이션의 핵심입니다. 인공지능이 코드를 몰라서 흔들리는 것이 아닙니다. 무엇을 몇 개 코딩할지가 정해져 있지 않아서 흔들립니다. 모델을 바꾸거나 성능을 높여도 이 부분은 개선되지 않습니다. 규약을 정해야 합니다.
결과 셋

열 번 모두 같은 답은 믿을 만합니다

검토자 세 분 중 두 분 이상이 같은 코드를 부여한 25개 문항을 기준으로 대조하였습니다.

열 번 모두 같은 답이 나온 문항 → 사람 합의와 일치61%
답이 갈린 문항 → 사람 합의와 일치29%

반복 판정의 일치 여부가 신뢰도 지표로 쓰일 수 있다는 뜻입니다. 열 번 모두 같은 답이 나오면 맞을 확률이 두 배 높습니다. 다만 61%는 자동 확정에 충분하지 않습니다. 전문가 확인을 대체할 수 없으며, 전문가가 어디에 시간을 쓸지 정하는 데 쓸 수 있습니다.

어느 유형도 사람을 재현하지 못하였습니다. 실제 검토자와 가장 많이 일치한 조합이 유형 1과 박대근 검토자의 52%였고, 나머지는 20%대에서 40%대였습니다. 규약을 정하는 것만으로는 부족하며, 규약을 정한 뒤 사람이 확인하는 구조가 필요합니다.
제안

판단을 줄이고 규칙을 늘리는 구조

시뮬레이션 결과가 가리키는 방향은 분명합니다. 인공지능의 자유 판단에 맡기는 부분을 최소화하고, 규칙으로 결정할 수 있는 것은 규칙으로 결정하는 구조입니다.

1층 · 코딩 범위 규칙 한 수술에 코드를 몇 개 부여할지, 동반 시술을 코딩할지를 규칙으로 고정합니다. 판단에 맡기지 않습니다. 흔들림의 78% 제거 2층 · 자릿수 결정 규칙 접근 경로는 술기 표기에서, 조직 종류는 어근 사전에서, 절제 범위는 수술명 어휘에서 결정합니다. 나머지 22% 중 상당수 3층 · 후보 추출 코드표 79,115개에서 계산만으로 후보를 추립니다. 현행 그대로입니다. 정답 포함률 100% 4층 · 인공지능 판단 (열 번 반복) 위 세 층으로 결정되지 않은 것만 판정합니다. 같은 문항을 열 번 돌려 일치 여부를 봅니다. 열 번 모두 같음 → 자동 확정 사람의 합의와 일치할 확률이 두 배 높습니다. 표준 규약 기준 50건 중 34건이 여기 해당합니다. 답이 갈림 → 전문가 확인 자동 확정하지 않고 검토 화면으로 보냅니다. 전문가는 이 16건에만 시간을 씁니다.
1층과 2층은 규칙이므로 결과가 항상 같습니다. 인공지능은 4층에서만 판단하며, 그 판단조차 열 번 반복하여 일치 여부로 갈라 냅니다.

이 구조에서 전문가의 일은 50건 전부를 보는 것에서 16건을 보는 것으로 줄어듭니다. 줄어든 만큼 검토 건수를 늘릴 수 있고, 검토 건수가 늘어야 정답셋이 만들어집니다.

먼저 할 일은 규약 문서입니다. 1층과 2층은 새로운 기술이 아니라 합의된 문장입니다. 코드를 몇 개 부여할지, 동반 시술을 어떻게 다룰지, 접근 경로를 무엇으로 판정할지를 문서로 정하면 그날부터 적용할 수 있습니다.
한계

이 시험이 말하지 않는 것

시뮬레이션은 제시된 후보 목록 안에서만 고르게 하였습니다. 실제 검토자는 코드표 전체를 검색하여 후보 밖의 코드를 넣으실 수 있으므로, 사람과의 일치율은 이 조건 때문에 낮게 나옵니다. 또한 대조 기준으로 삼은 ‘사람 합의’는 25개 문항에 불과하며, 그 자체가 확정된 정답셋이 아닙니다.

따라서 이 결과에서 읽어야 할 것은 정확도의 절대 수치가 아니라 흔들림의 구조입니다. 어디에서 답이 갈리는지, 무엇을 정하면 갈리지 않는지가 이번 시험의 소득입니다.

관련 자료

함께 보실 자료