코딩 규약 세 가지를 정해 놓고, 같은 수술 50건을 각각 열 번씩 판정하게 하였습니다. 규약 외의 조건은 모두 동일합니다. 그런데 세 규약의 답이 모두 같은 문항은 50건 중 21건뿐이었습니다. 나머지 29건은 규약이 답을 바꾸었습니다.
세 유형은 실제 검토자 세 분에게서 관찰된 성향을 그대로 옮긴 것입니다. 한 분은 확실할 때만 코드를 부여하셨고, 한 분은 표준에 가까웠으며, 한 분은 동반 시술까지 폭넓게 부여하셨습니다.
| 규약 유형 | 열 번 모두 같은 답 | 다수답 평균 일치율 | 정답 없음 | 문항당 코드 수 |
|---|---|---|---|---|
| 유형 1최소 코딩 | 39 / 50 | 96% | 10건 | 1.00 |
| 유형 2표준 규약 | 34 / 50 | 93% | 9건 | 1.34 |
| 유형 3포괄 코딩 | 27 / 50 | 86% | 6건 | 1.66 |
열 번 중 답이 갈린 문항 50개가 무엇 때문에 갈렸는지 분해하였습니다.
검토자 세 분 중 두 분 이상이 같은 코드를 부여한 25개 문항을 기준으로 대조하였습니다.
반복 판정의 일치 여부가 신뢰도 지표로 쓰일 수 있다는 뜻입니다. 열 번 모두 같은 답이 나오면 맞을 확률이 두 배 높습니다. 다만 61%는 자동 확정에 충분하지 않습니다. 전문가 확인을 대체할 수 없으며, 전문가가 어디에 시간을 쓸지 정하는 데 쓸 수 있습니다.
시뮬레이션 결과가 가리키는 방향은 분명합니다. 인공지능의 자유 판단에 맡기는 부분을 최소화하고, 규칙으로 결정할 수 있는 것은 규칙으로 결정하는 구조입니다.
이 구조에서 전문가의 일은 50건 전부를 보는 것에서 16건을 보는 것으로 줄어듭니다. 줄어든 만큼 검토 건수를 늘릴 수 있고, 검토 건수가 늘어야 정답셋이 만들어집니다.
시뮬레이션은 제시된 후보 목록 안에서만 고르게 하였습니다. 실제 검토자는 코드표 전체를 검색하여 후보 밖의 코드를 넣으실 수 있으므로, 사람과의 일치율은 이 조건 때문에 낮게 나옵니다. 또한 대조 기준으로 삼은 ‘사람 합의’는 25개 문항에 불과하며, 그 자체가 확정된 정답셋이 아닙니다.
따라서 이 결과에서 읽어야 할 것은 정확도의 절대 수치가 아니라 흔들림의 구조입니다. 어디에서 답이 갈리는지, 무엇을 정하면 갈리지 않는지가 이번 시험의 소득입니다.