조현병 보도의 관련성 판정에서 어떤 기사가 어려운가를 실측했습니다. 실제 기사 300건에 판정자 7종을 돌려 나온 불일치를 난이도로 삼고, 그 난이도가 문항의 성질에서 오는지 판정자의 성향에서 오는지 갈라 보았습니다.
네이버뉴스 5년치에서 뽑은 실제 기사 300건에, 판정 규칙(루브릭)을 제시한 상태로 판정자 7종을 돌렸습니다. GPT-5-mini · Gemini 2.5 Flash · Claude Haiku 4.5 · Gemma 4 · EXAONE 3.5 · Llama 3.1 8B · GPT-OSS 120B입니다.
| 등급 | 정의 — 7종의 소수의견 수 | 문항 |
|---|---|---|
| 쉬움 | 0 — 만장일치 | 100 |
| 중간 | 1 — 6:1 | 100 |
| 어려움 | 2 이상 — 5:2 또는 4:3 | 100 |
가장 강한 규칙성은 내용이 아니라 분량과 위치에서 나왔습니다. 기사에서 조현병이 차지하는 자리가 작을수록 판정자가 갈립니다.
본문에 조현병(정신분열병 포함)이 몇 번 나오는가에 따른 어려움 비율.
| 지분을 재는 지표 | 쉬움 | 중간 | 어려움 | 불일치와의 상관 |
|---|---|---|---|---|
| 조현병 언급 횟수 | 5.5회 | 3.0회 | 2.3회 | −0.35 |
| 첫 언급의 위치 (0=서두, 1=말미) | 0.19 | 0.33 | 0.37 | +0.24 |
| 본문 길이 | 1,339자 | 1,629자 | 1,839자 | +0.22 |
세 지표가 같은 이야기를 합니다. 조현병이 여러 번, 앞쪽에, 짧은 기사에 나오면 그 기사의 주제입니다. 반대로 긴 기사 한가운데에 한두 번 스치면 판정자마다 다르게 읽습니다. 첫 언급이 서두인 기사는 어려움이 22%인데, 전반부로 밀리면 51%로 뜁니다.
조현병 언급 주변 문맥에서 특징을 뽑아, 그 특징이 있을 때와 없을 때의 어려움 비율을 비교했습니다.
| 특징 | 해당 문항 | 있을 때 | 없을 때 | 차이 |
|---|---|---|---|---|
| 다른 질환과 나란히 나열 — "우울증·치매·조현병 등" | 102 | 46% | 27% | +19%p |
| 정책·지원 문맥 | 50 | 36% | 33% | +3%p |
| 치료제·제약 문맥 | 95 | 37% | 32% | +5%p |
| 인용문 안에 등장 | 139 | 29% | 37% | −8%p |
| 범죄·재판 문맥 | 59 | 12% | 39% | −27%p |
| 제목에 조현병 | 90 | 8% | 44% | −36%p |
어려움을 높이는 특징은 하나뿐입니다 — 조현병이 다른 질환과 나란히 놓이는 경우. 목록의 한 항목인지 정책의 대상인지가 판정자마다 갈립니다.
제목에 조현병이 있으면 어려움이 8%로 떨어집니다. 단일 지표로는 가장 강력합니다. 제목은 곧 기사의 주제 선언이기 때문입니다.
범죄·재판 문맥은 어려움 12%. 이 층의 관련 판정 비율은 100%입니다. 피의자 병력과 형사책임의 결합이 판정자에게 익숙한 형태입니다.
| 분류 | 문항 | 평균 소수의견 | 어려움 비율 |
|---|---|---|---|
| 비유·부수적 언급 | 17 | 2.06 | 71% |
| 정신건강 정책·제도 | 29 | 1.55 | 41% |
| 타 질환·일반 정신건강 | 86 | 1.35 | 38% |
| 의료·치료·연구 | 70 | 1.16 | 34% |
| 인권·차별 | 28 | 0.82 | 21% |
| 당사자·가족 사례 | 20 | 0.70 | 10% |
| 강력범죄·사건 연계 | 37 | 0.59 | 14% |
위 특징 아홉 개로 어려움 여부를 예측하는 모형을 세워 교차검증했습니다.
| 변수 | 표준화 계수 | 방향 |
|---|---|---|
| 조현병 언급 횟수 | −0.69 | 많을수록 쉬움 |
| 제목에 조현병 | −0.67 | 있으면 쉬움 |
| 범죄·재판 문맥 | −0.36 | 있으면 쉬움 |
| 다른 질환과 나열 | +0.35 | 있으면 어려움 |
| 본문 길이 | +0.25 | 길수록 어려움 |
같은 300건을 두고 판정자들이 '관련'이라고 답한 비율입니다. 7종 다수결의 관련 비율은 67%입니다.
가로축은 관련 판정 비율. 어려움 100건만 놓고 보면 격차가 3%와 96%로 벌어집니다.
Gemma 4와 GPT-OSS 120B는 사실상 반대 잣대를 씁니다. 두 모델의 판정이 엇갈리는 기사가 300건 중 159건(53%)입니다. 반면 Gemini와 Haiku는 14%만 엇갈립니다. 판정자 사이의 거리가 문항 사이의 거리만큼이나 큽니다.
Gemma 4와 GPT-OSS 120B를 제외한 5종으로 다시 등급을 매긴 결과.
반대로 쉬움 100건은 5종 체제에서도 100건 전부 쉬움으로 남았습니다. 쉬운 문항은 누가 보아도 쉽지만, 어려운 문항의 상당수는 특정 판정자가 만들어 낸 어려움이라는 뜻입니다.
같은 기사가 판정자 구성에 따라 어려움이 되기도 하고 중간이 되기도 합니다. 난이도를 보고할 때는 어떤 판정자 집합에서의 난이도인지를 함께 밝혀야 합니다.
성향이 한쪽으로 쏠린 판정자를 여럿 넣으면 다수결이 그쪽으로 기웁니다. 관련을 넓게 보는 모델과 좁게 보는 모델을 균형 있게 넣어야 합니다.
난이도를 높이려면 언급을 한두 번으로 줄이고, 기사 중반에 두고, 다른 질환과 나란히 놓고, 제목에서 빼면 됩니다. 낮추려면 반대로 하면 됩니다.