← 조현병 보도 연구 포털
AIForA Lab · 난이도 분석 · 2026. 9. 3

난이도는 어디서 오는가

조현병 보도의 관련성 판정에서 어떤 기사가 어려운가를 실측했습니다. 실제 기사 300건에 판정자 7종을 돌려 나온 불일치를 난이도로 삼고, 그 난이도가 문항의 성질에서 오는지 판정자의 성향에서 오는지 갈라 보았습니다.

300건
실기사 · 쉬움·중간·어려움 각 100
2,100
판정 수 (7종 × 300, 전문 기준)
AUC .73
기사 특징만으로 어려움을 맞힌 정도
43%
판정자 두 명을 빼자 사라진 어려움
결론. 난이도는 두 곳에서 옵니다. 기사 쪽에서는 조현병이 그 기사에서 차지하는 지분이 작을수록 어려워집니다. 판정자 쪽에서는 관련을 넓게 보느냐 좁게 보느냐는 성향 차이가 그만큼을 더합니다. 어려움 100건 중 43건은 극단 성향 판정자 두 명을 빼는 것만으로 사라졌습니다.

전체 흐름
① 무엇을 난이도로 삼았나→ ② 조현병의 지분→ ③ 어려움을 만드는 특징→ ④ 특징만으로 얼마나 맞히나→ ⑤ 판정자의 성향→ ⑥ 설계에 주는 함의

1무엇을 난이도로 삼았나

네이버뉴스 5년치에서 뽑은 실제 기사 300건에, 판정 규칙(루브릭)을 제시한 상태로 판정자 7종을 돌렸습니다. GPT-5-mini · Gemini 2.5 Flash · Claude Haiku 4.5 · Gemma 4 · EXAONE 3.5 · Llama 3.1 8B · GPT-OSS 120B입니다.

등급정의 — 7종의 소수의견 수문항
쉬움0 — 만장일치100
중간1 — 6:1100
어려움2 이상 — 5:2 또는 4:3100
판정 텍스트는 전문(全文)입니다. 앞선 시도에서 1,000자 발췌로 판정했더니 같은 기사의 등급이 32% 뒤바뀌었습니다. 발췌 기준 난이도는 개별 문항 수준에서 신뢰할 수 없어, 이 분석은 전부 전문 기준으로 다시 수집했습니다.

2조현병의 지분이 작을수록 어렵다

가장 강한 규칙성은 내용이 아니라 분량과 위치에서 나왔습니다. 기사에서 조현병이 차지하는 자리가 작을수록 판정자가 갈립니다.

언급 횟수가 늘수록 쉬워진다

본문에 조현병(정신분열병 포함)이 몇 번 나오는가에 따른 어려움 비율.

1회41% · 79건 2회53% · 86건 3~4회22% · 58건 5회+12% · 77건
지분을 재는 지표쉬움중간어려움불일치와의 상관
조현병 언급 횟수5.5회3.0회2.3회−0.35
첫 언급의 위치 (0=서두, 1=말미)0.190.330.37+0.24
본문 길이1,339자1,629자1,839자+0.22

세 지표가 같은 이야기를 합니다. 조현병이 여러 번, 앞쪽에, 짧은 기사에 나오면 그 기사의 주제입니다. 반대로 긴 기사 한가운데에 한두 번 스치면 판정자마다 다르게 읽습니다. 첫 언급이 서두인 기사는 어려움이 22%인데, 전반부로 밀리면 51%로 뜁니다.

3어려움을 만드는 특징과 없애는 특징

조현병 언급 주변 문맥에서 특징을 뽑아, 그 특징이 있을 때와 없을 때의 어려움 비율을 비교했습니다.

특징해당 문항있을 때없을 때차이
다른 질환과 나란히 나열 — "우울증·치매·조현병 등"10246%27%+19%p
정책·지원 문맥5036%33%+3%p
치료제·제약 문맥9537%32%+5%p
인용문 안에 등장13929%37%−8%p
범죄·재판 문맥5912%39%−27%p
제목에 조현병908%44%−36%p

↑ 나열이 어려움을 만든다

어려움을 높이는 특징은 하나뿐입니다 — 조현병이 다른 질환과 나란히 놓이는 경우. 목록의 한 항목인지 정책의 대상인지가 판정자마다 갈립니다.

↓ 제목이 어려움을 없앤다

제목에 조현병이 있으면 어려움이 8%로 떨어집니다. 단일 지표로는 가장 강력합니다. 제목은 곧 기사의 주제 선언이기 때문입니다.

↓ 사건 기사는 쉽다

범죄·재판 문맥은 어려움 12%. 이 층의 관련 판정 비율은 100%입니다. 피의자 병력과 형사책임의 결합이 판정자에게 익숙한 형태입니다.

기사 종류별

분류문항평균 소수의견어려움 비율
비유·부수적 언급172.0671%
정신건강 정책·제도291.5541%
타 질환·일반 정신건강861.3538%
의료·치료·연구701.1634%
인권·차별280.8221%
당사자·가족 사례200.7010%
강력범죄·사건 연계370.5914%

4특징만으로 얼마나 맞히는가

위 특징 아홉 개로 어려움 여부를 예측하는 모형을 세워 교차검증했습니다.

AUC 0.734 · 정확도 68%. 기사의 겉모습만으로 난이도를 상당 부분 맞힐 수 있지만, 절반가량은 설명되지 않습니다. 설명되지 않는 부분이 어디서 오는지가 다음 절의 주제입니다.
변수표준화 계수방향
조현병 언급 횟수−0.69많을수록 쉬움
제목에 조현병−0.67있으면 쉬움
범죄·재판 문맥−0.36있으면 쉬움
다른 질환과 나열+0.35있으면 어려움
본문 길이+0.25길수록 어려움

5나머지 절반은 판정자에게서 온다

같은 300건을 두고 판정자들이 '관련'이라고 답한 비율입니다. 7종 다수결의 관련 비율은 67%입니다.

판정자마다 잣대가 다르다

가로축은 관련 판정 비율. 어려움 100건만 놓고 보면 격차가 3%와 96%로 벌어집니다.

GPT-OSS 120B36% · 어려움층 3% GPT-5-mini58% · 27% EXAONE 3.558% · 34% Llama 3.1 8B63% · 40% Claude Haiku 4.573% · 73% Gemini 2.5 Flash78% · 81% Gemma 489% · 96% 다수결 67%

Gemma 4와 GPT-OSS 120B는 사실상 반대 잣대를 씁니다. 두 모델의 판정이 엇갈리는 기사가 300건 중 159건(53%)입니다. 반면 Gemini와 Haiku는 14%만 엇갈립니다. 판정자 사이의 거리가 문항 사이의 거리만큼이나 큽니다.

극단 두 명을 빼면 어려움의 43%가 사라진다

Gemma 4와 GPT-OSS 120B를 제외한 5종으로 다시 등급을 매긴 결과.

7종 기준 어려움 100건 5종 기준 어려움 57건 중간 43건

반대로 쉬움 100건은 5종 체제에서도 100건 전부 쉬움으로 남았습니다. 쉬운 문항은 누가 보아도 쉽지만, 어려운 문항의 상당수는 특정 판정자가 만들어 낸 어려움이라는 뜻입니다.

6설계에 주는 함의

난이도는 문항의 속성만이 아니다

같은 기사가 판정자 구성에 따라 어려움이 되기도 하고 중간이 되기도 합니다. 난이도를 보고할 때는 어떤 판정자 집합에서의 난이도인지를 함께 밝혀야 합니다.

배심원 구성이 결과를 좌우한다

성향이 한쪽으로 쏠린 판정자를 여럿 넣으면 다수결이 그쪽으로 기웁니다. 관련을 넓게 보는 모델과 좁게 보는 모델을 균형 있게 넣어야 합니다.

문항을 만들 때의 손잡이

난이도를 높이려면 언급을 한두 번으로 줄이고, 기사 중반에 두고, 다른 질환과 나란히 놓고, 제목에서 빼면 됩니다. 낮추려면 반대로 하면 됩니다.

이 분석의 한계. 난이도를 판정자 불일치로 정의했으므로, 여기서 말하는 어려움은 모델에게 어려운 정도입니다. 사람에게 어려운 정도와 같지 않습니다. 실제로 앞선 검토에서, 모델이 만장일치로 쉽게 넘긴 기사를 사람이 판단보류한 사례가 나왔습니다. 사람 난이도는 문항 검토 도구로 수집 중이며, 두 난이도의 관계는 별도로 보고할 예정입니다.