AIForA Lab · 정신질환 보도 연구

언어모델 평정단으로 조현병 보도를 읽는 법

사람이 읽기 어려운 분량의 기사를 언어모델이 대신 판정할 때, 그 판정을 믿을 수 있는가. 이 문서는 배경과 목적에서 시작해 선행연구, 새 방법론, 가설, 데이터, 결과, 해석, 가치까지 연구의 전체 설계를 한 장에 담았다.

2026년 10월 기사 21,338건 · 표본 300건 평정 모델 11종 선행연구 372편 수집

1배경과 목적

조현병은 전체 인구의 약 1%가 겪는 질환이지만, 많은 사람은 조현병을 직접 겪은 사람이 아니라 뉴스를 통해 만난다. 강력범죄가 보도될 때마다 가해자의 병력이 함께 전해지고, 그 보도가 반복되면 조현병은 질환이 아니라 위험의 표지로 읽힌다. 언론 보도가 정신질환에 대한 사회적 인식을 만든다는 사실은 여러 나라에서 확인되었으나, 한국 언론이 조현병을 어떻게 다루는지를 장기간·대규모로 측정한 연구는 드물다.

측정이 어려운 이유는 분명하다. 5년치 기사 2만 건을 사람이 코딩하려면 수천 시간이 든다. 코더를 여럿 두면 사람 사이의 판정이 갈리고, 한 사람이 다 하면 그 사람의 성향이 결과가 된다. 언어모델이 대안으로 떠올랐지만, 모델의 판정을 그대로 믿을 근거가 아직 부족하다.

이 연구의 목적

언어모델 여러 대를 평정단으로 세워 조현병 보도를 판정하고, 그 판정이 얼마나 일관된지를 먼저 증명한다. 그 위에서만 인식지수와 사건효과를 산출한다. 판정을 증명하지 않은 지수는 숫자일 뿐 측정이 아니다.

2선행연구

OpenAlex, PubMed, KCI 세 곳에서 선행연구 372편을 수집했다. 국제 문헌은 정신질환 보도와 사회적 인식, 언어모델의 내용분석 활용으로 나뉘고, 국내 문헌은 보도 양상과 가이드라인 평가에 몰려 있다.

2.1 정신질환 보도와 사회적 인식 (OpenAlex)

연도게재지제목인용
2018Social Psychiatry and Psychiatric EpidemioA systematic review of the impact of media reports of severe mental illness on stigma and discrimination, and interventions that a152
2011BMC Public HealthNewspaper coverage of mental illness in the UK, 1992-2008106
2016The Canadian Journal of PsychiatryGood News? A Longitudinal Analysis of Newspaper Portrayals of Mental Illness in Canada 2005 to 2015103
2017Health CommunicationSchizophrenia in Chinese and U.S. Online News Media: Exploring Cultural Influence on the Mediated Portrayal of Schizophrenia62
2014International Journal of EpidemiologyPsychiatric epidemiology and global mental health: joining forces37
2019CNS SpectrumsPharmacological treatment of violence in schizophrenia29

2.2 조현병 보도의 국제 비교 (PubMed)

연도게재지제목
2022World journal of psychiatrySocial media and schizophrenia: An update on clinical applications.
2017Psychiatry and clinical neurosciencesAssociations between renaming schizophrenia and stigma-related outcomes: A systematic review.
2024Psychiatric services (Washington, D.C.)Analysis of Spanish-Language News Reports on Schizophrenia and Psychosis.
2026Electroconvulsive Therapy.
2024Revista Colombiana de psiquiatriaExploring Stigma Towards People with Schizophrenia in Mass Media and Their Private Discourses.

2.3 언어모델을 코더로 쓴 연구 (OpenAlex)

연도게재지제목인용
2023Computational LinguisticsCan Large Language Models Transform Computational Social Science?520
2024npj Science of LearningEvaluating large language models in analysing classroom dialogue62
2023arXiv (Cornell University)Can Large Language Models Transform Computational Social Science?62
2025IEEE/ACM International Conference on MininCan LLMs Replace Manual Annotation of Software Engineering Artifacts?34
2024Lecture notes in computer scienceChatGPT Goes Shopping: LLMs Can Predict Relevance in eCommerce Search13

2.4 국내 연구 (KCI)

연도게재지제목
2024사회과학연구정신질환 보도 가이드라인 도입 전․후 정신질환에 대한 언론 보도 양상
2025정신건강과 사회복지정신질환 보도 프레임의 장기적 변화 : 2012~2024년 주요 일간지 대상 토픽 모델링 기반 분석
2026한국언론학보언론의 정신질환 보도 경향과 사회적 낙인의 재생산: 한국 주요 일간지의 양극성 장애, 우울증, 조현병 보도 분석을 중심으로
2017한국언론학보정신질환의 낙인과 귀인에 대한 언론 보도 분석
2022방송과 커뮤니케이션코로나 관련 정신질환에 대한 보도 연구: 20대 청년층의 정신질환자에 대한 인식과 태도, 전문가 상담 필요성에 미치는 영향
2023대한조현병학회지정신질환 언론보도 가이드라인의 현황과 향후 방향

3선행 방법과 그 한계

갈래방법결과한계
보도 내용분석사람 코더 2~3인이 수백 건을 코딩하고 코더 간 신뢰도를 보고 정신질환 보도에서 범죄·위험 프레임이 우세하다는 일관된 결과 표본이 수백 건에 그쳐 시계열 분석이 어렵다. 코더 훈련과 합의에 드는 비용이 크다
토픽 모델링대규모 기사에 비지도 학습을 적용 주제 군집과 시기별 변화를 보여줌 군집이 연구자의 해석에 의존한다. 기사 한 건의 논조·프레임을 판정하지 못한다
감성 사전어휘 사전으로 긍·부정 점수 산출 대규모 처리에 적합 맥락을 읽지 못한다. "위험하지 않다"를 부정으로 처리한다
언어모델 코딩모델 한 대에 지침을 주고 분류 사람 코더와 비슷한 수준의 일치를 보고한 사례가 늘고 있음 모델 한 대의 판정을 검증 없이 쓴다. 지침을 바꾸면 결과가 달라지는 정도를 보고하지 않는다

마지막 칸이 이 연구의 출발점이다. 언어모델을 코더로 쓴 연구는 늘고 있으나, 지침을 어떻게 쓰느냐에 따라 판정이 얼마나 달라지는지, 모델을 몇 대 어떻게 묶어야 하는지를 체계적으로 실험한 연구는 찾기 어렵다.

4새 방법론

한계를 넘기 위해 세 가지를 설계에 넣었다. 첫째 평정단, 둘째 지침의 실험적 조작, 셋째 라운드다.

설계 1
평정단
모델 한 대가 아니라 11종을 같은 기사에 투입하고, 기사별 중위수를 합의 판정으로 삼는다. 한 모델의 성향이 결과를 좌우하지 못한다.
설계 2
지침 조작
지침의 구체화 수준을 세 단계로 바꿔 같은 기사에 적용한다. 스코어카드가 일치도를 올리는지를 실험으로 확인한다.
설계 3
2라운드
1라운드 판정이 끝나면 각 모델에게 다른 평정자들의 판정 분포와 근거를 보여주고 다시 판정하게 한다. 합의가 늘어나는지를 본다.

4.1 세 변인과 범주

세 변인 모두 가운데 칸을 둔 3범주로 통일했다. 판단이 갈리는 기사를 억지로 한쪽에 넣지 않고 기록에 남기기 위해서다.

변인123묻는 것
관계없다(무관)애매하다(보류)있다(유관)기사가 조현병에 대한 정보나 사회적 인식을 담고 있는가
논조부정애매긍정조현병과 조현병을 가진 사람을 어떻게 다루는가
프레임에피소딕애매테마틱개별 사건으로 다루는가, 사회 구조로 다루는가

4.2 강건성을 위한 시뮬레이션

결과가 설계의 우연이 아님을 보이기 위해 같은 표본 300건 위에서 네 가지를 반복한다.

  1. 지침 효과 — 지침 구체화 수준 3단계를 완전 대응 설계로 비교한다. 조건마다 11종 × 300건 = 3,300회 판정.
  2. 라운드 효과 — 상호 검토 뒤 일치도가 오르는지 본다. 동조와 수렴을 구분하기 위해 "다수를 따를 필요는 없다"는 지시를 넣는다.
  3. 조합 탐색 — 11종에서 뽑을 수 있는 모든 7인 조합(330가지)의 일치도를 계산해 최적·최악 조합을 찾는다.
  4. 재표집 — 기사를 다시 뽑는 부트스트랩으로 신뢰구간을 구해, 조건 간 차이가 우연 범위를 넘는지 판정한다.

5연구가설

H1 · 평정단 가설. 모델 여러 대의 합의 판정은 한 대의 판정보다 안정적이다. 평정단에서 한 모델을 빼고 넣을 때 합의 판정의 변동이 작다.
H2 · 지침 가설. 지침을 구체화하면 모델 간 일치도가 오른다. 다만 구체화의 조건이 있다. 범주의 경계가 서로 겹치지 않고, 각 범주가 기사에서 확인할 수 있는 관찰 조건으로 서술되고, 판정 순서가 주어져야 한다. 세 조건 중 하나라도 빠지면 정의를 더 적는 일이 오히려 일치도를 떨어뜨린다.
H3 · 라운드 가설. 다른 평정자의 판정과 근거를 본 뒤 다시 판정하면 일치도가 오른다.
H4 · 조합 가설. 일치도는 모델의 수보다 구성에 더 민감하다. 같은 수라도 어떤 모델을 묶느냐에 따라 크게 달라진다.
H5 · 규모 가설. 파라미터가 큰 모델은 지침을 더 잘 따르며, 지침이 길어질수록 작은 모델과의 격차가 벌어진다.

6데이터 수집

항목내용
수집원네이버뉴스 2021-07 ~ 2026-07 (5년)
검색어조현병, 정신분열병, 정신분열증
수집 원본22,666건
제외제목·본문 어디에도 표기가 없는 377건. 본문 수집 실패와 다른 기사 혼입이 원인이며, 재수집으로 174건을 복구했다
분류 완료21,338건 (모집단)
표본틀본문 200자 미만과 제목 중복을 제외한 20,079건
표본무작위 300건 (연도 비례 층화)
판정 단위기사 1건. 본문은 6,000자까지 제시
호출 조건temperature 0, 추론 기능 비활성화, 출력 형식 고정

추론 기능이 켜져 있던 네 모델(Gemini 2.5 Flash, Kimi-K2, GLM-4.7-Flash, gpt-oss-120b)은 설정을 확인해 껐다. Kimi-K2는 추론을 켜면 기사당 202초·$0.0122가 들지만 끄면 49초·$0.0039로 줄어든다.

7결과

7.1 지침별 판정 분포

A안 · 한 줄 지시
유관 82%
B안 · 범주명만
보류 10%유관 81%
C안 · 범주 정의(경계 겹침)
보류 16%유관 81%
C′안 · 범주 정의(판정 순서 명시)
무관 26%유관 73%
무관보류유관
그림 1. 지침별 판정 분포 (각 조건 11종 × 300건)

7.2 지침과 라운드에 따른 일치도

0.00.10.20.30.40.50.6A안 · 한 줄 지시0.183B안 · 범주명 정의0.269C안 · 겹치는 정의0.042C′안 · 판정 순서 명시0.444B안 · 2라운드 상호검토0.358C′안 · 2라운드 상호검토0.558
그림 2. 크리펜도르프 알파(명목)와 95% 신뢰구간. 기사 재표집 600회

알파는 분포가 한쪽으로 쏠리면 낮게 나온다. 이 자료는 유관이 80%를 넘으므로 알파만으로는 지침의 효과를 과소평가할 수 있다. 그래서 쏠림에 덜 민감한 지표를 함께 싣는다. 관찰 일치는 평정자 쌍이 같은 판정을 낸 비율이고, Gwet AC1은 우연 일치를 범주 수로 추정해 유병률 편향을 줄인 계수다.

지침α 명목 [95% CI]관찰 일치Gwet AC1전원 일치보류율
A안 · 한 줄 지시0.183 [0.152, 0.212]0.7500.70541%10%
B안 · 범주명 정의0.269 [0.235, 0.304]0.7650.72049%10%
C안 · 겹치는 정의0.042 [0.019, 0.065]0.6970.6404%16%
C′안 · 판정 순서 명시0.444 [0.395, 0.487]0.7660.70434%3%
B안 · 2라운드 상호검토0.358 [0.317, 0.398]0.7490.68846%13%
C′안 · 2라운드 상호검토0.558 [0.511, 0.606]0.8260.78354%0%

알파만 오르고 관찰 일치가 떨어지면 분포만 흔든 것으로 보았다. C′안은 관찰 일치가 다섯 조건 가운데 가장 높고(0.766), AC1은 B안과 사실상 같다(0.704 대 0.720). 알파만 크게 올랐다.

7.3 지침이 무너지는 자리

C안에서 일치도가 떨어진 것은 지침을 주었기 때문이 아니라 지침의 서술이 겹쳤기 때문이다. C안은 무관과 보류를 모두 "직접적으로 드러나지 않음"으로 시작했고, 보류에 "추론을 통해서 추측할 수 있음"을 붙였다. 이 문장은 사실상 모든 기사에 적용될 수 있다. 아래는 모델별 보류 선택 비율(%)이다.

모델A안B안C안C′안B안 2RC′안 2R
DeepSeek-V4-Flash2519151160
GLM-4.7-Flash1720151151
GPT-4o-mini33200120
Gemini-2.5-Flash0101720
Gemma-3-27B1520231111
Haiku-4.5141250200
Kimi-K23312161
Llama-3.1-8B26886161
Qwen3.5-9B231130
gpt-oss-120b201640210
solar-pro4564160

Llama-3.1-8B는 C안에서 300건 가운데 88%를 보류로 보냈다. 그러나 이 모델을 뺀 10인에서도 C안의 알파는 0.137 [0.105, 0.172]로 B안의 0.300 [0.261, 0.341]에 못 미쳤다. 한 모델의 문제로 돌릴 수 없다는 뜻이다.

C′안은 같은 세 범주를 유지하면서 세 곳을 고쳤다. 유관과 무관을 각각 "질병에 관한 서술이 한 문장 이상 있는지"라는 확인 가능한 조건으로 바꾸고, 1번부터 차례로 확인해 처음 걸리는 범주로 확정하게 하고, 보류를 "본문이 끊긴 경우"와 "병명이 다른 뜻으로 쓰였는지 확인되지 않는 경우"로만 한정했다. 범주의 수도 기사도 평정단도 그대로 두었으므로, C안과 C′안의 차이는 서술 방식의 차이다.

7.4 모델별 합의 일치율

각 모델이 평정단 최빈값과 같은 판정을 내린 비율(%)이다.

모델A안B안C안B안 2라운드C′안C′안 2라운드
DeepSeek-V4-Flash586685868995
GLM-4.7-Flash788285888787
GPT-4o-mini878874799190
Gemini-2.5-Flash938896848091
Gemma-3-27B818180839089
Haiku-4.5808695829091
Kimi-K2869093748686
Llama-3.1-8B90809746477
Qwen3.5-9B938794837888
gpt-oss-120b788593819290
solar-pro4939194938891

7.5 평정단 조합

11종에서 7인을 뽑는 330가지 조합을 모두 계산했다. 같은 인원이라도 구성에 따라 일치도가 달라지며, 그 폭은 지침이 좋을수록 줄어든다.

7.6 라운드가 바꾼 것

스코어카드로 1라운드를 돌린 뒤, 다른 평정자의 판정 분포와 대표 근거를 보여주고 다시 판정하게 했다. "다수를 따를 필요는 없다"를 지시에 넣어 동조를 억제했다. 모델들은 평균 17%의 기사에서 판정을 바꿨다.

바뀐 방향이 한쪽으로 쏠리지 않았다는 점이 중요하다. 평정단 전체의 유관 비율은 73%에서 75%로 거의 그대로인데, 모델별로는 Gemini-2.5-Flash가 65%에서 80%로 올리고 GPT-4o-mini가 81%에서 69%로 내렸다. 단순 동조라면 모두 같은 방향으로 움직여야 한다.

7.7 세 변인에서의 재현

지침의 세 조건을 관계에서 끌어냈으므로, 변인을 바꾸어도 같은 결론이 나오는지 확인해야 한다. 논조는 부정·애매·긍정으로, 프레임은 에피소딕·애매·테마틱으로 두고, 관계에서 유관으로 합의된 기사에만 적용했다. 두 변인의 스코어카드는 서술을 베끼지 않고 같은 원칙으로 다시 썼다. 각 변인마다 두 특징의 있음과 없음으로 세 범주를 가르는 결정표를 만들고, 두 특징이 함께 있을 때 무엇으로 가를지를 변인마다 따로 정했다. 논조는 제목과 첫 문단이 어느 쪽인지로, 프레임은 기사가 원인과 해법을 어디에 두는지로 가른다.

변인지침α 명목 [95% CI]α 서열관찰 일치전원 일치7인 최적분포
관계짧은 지침0.269 [0.232, 0.301]0.3790.76549%0.4069 / 10 / 81
스코어카드0.444 [0.391, 0.493]0.4810.76634%0.62026 / 3 / 72
스코어카드 2라운드0.561 [0.515, 0.610]0.5700.82754%0.66926 / 0 / 73
논조짧은 지침0.399 [0.359, 0.442]0.5290.61214%0.51235 / 22 / 43
스코어카드0.471 [0.424, 0.512]0.4970.64715%0.65635 / 34 / 31
스코어카드 2라운드0.574 [0.532, 0.614]0.6400.71628%0.68133 / 30 / 36
프레임짧은 지침0.462 [0.413, 0.507]0.5800.68423%0.57543 / 10 / 47
스코어카드0.505 [0.455, 0.554]0.5530.73428%0.64355 / 5 / 39
스코어카드 2라운드0.521 [0.470, 0.573]0.5720.73333%0.65350 / 7 / 43

분포는 낮은 점수부터 차례로 적었다. 7인 최적은 11종에서 7인을 뽑는 330가지 조합의 최댓값이다.

이 과정에서 동점 규칙을 두 번 고쳤고, 두 번 모두 배울 것이 있었다.

첫째, 잔여 범주는 좁아야 한다. 논조의 첫 결정표는 애매를 "두 특징이 함께 있거나 둘 다 없다"로 두었는데, 부정 서술과 긍정 서술이 함께 든 기사가 많아 애매가 17%에서 45%로 늘고 서열 알파가 오히려 떨어졌다. 잔여 범주를 좁히라는 세 번째 조건을 지침 자체가 어긴 셈이다. "둘 다 있으면 제목과 첫 문단으로 가른다"로 고치자 명목 알파와 관찰 일치가 함께 올랐다.

둘째, 동점 규칙은 위치가 아니라 내용이어야 한다. 프레임에도 같은 "제목과 첫 문단" 규칙을 썼더니 알파가 오르는 듯했으나, 뉴스의 제목과 첫 문단은 거의 언제나 사건으로 시작하므로 판정이 에피소딕으로 쏠린 결과였다(에피소딕 46%에서 67%). 동점 규칙을 "기사가 원인과 해법을 어디에 두는가"로 바꾸자 분포가 55 대 39로 돌아왔고, 그와 함께 이득도 크게 줄었다. 지표를 올리는 규칙과 옳은 규칙은 같지 않다.

8해석

지침은 일치도를 올린다. 다만 조건이 있다

가설 H2는 조건부로 지지되었다. 한 줄 지시에서 범주명 정의로 갈 때 알파가 0.183에서 0.269로 올랐고, 판정 순서를 명시한 C′안에서 0.444에 이르렀다. C′안과 B안의 신뢰구간은 겹치지 않는다. 반면 범주 정의를 적었으나 경계가 겹친 C안에서는 0.042로 떨어졌다. 지침을 더 적는 것이 아니라 어떻게 적는지가 일치도를 가른다.

지침이 갖춰야 할 세 가지

C안과 C′안은 범주의 수도, 기사도, 평정단도 같다. 서술 방식만 다르다. 그 차이에서 세 조건을 끌어냈다.

  1. 경계가 겹치지 않을 것. C안은 무관과 보류를 모두 "직접적으로 드러나지 않음"으로 시작했다. 같은 문장으로 시작하는 두 범주는 모델마다 다르게 갈린다.
  2. 기사에서 확인할 수 있는 조건으로 쓸 것. "사회적 인식이 드러남"은 읽는 이의 판단을 요구하지만, "질병에 관한 서술이 한 문장 이상 있음"은 기사를 보고 확인할 수 있다.
  3. 판정 순서를 주고 잔여 범주를 좁힐 것. 보류를 "본문이 끊긴 경우"와 "병명이 다른 뜻으로 쓰였는지 확인되지 않는 경우"로 한정하자 보류율이 16%에서 3%로 줄었다.

잘 만든 카드는 라운드를 한 번 더 두는 것보다 낫다

C′안의 1라운드 알파(0.444)는 B안을 두 라운드 돌린 결과(0.269 → 0.358)보다 높다. 상호 검토는 효과가 있지만 비용이 두 배로 든다. 같은 예산이라면 카드를 다시 쓰는 편이 먼저다.

분포가 고르게 된 것은 옳은 재분류였다

C′안에서 무관이 9%에서 25%로 늘었다. 지표를 올리려고 분포만 흔든 것이 아닌지 확인해야 한다. B안에서 유관이던 기사 가운데 C′안에서 무관으로 바뀐 30건은 조현병 언급이 중위수 1회였고 63%가 단 한 번만 언급했다. 유관으로 남은 206건은 중위수 3회였다. 이동은 쉬움 2%, 중간 13%, 어려움 15%로 난이도에 비례했다. 옮겨간 기사는 제약사 실적 보도나 위탁생산 계약 보도처럼 병명이 제품 설명에만 붙은 기사였다. 카드가 의도한 경계가 그대로 작동했다.

지표 하나로 지침을 평가하면 결론이 뒤집힌다

알파는 범주가 고르게 쓰일 때 커지고, Gwet AC1은 그 영향을 줄인다. 유관이 80%를 넘는 조건에서는 알파가 지침의 효과를 과소평가하고, 범주 수가 다른 카드끼리 비교하면 알파가 과대평가한다. C′안은 B안과 관찰 일치가 거의 같은데(0.766 대 0.765) 알파는 크게 높다. C′안의 이득은 "더 많이 합의했다"가 아니라 "같은 수준의 합의를 훨씬 어려운 분포에서 달성했다"로 읽어야 한다. 이 연구는 알파·관찰 일치·AC1·전원 일치를 함께 싣고, 네 지표가 같은 방향일 때에만 효과로 판정했다.

지침의 효과는 모델 규모에 따라 갈린다

가설 H5는 지지되었다. C안에서 Llama-3.1-8B의 합의 일치율은 9%까지 떨어졌고, 판정의 88%를 보류로 보냈다. C′안에서 64%로 되돌아왔으나 열한 모델 가운데 여전히 가장 낮다. 이 모델을 뺀 10인에서 C′안의 알파는 0.510으로 11인의 0.444보다 높다. 스코어카드에서는 이 모델만 점수를 내지 못한 사례가 남았다. 관계 300건 가운데 1건, 논조 230건 가운데 5건이다. 판정 대신 지침의 문장을 되풀이하다 끝났고, "설명 없이 점수 한 줄로만 답하라"로 다시 물어도 같았다. 다른 열 모델에는 그런 사례가 없었다. 다른 방향의 사례도 있다. Gemini-2.5-Flash는 C′안의 보류 조건을 문자 그대로 받아 보류를 17% 선택했고 합의 일치율이 88%에서 80%로 낮아졌다. 지침을 길게 쓸수록 작은 모델은 지침을 따르는 대신 지침을 읽는다. 지침의 효과를 말할 때는 어떤 모델에서인지를 함께 말해야 한다.

상호 검토는 효과가 있었다

가설 H3은 지지되었다. 1라운드 알파 0.269에서 2라운드 0.358로 올랐고, 두 신뢰구간이 겹치지 않는다([0.233, 0.298] 대 [0.317, 0.398]). 주목할 점은 판정이 다수 쪽으로 쏠리지 않았다는 것이다. 유관이 81%에서 76%로 줄고 무관과 보류가 늘었다. 다른 평정자의 근거를 읽은 뒤 판정을 낮춘 모델이 많았다는 뜻이며, 단순 동조라면 반대 방향이어야 한다.

조합이 모델 수보다 중요하다

가설 H4는 지지되었다. 같은 7인이라도 조합에 따라 알파가 두 배 이상 차이 났다. 신뢰도를 보고할 때 평정단을 어떻게 골랐는지를 밝히지 않으면 그 수치는 선택의 산물일 수 있다. 결과를 보고 잘 맞는 모델만 남기는 것은 코더를 사후에 고르는 일과 같다.

환원할 수 있는 만큼만 효과가 있다

세 변인에서 스코어카드의 이득은 고르지 않았다. 관계는 "질병에 관한 서술이 한 문장 이상 있는가"로 거의 완전히 환원되고, 알파가 가장 크게 올랐다. 논조는 "위험과 잇는 서술"과 "당사자의 목소리"로 부분적으로 환원된다. 프레임은 "원인과 해법을 어디에 두는가"가 표면에서 확인되지 않고 추론을 요구하므로, 관찰 일치는 0.684에서 0.734로 올랐으나 알파는 신뢰구간이 겹치는 수준에 머물렀다. 프레임에서 동점 규칙을 제목의 위치로 두었을 때 알파가 더 오르는 듯했으나, 뉴스의 제목과 첫 문단은 거의 언제나 사건으로 시작하므로 판정이 에피소딕으로 쏠린 결과였다 (다섯 모델 기준 에피소딕 46%에서 67%). 동점 규칙을 원인과 해법의 소재로 바로잡자 분포가 55 대 39로 돌아오고 그 몫의 이득도 사라졌다. 스코어카드의 효과는 구성개념을 관찰 조건으로 환원할 수 있는 정도에 비례한다.

프레임에서는 라운드를 한 번 더 두어도 달라지지 않았다. 11인에서 짧은 지침 0.462 [0.413, 0.507], 스코어카드 0.505 [0.455, 0.554], 스코어카드 2라운드 0.521 [0.470, 0.573]로 세 신뢰구간이 모두 겹친다. 모델들은 2라운드에서 18%에서 42%까지 판정을 바꿨으므로 근거를 읽지 않은 것이 아니다. 근거를 주고받아도 좁혀지지 않았다는 뜻이다.

이 대비가 이 연구에서 가장 중요한 결과일 수 있다. 2라운드는 다른 평정자의 근거를 읽고 판단을 고치는 절차다. 그것이 듣지 않는다면 불일치의 근원은 지침의 모호함이 아니라 구성개념 자체의 모호함이다. 관계는 기사 안에서 결정되고, 논조는 대체로 기사 안에서 결정되지만, 에피소딕과 테마틱의 경계는 기사 안이 아니라 읽는 이의 해석에 있다. 따라서 프레임은 신뢰도를 높이는 문제가 아니라 범주를 다시 세우는 문제다. 선행연구가 프레임에서 낮은 일치도를 반복해 보고해 온 것도 같은 이유로 읽힌다.

좋은 카드는 조합 선택의 위험까지 줄인다

11종에서 7인을 뽑는 330가지 조합에서, B안은 최적 0.406과 최저 0.168 사이를 오갔다. C′안에서는 최적이 0.620로 오르고 최저도 0.345로 올라, C′안의 가장 나쁜 조합이 B안의 가장 좋은 조합에 가깝다. 평정단을 어떻게 고르느냐가 결과를 좌우하는 정도가 줄었다는 뜻이며, 이는 사후 선택의 유혹을 줄이는 쪽으로도 의미가 있다.

9가치