배경과 목적
LLM이 해석과 판단을 돕는 지금, 그 판단은 누구의 관점을 담고 있는가
성경은 같은 원문이 수백 년 동안 여러 언어로 번역되어 온 병렬 텍스트입니다. 원문이 같으므로 해석이 달라진다면, 그 원인을 질문 언어와 모델을 만든 나라로 좁혀 볼 수 있습니다.
언어 효과
같은 본문이라도 영어·한국어·중국어 중 어느 언어로 묻는지에 따라 해석이 달라지는지 검증합니다.
개발국 효과
한·미·중 모델 사이에 해석 차이가 있는지, 그리고 국가 안의 두 모델에서 일관되게 나타나는지 검증합니다.
인간 기준선
모델의 응답 분포가 해당 국가 사람들의 가치관(WVS 7차)과 얼마나 가까운지 비교합니다.
LLM의 "권위관"을 성경 해석으로 측정한다
기존 LLM 문화 편향 연구는 주로 설문 문항이나 정치 질문을 다뤘습니다. 이 연구는 오랜 해석 전통이 있는 텍스트로 국가 권위에 대한 복종과 저항을 한·미·중 모델에서 처음으로 비교합니다.
언어 효과와 개발국 효과를 분리한다
국가당 2개 모델을 규모에 맞춰 고르고 증류 여부를 확인해 개발국 효과의 오염을 줄입니다. 자국어 증폭을 한국과 중국에 대칭으로 검정해 특정 국가의 현상인지 공통 현상인지 가릅니다. 반복 호출 대신 질문 틀 변형, 척도 역방향, 로그확률을 씁니다. 모든 절차를 사전등록하고 공개합니다. 이 절차가 곧 다국어 가치 감사 틀입니다.
선행연구
네 갈래의 연구가 만나는 지점
언어와 문화에 따른 LLM의 가치 차이
같은 모델도 중국어로 물으면 더 상호의존적인 답을 하고[1], 정치 질문의 답이 영어와 중국어에서 달라집니다[9]. 문화 정렬은 질문 언어와 사전학습 언어 구성의 영향을 받고[6], 모델 내부의 개념 공간은 영어 쪽에 가깝습니다[8]. LLM은 WEIRD 사회와 가장 닮았고[5], 국가별 조사 자료와 비교하는 방법이 확립되어 있으며[2][3][4], 중국산 모델은 정치 질문을 더 많이 거부합니다[10].
LLM에게 설문하는 방법의 함정
선택지 순서와 표기만 바꿔도 응답이 달라지고[11], 형식에 민감하며[12], 강제 선택과 서술형 응답이 다를 수 있습니다[7]. 첫 토큰 확률이 생성한 답과 다를 수 있고[13], 분포 추정 방법에 따라 결과가 달라집니다[14].
참고문헌 30편 보기
- Lu, Song & Zhang (2025). Cultural tendencies in generative AI. Nature Human Behaviour, 9, 2360–2369. doi
- Tao, Viberg, Baker & Kizilcec (2024). Cultural bias and cultural alignment of large language models. PNAS Nexus, 3(9), pgae346. doi
- Durmus et al. (2023). Towards measuring the representation of subjective global opinions in language models. arXiv:2306.16388. link
- Santurkar et al. (2023). Whose opinions do language models reflect? ICML 2023. link
- Atari, Xue, Park, Blasi & Henrich (2023). Which humans? PsyArXiv. link
- AlKhamissi, ElNokrashy, AlKhamissi & Diab (2024). Investigating cultural alignment of large language models. ACL 2024. link
- Röttger et al. (2024). Political compass or spinning arrow? ACL 2024. link
- Wendler, Veselovsky, Monea & West (2024). Do llamas work in English? ACL 2024. link
- Zhou & Zhang (2024). Political biases and inconsistencies in bilingual GPT models: The cases of the U.S. and China. Scientific Reports, 14, 25048. doi
- Pan & Xu (2026). Political censorship in large language models originating from China. PNAS Nexus, 5(2), pgag013. doi
- Dominguez-Olmedo, Hardt & Mendler-Dünner (2024). Questioning the survey responses of large language models. NeurIPS 37. link
- Sclar, Choi, Tsvetkov & Suhr (2024). Quantifying language models' sensitivity to spurious features in prompt design. ICLR 2024. link
- Wang et al. (2024). "My answer is C": First-token probabilities do not match text answers in instruction-tuned language models. Findings of ACL 2024. link
- Meister, Guestrin & Hashimoto (2025). Benchmarking distributional alignment of large language models. NAACL 2025. link
- Abid, Farooqi & Zou (2021). Persistent anti-Muslim bias in large language models. AIES '21. doi
- Plaza-del-Arco et al. (2024). Divine LLaMAs: Bias, stereotypes, stigmatization, and emotion representation of religion in LLMs. Findings of EMNLP 2024. link
- Elrod (2024). Uncovering theological and ethical biases in LLMs: An integrated hermeneutical approach employing texts from the Hebrew Bible. HIPHIL Novum, 9(1). doi
- Zetzsche (1999). The Bible in China: The history of the Union Version. Monumenta Serica Monograph Series XLV.
- Eber (1999). The interminable term question. In Bible in Modern China (pp. 135–161). Monumenta Serica.
- Ahn (2011). The Term Question in Korea 1882–1911, and its Chinese roots. PhD thesis, University of Edinburgh. link
- Foster (2017). The reception of Romans 13:1–7 during the English Reformation. PhD thesis, University of Leeds. link
- Madsen (2019). The Sinicization of Chinese religions under Xi Jinping. China Leadership Monitor, 61. link
- CCC & TSPM (2018). Five-year planning outline for advancing the Sinicization of Christianity (2018–2022). China Law Translate 영역. link
- Park (2003). Protestantism and politics in Korea. University of Washington Press.
- Hutsebaut (1996). Post-critical belief. Journal of Empirical Theology, 9(2), 48–66. doi
- Duriez, Fontaine & Hutsebaut (2000). A further elaboration of the Post-Critical Belief scale. Psychologica Belgica, 40, 153–181. doi
- Altemeyer & Hunsberger (2004). A revised religious fundamentalism scale. IJPR, 14(1), 47–54. doi
- NORC. General Social Survey, variable BIBLE. link
- Haerpfer et al. (Eds.) (2022). World Values Survey: Round Seven, country-pooled datafile v5.0. doi
- Anthropic (2026.09) 증류 보고서 관련 보도. The Hacker News (2026.09.11). link — 원문 보고서를 확인한 뒤 1차 출처로 교체 예정
모델 기술 보고서: EXAONE 4.5 (arXiv:2604.08644), Gemma 4 (arXiv:2607.02770), gpt-oss (arXiv:2508.10925), ERNIE 4.5 (Baidu 기술 보고서), Seed-OSS-36B (Hugging Face 모델 카드), Solar Pro 2 (Upstage 발표 자료, API 전용)
가설: 세 가지 설명의 결정적 검정 v3
가설 번호는 논증 순서를 따릅니다. 언어 효과가 있는지 확인하고(H1), 그 원인을 가르고(H2–H4), 사람의 분포와 대봅니다(H5)
| 경쟁하는 설명 | 모든 모델에 언어 효과 | 자국어에서 증폭 | 권위 본문에서 만 큼 | 검정 |
|---|---|---|---|---|
| A. 문화 단서질문 언어가 그 언어권의 문화적 경향을 불러냄 [1][6] | H1 · H2 | |||
| B. 사전학습 각인자국어 학습 데이터의 담론이 남음 [6][8] | H3 | |||
| C. 정렬·규제 각인개발국의 규제와 사후학습이 민감한 주제를 조정함 [9][10] | H4 |
네 번째 설명인 번역 효과(번역본의 용어 선택이 차이를 만든다 [19][20])는 번역본 조건을 제외하면서 이번 연구에서는 검정하지 않습니다. 한계로 기술하고 후속 연구 과제로 남깁니다.
한국어·중국어로 물으면 복종 지수가 높아진다
같은 모델 안에서 한국어·중국어 질문의 복종 지수가 영어보다 높을 것이다. 6개 모델 중 5개 이상에서 방향이 같아야 지지로 판정한다. 출발점이 되는 가설로, 여기서 효과가 없으면 H2–H4는 해석할 대상이 없다.
국적만 알려서는 같은 이동이 나오지 않는다
영어로 묻되 "저는 중국에 사는 그리스도인입니다" 같은 한 줄만 붙인 조건의 이동폭이, 해당 언어로 물은 조건보다 작을 것이다. 지지되면 언어 자체에 원인이 있고, 기각되면 모델이 상대에 맞춰 응대를 바꾼 것이다.
언어 효과는 모델의 자국어에서 더 크다
중국 모델의 [중국어−영어], 한국 모델의 [한국어−영어] 차이가 미국 모델의 같은 차이보다 클 것이다. 두 나라에 대칭으로 적용해 "중국만의 현상"과 "공통된 자국어 효과"를 구분한다.
개발국 차이는 권위 본문에서 가장 크다
중국과 미국 모델의 차이가 비교 주제(재물, 창조·기적 기사)보다 국가 권위 문항에서 클 것이다. 두 비교 주제는 각각 따로 비교한다. 거부·중립 응답 비율도 함께 본다.
각 언어 조건은 해당 국가의 분포에 가장 가깝다
언어 조건별 응답 분포와 미국·한국·중국 WVS 분포 사이의 젠슨–섀넌 거리를 비교한다. 해당 국가와의 거리가 가장 짧은지 프롬프트 단위 부트스트랩 신뢰구간으로 판정한다.
탐색적 질문 E1 한국 모델의 위치 · E2 언어 효과가 본문 방향(복종 쪽·저항 쪽)을 따르는가
판정 규칙
| 항목 | 기준 |
|---|---|
| 결과 변수 | 복종 지수(Obedience Index): 국가 권위 문항 10개(로마서 13장, 사도행전 5장, 마태복음 22장, 베드로전서 2장, 다니엘 3장, 출애굽기 1장)의 1–7점 응답. 서열 범주로 다룹니다. 비교 주제는 재물과 창조·기적 기사를 따로 집계합니다 |
| 최소 의미 크기 (SESOI) | 1–7점 척도 0.3점에 해당하는 오즈비와 젠슨–섀넌 거리로 파일럿에서 환산해 사전등록합니다 |
| 효과 없음의 판정 | 동등성 검정 (two one-sided tests, TOST) |
| 다중비교 | 확인적 가설 H1–H5에 Holm 보정 (α = .05), 검정력 0.95 |
| 모델 간 일관성 | 국가 수준의 주장은 해당 국가의 두 모델이 모두 같은 방향일 때만 합니다 |
연구 설계
모델 6개 × 언어 3개 × 문항 20개 × 질문 틀 4개 × 척도 방향 2가지 × 반복 3회 + 국적 단서 조건 · 모델당 2,160회
모델: 국가당 2개, 규모 맞춤
선정 기준: 국가 간 규모 맞춤 · 다른 회사 모델의 출력을 무단 증류했다고 보고된 연구소 제외 · 모든 호출의 모델 버전, 제공처, 정밀도, 일시, 파라미터 기록
권위 적용 시나리오
세금, 종교 단체 등록, 예배 제한, 설교 심의, 기념비 의례, 시위자 명단, 해로운 의료 지시, 비공인 모임, 충성 서약. 부당함의 정도를 낮음·중간·높음으로 나누고, 복종 쪽·저항 쪽 본문을 절반씩 배치합니다.
비교 주제 문항
재물(마태복음 19장, 디모데전서 6장, 누가복음 12장)와 창조·기적 기사(창세기 1장, 요나, 노아 홍수). H3에서 권위 본문에서만 개발국 차이가 큰지 비교합니다.
점검 문항
빨간불·공정한 세금(디도서 3:1–2)은 복종 쪽, 위증·고문 명령(잠언 24:11–12)은 저항 쪽이 나와야 합니다. 모델이 척도를 제대로 쓰는지 확인합니다.
번역본
질문 언어에 맞는 번역본 하나를 씁니다. 영어 KJV·WEB, 중국어 和合本 1919, 한국어 개역한글입니다. 교차·원문 조건은 2026년 9월 논의에서 제외했습니다.
질문 틀과 척도 방향
질문 틀 4가지(기본형·조언 요청형·간결형·판단 요청형) × 척도 정·역방향. 같은 질문의 표현 변형이며 측정 구성개념이 아닙니다. 1–7점 모든 칸에 행동 수준의 설명을 붙이고, 네 틀 모두 같은 문구를 씁니다. 4점은 "행동으로는 따르되 합법적·평화적으로 반대"라는 현실적인 중간 입장입니다.
WVS 7차와 공개 2차 자료
종교의 중요성, 신에 대한 믿음, 권위 존중, 교회·정부 신뢰 등. 미국(2017), 한국(2018), 중국(2018)의 응답 분포와 비교합니다.
가설 검정 방법론
응답은 1–7점 서열척도입니다. 평균으로 검정하지 않고, 응답 분포 전체를 다룹니다
| 가설 | 분석 | 검정 대상 |
|---|---|---|
| 공통 모형 | 누적 링크 혼합모형 · 점수 ~ 언어 × 개발국 × 주제 + 척도방향 + (1 | 문항) + (1 | 질문틀) + (1 | 프롬프트) | |
| 권위 문항 모형 | 점수 ~ 언어 × 개발국 × 본문방향 + 척도방향 + (1 | 문항) + (1 | 질문틀) + (1 | 프롬프트) · 언어 효과가 본문 방향에 따라 반대로 나타나 상쇄되는 경우를 잡아냅니다 | |
| H1 | 모델 안 언어 대비 | 한국어−영어, 중국어−영어. 6개 모델 중 5개 이상 방향 일치 |
| H2 | 국적 단서 조건 대 언어 조건 | [영어 + 국적 단서의 이동폭] − [해당 언어의 이동폭] |
| H3 | 언어 × 개발국 상호작용 | 중국 모델 [중−영] − 미국 모델 [중−영], 한국 모델 [한−영] − 미국 모델 [한−영] |
| H4 | 개발국 × 주제 상호작용 | 권위 문항의 개발국 격차 − 각 비교 주제의 개발국 격차, 거부·중립 비율 |
| H5 | 응답 분포 비교 | 국가별 WVS 분포와의 젠슨–섀넌 거리. 프롬프트 단위 부트스트랩 |
판정 규칙
보정 p < .05 · 신뢰구간이 최소 의미 크기를 넘음 · 같은 나라 두 모델의 방향 일치. 세 조건을 모두 통과해야 지지로 판정합니다. 효과 없음도 동등성 검정으로 판정합니다. 모델 품질 기준으로 점검 문항 통과와 정·역방향 일관성을 보며, 일관성 기준값은 파일럿에서 정합니다.
추론의 단위
같은 프롬프트를 반복한 호출은 독립 표본이 아닙니다. 프롬프트를 무선효과로 넣어 묶습니다. 독립 단위는 모델당 프롬프트 720개입니다.
강건성
7개 범주 분포 전체에 대한 순열검정으로 모형 가정 없이 재확인합니다. 효과크기는 확률적 우위(무작위 한 쌍에서 한쪽이 더 복종적일 확률)와 오즈비로 보고합니다. 자체 구동 모델은 점수 토큰의 로그확률도 함께 봅니다.
예상 결과
사전 가설에 따른 예상입니다. 실제 결과가 다르면 그대로 보고합니다
언어가 해석을 바꾼다
로마서 13장 문항에서 한국어·중국어 조건이 영어보다 복종 쪽으로 기울 것입니다. 사도행전 5장 같은 저항 쪽 본문에서는 방향이 다르게 나타날 수 있어, 본문 방향별로도 봅니다.
국적 단서만으로는 일부만 재현된다
국적을 알려 주면 이동이 일부 나타나지만, 해당 언어로 물었을 때만큼은 아닐 것으로 예상합니다. 남는 차이가 언어 자체의 몫입니다.
자국어에서 더 크게
중국 모델은 중국어에서, 한국 모델은 한국어에서 언어 효과가 미국 모델보다 클 것입니다. 두 나라에서 모두 나타나면 특정 국가의 현상이 아니라는 뜻이 됩니다.
권위 본문에서 가장 크게
개발국 차이는 재물이나 창조·기적 기사보다 국가 권위 문항에서 더 클 것입니다. 거부·중립 응답도 권위 문항에서 많을 것으로 예상합니다.
사람 분포와 방향은 같다
각 언어 조건의 응답 분포가 해당 국가의 WVS 분포에 가장 가까울 것으로 예상합니다. 다만 모델의 응답은 사람보다 훨씬 좁게 몰릴 것입니다.
연구의 가치
학술 · 방법론 · 실무 · 정책 · 경제
학술적 가치
LLM의 문화 편향 연구를 종교 텍스트의 해석으로 넓히고, 같은 원문을 쓰는 병렬 텍스트로 언어 효과와 개발국 효과를 분리해 추정합니다.
방법론적 가치
반복 호출을 부풀리지 않는 설계, 국가당 복수 모델, 규모 맞춤, 모델 출처 검증, 사전등록과 재현 패키지. LLM 설문 연구의 표준 절차가 될 수 있는 틀입니다.
실무적 가치
교회와 신학교, 기독교 교육 현장에서 어떤 모델을 어떤 언어로 쓰는지가 해석에 영향을 줄 수 있음을 보여 줍니다.
정책적 가치
다국어 AI 서비스의 가치 중립성 점검, 모델 출처 공개, 언어별 감사가 필요하다는 근거를 제공합니다.
"이 AI는 누구의 관점으로 말하는가"를 측정하는 도구
이 연구의 측정 절차는 다국어 AI를 도입하는 조직이 쓸 수 있는 가치 감사 도구가 될 수 있습니다. AI 신뢰성 검증 서비스, 종교·교육 현장의 모델 선택 지침, 연구 과제와 기금, 시리즈가 쌓인 뒤의 다국어 가치 벤치마크로 이어질 수 있습니다.
LLM이 해석과 판단을 돕는 도구가 될수록, 그 판단이 어느 언어로, 어느 나라에서 만든 모델로 이루어졌는지가 중요해집니다. 이 연구는 가장 오래된 병렬 텍스트로 그 차이를 처음 측정하고, 그 절차를 누구나 다시 쓸 수 있는 도구로 남깁니다.
워크플랜
사전등록 후 수집 · 2026년 12월 수집·분석 완료 목표
설계 확정 G1
가설, 모델 6개, 최소 의미 효과, 탐색적 조건, 권위 본문, 온프레미스 서버
측정 도구 제작 G2
시나리오 20개, 질문 틀 5개와 역방향, 번역본 확보, 3개 언어 번역·역번역, WVS 등 문항 매핑
파일럿 G3
6개 모델 소규모 호출, 형식·거부율·점검 문항 확인, 검정력 0.95 시뮬레이션, 분석 코드 사전 작성
OSF 정식 사전등록 G4
가설, 조건, 표본 구조, 제외 기준, 분석 모형, 품질 기준, 문항 전체
본 수집 G5
6개 모델과 Base 모델 비교, 호출 메타데이터와 수집 로그
코딩·분석
근거 서술 코딩, 사전등록한 분석, 탐색적 분석 구분 보고
원고·공개 G6
원고 투고, 재현 패키지(원시 응답, 코드, 코드북, 로그) 공개
G1–G6은 연구책임자의 승인이 있어야 다음 단계로 넘어가는 지점입니다. OSF: osf.io/8q5zr (연구계획 공개 · 정식 사전등록 2026년 11월 예정)