Regaining Trust in AI · JBDM 심사 중

🔬 연구 소개

무엇을 묻고, 어떻게 설계했는가.

01

연구 질문

The question

조언자가 예측을 틀리면 사람들은 조언을 덜 따릅니다. 여기까지는 잘 알려져 있습니다. 이 연구가 보는 것은 그 다음입니다 — 무너진 신뢰가 돌아오는가, 얼마나, 무엇에 따라.

여기에 두 개의 축을 세웠습니다.

두 충격은 사용자에게 전혀 다른 신호를 줍니다. 앞은 "운이 나빴다", 뒤는 "이 조언자는 세상이 바뀐 걸 모른다"입니다. 신뢰 회복의 속도가 이 조합에 따라 어떻게 달라지는지는 실증된 바가 없습니다.

심사 이후 재정위한 상위 질문

기존 알고리즘 기피 연구(Dietvorst 외, 2015)는 통계 모델이 사람보다 낫다고 확립된 영역에서 수행되었습니다. 금융 시계열은 그런 영역이 아닙니다. 그렇다면 상위 질문은 이렇게 됩니다.

알고리즘 우위가 전제되지 않는 영역에서도 같은 현상이 나타나는가

이 틀에서 본 연구는 이론의 오적용이 아니라 일반화 범위에 대한 검증이며, H1 귀무는 실패가 아니라 완벽성 도식의 경계조건이 됩니다. 이 질문은 한계 절이 아니라 서론과 이론 절에 놓여야 합니다.
세 줄 요약

① 오래 가는 충격은 조언 수용을 확실히 떨어뜨립니다. 잠깐 튀는 충격은 두 배 크기여도 거의 영향이 없습니다.
② AI냐 사람이냐에 따른 차이는 찾지 못했습니다. "차이가 없다"가 아니라 "이 표본으로는 못 찾았다"입니다.
③ 회복은 방향만 있고 통계적으로 확인되지 않았습니다.

팀 설명서(그림책)로 먼저 보기 → — 이 카드의 내용을 그림으로 풀어 쓴 15장짜리 문서입니다.

02

선행연구

Literature

알고리즘 기피

Dietvorst, Simmons & Massey (2015)는 사람들이 알고리즘의 오류를 목격하면 인간의 동일한 오류보다 강하게 조언을 할인한다고 보고했습니다. Burton, Stein & Jensen (2020)이 이를 정리했습니다.

영역 의존성 — 상위 질문의 근거

① 알고리즘 신뢰는 과제 성격에 따라 달라집니다 — Castelo, Bos & Lehmann (2019, JMR).
② Dietvorst류 연구가 쓰는 과제는 모델 우위가 확립된 영역입니다 — Meehl (1954), Dawes (1979).
③ 금융 시계열은 그렇지 않습니다 — Önkal 외 (2009)는 같은 영역에서 "통계 모델" 라벨이 "전문가"보다 더 할인됨을 보였습니다.

세 단계가 쌓이면 "그럼 후자에서도 성립하는가"가 자연스러운 질문이 되고, 그것이 본 연구입니다.

패러다임 구분 — 심사 후 추가

Harvey & De Baets (2025)는 시계열 예측에서는 위 결과가 역전된다고 지적합니다. 피드백 전에는 기피, 후에는 선호. Önkal 외 (2009), Chacon 외 (2022). 본 연구는 시계열 패러다임에 속합니다.

조언 수용과 자기중심적 할인

Bonaccio & Dalal (2006), Yaniv & Kleinberger (2000), Soll & Larrick (2009). 다만 Himmelstein (2022)은 자기중심적 할인이 집계 과정의 산물일 수 있다고 봅니다.

신뢰의 비대칭

Slovic (1993) — 신뢰는 무너뜨리기는 쉽고 쌓기는 어렵습니다. Baumeister 외 (2001)의 부정성 편향과 함께 본 연구의 비대칭 결과를 뒷받침합니다.

신뢰 회복

Kahr 외 (2024)는 AI 조언에 대한 신뢰가 완전히 회복되는 경우를 보고했습니다. 오류의 타이밍이 핵심 변수입니다.

개입 시계열 분석

Box & Tiao (1975), Tsay (1988), Chen & Liu (1993). 이상치와 수준변화를 구분하고 동시 추정하는 틀이며, 자극 설계와 조언자의 탐지 규칙이 여기에 기반합니다.

03

가설

Hypotheses

H1 — 조언자 유형에 따라 신뢰 침식과 회복이 다르다 (AI가 더 크게 침식된다).
H2 — 영구적 충격이 일시적 충격보다 더 크고 더 오래 가는 침식을 낳는다.

심사자 1은 H2를 교호작용 가설로 세웠어야 한다고 지적했습니다 — 완벽성 도식 논리가 참이라면 인간 조언자가 영구 충격에 더 잘 적응한다고 기대될 것이므로, 조언자 × 충격 교호작용을 검정해야 한다는 것입니다.

04

방법

Method

설계

2 (조언자: AI / 인간) × 2 (충격: AO / LS) 피험자 간 설계, MTurk N=120, 셀당 30명. 조언의 내용은 네 조건에서 완전히 동일하며 라벨만 다릅니다. 세션 약 40분, 보상 $2 + 성과 보너스(평균 $3.25).

자극

ARIMA(0,1,1) 로 주가 계열을 생성했습니다.

(1 − B) Yt = (1 − θB) εt   ·   θ = 0.7,  εt ~ N(0,1),  Y0 = 10

계열은 90개 관측치이고, 참가자는 61~90번째를 30라운드에 걸쳐 예측합니다. 충격은 77번째 시점 = 라운드 17에 주입되며 참가자에게 고지되지 않습니다.

일시적 충격 (AO)   Yt ← Yt + ω · I(t = 77),  ω = 20
영구적 충격 (LS)   Yt ← Yt + ω · I(t ≥ 77),  ω = 10
두 충격의 크기가 다른 이유 — 심사자 1이 설명을 요구했고, 현재 원고에 답이 없습니다.

기준은 명목 충격 크기가 아니라 참가자가 실제로 관찰하는 누적 예측오차입니다.

영구 충격(ω = 10)은 조언자가 구조변화를 탐지할 때까지 세 라운드에 걸쳐 오차를 냅니다. 조언자가 매 기 오차의 30%를 흡수하므로 10 + 7 + 4.9 = 21.9입니다. 일시 충격은 단일 라운드의 오차만 발생하므로, 동일한 노출량을 맞추려면 ω = 20이 되어야 합니다 (20 × 1 = 20.0).

즉 ω = 20은 임의의 값이 아니라 θ = 0.7에서 도출되는 값입니다. 감쇠율이 0.7이면 세 기간 누적 오차가 원충격의 약 2.2배가 되므로, 일회성 충격은 두 배로 주어야 합니다. ω = 30으로 설정했다면 30 대 21.9로 오히려 어긋납니다.

이렇게 맞춘 결과 두 조건의 차이는 오차의 총량이 아니라 지속성 하나로 고립됩니다. 그리고 이 설계가 논지를 강화합니다 — 동일한 오차 총량을 겪고도, 한 번에 몰린 경우(AO)는 침식을 거의 일으키지 못했습니다(A3의 δ₀ = −0.002).

조언자의 적응 규칙

Chen & Liu (1993)의 개입 모형화를 따릅니다. 조언자는 구조변화를 즉시 탐지하지 못하고, 두 번의 연속된 예측오차를 관찰한 뒤 수준 이동항 ω를 반영합니다. 따라서 조언은 라운드 17·18·19에서만 최적이 아니고, 라운드 20부터 다시 최적입니다.

이 설계 덕분에 충격 직후의 오차는 조언자의 무능이 아니라 정보 제약의 결과가 되고, 관측되는 WOA 변화는 조언 품질이 아니라 순수한 신뢰의 동태로 해석됩니다.

종속변수

WOA = (최종 예측 − 초기 예측) ÷ (조언 − 초기 예측)

Harvey & Fischer (1997). 0이면 조언 무시, 1이면 완전 수용. 조언보다 더 멀리 가는 과대추종도 신뢰의 실패로 보아 1을 넘는 부분을 대칭적으로 감점한 WOAadj를 사용합니다.

WOAadj = max( 0,  1 − |WOA − 1| )

두 심사자 모두 이것을 행동적(revealed) 신뢰로 명시하고, 설문으로 묻는 명시적(stated) 신뢰와 구분하라고 요구했습니다 (O'Neill, 2002; Daschner & Obermaier, 2022).

추정

A계열은 회복을 가정하지 않고, B계열은 두 번째 분기점을 두어 회복을 모형화합니다.

C1t = 1  if  라운드 ∈ [19, 23]  (충격 직후 구간)
C2t = 1  if  라운드 ≥ 24  (회복 구간)
Model B3   Wit = β₀ + β₁Ai + δ₀C1t + δ₁SiC1t + γ₀C2t + γ₁SiC2t + εit

회복 분기점은 탐색으로 찾았습니다. 라운드 22~27을 후보로 두고 각각 추정해 F통계량이 최대인 지점을 선택했으며, 인접 분기점으로 바꿔도 결과가 유지되는지 확인했습니다(Appendix B). 개정 과정에서 이 값이 24가 아니라 26이었음이 확인되어 정정했습니다.