결과
Results · 원고 Table 1을 원자료로 재현하고 정확한 p값을 붙였습니다
표를 읽기 전에 — 기호가 무슨 뜻인가
| 기호 | 통계 용어 | 쉬운 말 |
|---|---|---|
| β₀ | 기저 수준 | 충격 전에 조언을 얼마나 따랐나 (0.32 ≈ 조언 쪽으로 3분의 1쯤 이동) |
| β₁ | 집단 간 기저 차이 | 두 집단이 충격 전부터 달랐나 |
| δ₀ | 충격 효과 | 충격 직후 조언 수용이 얼마나 떨어졌나 |
| δ₁ | 충격 × 집단 | 집단에 따라 다르게 떨어졌나 ← 가설을 검정하는 칸 |
| γ₀ | 회복 효과 | 회복 구간에 얼마나 돌아왔나 |
| γ₁ | 회복 × 집단 | 집단에 따라 다르게 돌아왔나 |
모형 여섯 개가 무엇인가
같은 자료에 여섯 개의 회귀식을 돌렸습니다. 이름은 글자 + 숫자로 되어 있고, 각각 뜻이 있습니다.
| A계열 — 회복을 보지 않음 충격 후(19라운드~)를 한 덩어리로 |
B계열 — 회복을 봄 침식기(19–25)와 회복기(26–30)로 나눔 |
|
|---|---|---|
| 1 · 전체 집단을 나누지 않음 |
A1 — 충격 후 전체적으로 얼마나 떨어졌나 | B1 — 떨어졌다가 얼마나 돌아왔나 |
| 2 · 조언자로 나눔 AI 대 인간 |
A2 — AI와 인간이 다르게 떨어졌나 → H1 | B2 — AI와 인간이 다르게 돌아왔나 → H1 |
| 3 · 충격으로 나눔 일시 대 영구 |
A3 — 일시와 영구가 다르게 떨어졌나 → H2 | B3 — 일시와 영구가 다르게 돌아왔나 → H2 |
글자는 회복을 모형에 넣었는지, 숫자는 집단을 어떻게 나눴는지를 뜻합니다. 예를 들어 B3은 "회복까지 보면서, 일시 충격과 영구 충격을 갈라서 비교한 모형"입니다.
2번 모형(A2·B2)에서는 AI가 기준이고, 3번 모형(A3·B3)에서는 일시 충격이 기준입니다. 그래서 같은 δ₀라도 모형에 따라 뜻이 달라집니다.
A1의 δ₀ = 전체 참가자의 평균 하락폭
A3의 δ₀ = 일시 충격 조건에서만의 하락폭 (−0.002 → 사실상 0)
A3의 δ₁ = 영구 충격이 추가로 얼마나 더 떨어뜨렸나 (−0.090)
즉 영구 충격 조건의 총 하락폭은 δ₀ + δ₁ = −0.002 + (−0.090) = −0.092입니다. A3의 δ₀만 보고 "충격 효과가 없다"고 읽으면 안 됩니다.
식으로 쓰면
결과표
| 모형 | β₀ | β₁ | δ₀ | δ₁ | γ₀ | γ₁ | F |
|---|---|---|---|---|---|---|---|
| A1 전체 | 0.324*** | — | −0.047*** | — | — | — | 12.96 |
| A2 조언자 | 0.337*** | −0.026 | −0.058** | 0.023 | — | — | 5.16 |
| A3 충격 | 0.312*** | 0.024 | −0.002 | −0.090*** | — | — | 8.58 |
| B1 전체 | 0.324*** | — | −0.065*** | — | −0.022 | — | 8.73 |
| B2 조언자 | 0.337*** | −0.026 | −0.076*** | 0.021 | −0.034 | 0.025 | 4.00 |
| B3 충격 | 0.312*** | 0.024 | −0.009 | −0.111*** | 0.008 | −0.060· | 6.37 |
강조된 칸만 통계적으로 유의합니다. 흐린 숫자는 0과 구분되지 않습니다.
· p < .10 |
* p < .05 | ** p < .01 | *** p < .001
(이분산에 강건한 표준오차 기준)
· 표시는 참고용입니다 — 유의한 것으로 세지 않으며, 이 칸에 근거해 주장을 세우지 않습니다.
모형 하나씩 읽어보기
계수만 보면 무슨 뜻인지 잘 안 잡힙니다. 각 모형의 계수를 실제 평균값으로 되돌려 계산해 보겠습니다. 숫자는 "조언 쪽으로 얼마나 이동했나"이고, 0.32면 조언과 내 생각 사이의 3분의 1쯤입니다.
A1 — 가장 단순한 모형
묻는 것: 충격이 있고 나서, 전체적으로 조언을 덜 따르게 됐나? 집단을 나누지 않고 참가자 120명을 통째로 봅니다.
| 구간 | 평균 | 계산 |
|---|---|---|
| 충격 전 (1–18라운드) | 0.324 | β₀ |
| 충격 후 (19–30라운드) | 0.277 | β₀ + δ₀ = 0.324 − 0.047 |
읽으면: 충격 후 조언 수용이 0.047 떨어졌고 통계적으로 확실합니다. 다만 "누가 왜 떨어뜨렸는지"는 알 수 없습니다. 그걸 보려고 A2·A3이 있습니다.
A2 — AI와 인간을 갈라서 본 모형
묻는 것: AI 조언자가 인간 조언자보다 더 크게 버림받았나? → H1
| 조언자 | 충격 전 | 충격 후 | 하락폭 |
|---|---|---|---|
| AI | 0.337 | 0.279 | −0.058 |
| 인간 | 0.311 | 0.276 | −0.035 |
읽으면: AI가 0.058, 인간이 0.035 떨어졌으니 AI가 더 많이 떨어진 것처럼 보입니다. 그 차이가 δ₁ = 0.023입니다. 그런데 이 값은 0과 구분되지 않습니다(p = .38). 방향은 알고리즘 기피와 같지만 차이가 있다고 말할 수 없습니다.
A3 — 일시 충격과 영구 충격을 갈라서 본 모형
묻는 것: 오래 가는 충격이 잠깐 튀는 충격보다 더 크게 신뢰를 무너뜨리나? → H2
| 충격 | 충격 전 | 충격 후 | 하락폭 |
|---|---|---|---|
| 일시 (AO) | 0.312 | 0.310 | −0.002 |
| 영구 (LS) | 0.336 | 0.244 | −0.092 |
읽으면: 일시 충격은 사실상 아무 일도 일으키지 않았습니다.
영구 충격만 0.092를 떨어뜨렸습니다. 두 하락폭의 차이가 δ₁ = −0.090이고 통계적으로 확실합니다.
이 연구의 가장 강한 결과입니다.
그리고 잊지 말아야 할 것 — 일시 충격은 크기가 두 배(20 대 10)였습니다.
두 배 크게 때렸는데도 한 번뿐이면 아무 일이 없었습니다.
B1 — 회복까지 본 가장 단순한 모형
묻는 것: 떨어진 신뢰가 나중에 돌아오나? A1을 두 구간으로 쪼갠 것입니다.
| 구간 | 평균 | 계산 |
|---|---|---|
| 충격 전 (1–18) | 0.324 | β₀ |
| 침식기 (19–25) | 0.259 | β₀ + δ₀ |
| 회복기 (26–30) | 0.302 | β₀ + γ₀ = 0.324 − 0.022 |
읽으면: 0.324 → 0.259 → 0.302.
절반쯤 돌아왔지만 원래 수준에는 못 미칩니다. 이것이 논문이 말하는 "부분 회복"입니다.
다만 γ₀는 통계적으로 확인되지 않습니다(p = .23).
이 모형의 γ₀가 원고에 +0.022로 잘못 실린 그 값입니다. 양수로 읽으면
회복기가 충격 전보다 높다는 뜻이 되어, 논문의 "부분 회복" 주장과 정면으로 어긋납니다.
B2 — 회복까지 보면서 AI와 인간을 비교
묻는 것: AI와 인간이 회복하는 방식도 다른가? → H1의 회복 버전
| 조언자 | 충격 전 | 침식기 | 회복기 |
|---|---|---|---|
| AI | 0.337 | 0.262 | 0.303 |
| 인간 | 0.311 | 0.257 | 0.302 |
읽으면: 두 줄이 거의 포개집니다. 침식도 회복도 구분되지 않습니다. δ₁ = 0.021, γ₁ = 0.025 모두 유의하지 않습니다.
B3 — 회복까지 보면서 일시와 영구를 비교
묻는 것: 두 충격이 회복하는 방식도 다른가? → H2의 회복 버전
| 충격 | 충격 전 | 침식기 | 회복기 | 회복량 |
|---|---|---|---|---|
| 일시 (AO) | 0.312 | 0.303 | 0.320 | +0.017 |
| 영구 (LS) | 0.336 | 0.216 | 0.285 | +0.069 |
읽으면: 영구 충격 조건이 0.336에서 0.216까지 깊이 떨어졌다가 0.285까지 올라옵니다.
회복량으로는 일시 충격보다 네 배 큽니다.
그런데 γ₁은 회복량이 아니라 회복기의 "수준"을 잽니다.
영구 충격은 훨씬 깊이 떨어졌기 때문에, 많이 회복하고도 회복기 수준(0.285)은
일시 충격(0.320)보다 낮습니다. 그래서 γ₁ = −0.060으로 음수가 나옵니다.
원고 본문이 이 음수를 "더 적극적인 회복"이라고 읽은 것이 해석 방향 오류입니다.
A1 충격은 신뢰를 떨어뜨린다 확실
A2 AI가 더 떨어진 것처럼 보이나 차이는 확인 안 됨 미확인
A3 떨어뜨린 것은 오직 영구 충격이다 확실
B1 절반쯤 돌아오지만 원래에는 못 미친다 미확인
B2 AI와 인간의 회복 차이 없음 미확인
B3 영구 충격이 더 많이 회복하나 수준은 여전히 낮다 미확인
표에서 읽어야 할 세 가지
| 어디를 보나 | 무엇이 보이나 |
|---|---|
| A3·B3의 δ₁ −0.090*** / −0.111*** |
이 연구의 결과는 사실상 이 두 칸입니다. 영구 충격 조건에서만 조언 수용이 추가로 떨어집니다. 같은 줄의 δ₀(−0.002, −0.009)이 일시 충격 조건의 효과인데 사실상 0입니다. 일시 충격은 크기가 두 배(20 대 10)였는데도 아무 일이 없었습니다. |
| A2·B2의 δ₁ 0.023 / 0.021 |
AI와 사람의 차이입니다. 부호는 알고리즘 기피와 같은 방향이지만 0과 구분되지 않습니다. "차이가 없다"가 아니라 "이 표본으로는 못 찾았다"입니다. |
| γ₀ · γ₁ 열 전체 | 회복입니다. 유의한 칸이 하나도 없습니다. B3의 γ₁ = −0.060만 p = .096으로 · 구간에 걸칩니다. 표에는 참고로 표시하되 여기에 근거해 주장을 세우지 않습니다. 원고 본문은 이 값을 "더 적극적인 신뢰 회복 시도"의 증거로 썼는데, 그 서술은 빼야 합니다. |
원고 Table 1을 원자료로 재현해 보았습니다. A계열은 19라운드 이후 전체를 한 구간으로, B계열은 19–25와 26–30으로 나누는 코딩에서 published 값이 정확히 재현됩니다. 회복 분기점은 26이 맞습니다 — 원고 본문의 "24"는 오기이며, 개정본에서 이미 정정되었습니다.
다만 B1의 γ₀는 재현되지 않습니다. 원고에는 +0.022로 실려 있으나 실제 값은 −0.022입니다. 부호가 뒤집혀 있습니다. 개정 작업에서 발견해 정정한 오류와 같은 건입니다.
별표 표기도 바꿔야 합니다. 원고는 *<.10 / **<.05 / ***<.01을 쓰는데, 대부분의 저널에서 ***는 p<.001입니다. 관례대로 읽는 독자는 유의성을 과대평가하게 됩니다. 위 표는 표준 표기로 다시 붙였습니다.
p<.10 구간은 별표에서 빼고 ·로 따로 표시했습니다. 심사자 1이 반대한 것은 "거의 유의하다"를 근거로 주장을 세우는 것이지 정보를 감추는 것이 아니므로, 표에는 남기되 본문 해석에서는 사용하지 않는 것이 타협점입니다. 해당하는 칸은 B3의 γ₁ 하나뿐입니다.
재분석으로 보강된 것
개정본에서는 OLS · 참가자 랜덤절편 혼합효과 · 참가자 클러스터 부트스트랩(B=1,000) 세 가지를 병렬로 보고합니다. ICC = 0.441로 개인차가 큽니다. 핵심 결과(B3의 δ₁)는 세 방법 모두에서 유지되며 부트스트랩 95% 신뢰구간은 [−0.180, −0.043]으로 0을 배제합니다. 참가자 단위로 묶은 표준오차로 다시 계산해도 p = .003으로 유의합니다.
그리고 심사자 2의 질문에 답하는 과정에서 새 분석이 하나 추가됐습니다. 방향성 낙관 편향은 없었고(평균 −0.36), 대신 조언 방향과 무관하게 자기 초기값 쪽으로 당기는 양방향 앵커링이 나타났습니다 — 상향 조언 시 −3.23, 하향 조언 시 +2.17.
디스커션 1 · 충격의 구조
Discussion — what participants actually saw
본 연구의 해석은 전적으로 참가자가 화면에서 무엇을 보았는가에 달려 있습니다. "라운드 17에 충격을 주었다"는 서술만으로는 그것이 정해지지 않습니다. 이 절에서 구조를 명시합니다.
충격은 기존 구조 위에 겹쳐진 다른 구조입니다
충격 이전까지 계열은 ARIMA(0,1,1)로 움직이고 있었습니다. 그런데 주입된 영구 충격은 그 구조가 아니라 랜덤워크형 수준 이동입니다. 즉 구조가 다른 충격이 들어와 기존 구조와 합쳐진 형태이며, 이 어긋남이 지속적 예측오차의 원인입니다.
ARIMA(1,1,1)로 일반화해 쓰면, ε₈₀ = M 하나가 들어갔을 때 관측 수준의 경로와 영구 잔존량은 다음과 같습니다.
/ M은 충격 크기로 나눈 정규화입니다 — 세로축을 "충격의 몇 배인가"로 읽으라는 뜻.
(1 − φk) ÷ (1 − φ)는 등비수열의 합으로, AR 관성이 k기간 누적된 양입니다.

충격 당기의 반응은 다섯 경우 모두 1로 동일하고, 갈라지는 것은 그 다음 기부터입니다.
범례의 φ, θ는 자료생성과정의 계수입니다.
AR(φ)은 관성, MA(θ)는 반작용이며, 크기가 같으면 서로 상쇄되어 순수 랜덤워크가 됩니다 —
그래서 φ=θ=0.7과 φ=θ=0은 완전히 동일한 경로를 만들고, 가장 단순한 표현인 ARIMA(0,1,0)으로 쓰는 것이 옳습니다.
본 연구의 영구 충격이 이 경우입니다(잔존 100%).
보정이 있는 경우와 없는 경우를 구분해야 합니다
이 둘을 섞으면 논지가 무너집니다.
경우 A — 보정 없음 (이론적 기준선)
조언자가 습관 모형만 유지하면 오차가 e80+k = M(θ₀ − φ₀)θ₀k−1로 감쇠하며 여러 기간 남습니다.
θ₀ = 0.7이면 0.70 → 0.49 → 0.34 → 0.24로 네 기간 지속됩니다.
경우 B — 보정 있음 (본 실험이 채택한 것)
Chen–Liu 탐지 규칙에 따라 두 번의 연속 오차 후 수준 이동항을 반영합니다. 따라서 오차는 라운드 17·18·19 세 번으로 끝나고 라운드 20부터 최적입니다. 심사자 2도 "조언은 17–19 구간을 빼면 최적이었다"고 확인했습니다.

흰 점선이 관측 수준, 색선이 각 습관 모형의 예측입니다. 범례의 φ₀, θ₀는 조언자 모형의 계수로,
그림 1의 자료생성 계수와 다른 모수이므로 아래첨자로 구분했습니다.
이 그림은 경우 A이며, 본 실험의 설계가 아닙니다 — 보정이 왜 필요한지, 없으면 어떻게 되는지를 보이는 기준선입니다.

그림 2의 세로 간격만 분리한 것입니다. φ₀ > θ₀인 경우 오차가 음수로 반전해 일관된 편의가 아니라 진동으로 지각됩니다.

경우 A에서 조작이 성립하는 영역의 지도입니다. 점선 대각선 φ₀ = θ₀ 아래에서는 오차가 소멸하거나 부호가 뒤집혀 측정할 종속변수가 사라집니다.
irf_level <- function(phi, theta, K = 13) { # 그림 1 · 관측 임펄스 응답
k <- 0:K
s <- if (phi == 1) k else (1 - phi^k) / (1 - phi)
c(1, (1 + (phi - theta) * s)[-1])
}
fc_error <- function(phi0, theta0, K = 13) # 그림 2·3 · 경우 A의 예측오차
c(1, (theta0 - phi0) * theta0^(0:(K - 1)))
n_persist <- function(phi0, theta0) # 그림 4 · 지속 기간
sum(abs((theta0 - phi0) * theta0^(0:19)) >= 0.2)
irf_level(0, 0) # 1 1 1 1 ... 랜덤워크, 충격이 전액 영구화 — 본 실험의 LS
fc_error(0, 0.7) # 1.00 0.70 0.49 0.34 ...
n_persist(0, 0.7) # 4
user01 계정
~/AI_Advisor_Figures/ 에 올려두었습니다.
벡터 파일: fig1 · fig2 ·
fig3 · fig4