보고 오류 세 건 — 재현으로 확인한 것
Reporting errors found by reproducing Table 1 from the raw data
B1 회복까지 보되 집단을 나누지 않은 모형 · B2 회복까지 보면서 AI와 인간을 비교 · B3 회복까지 보면서 일시 충격과 영구 충격을 비교
δ₀ 침식기의 하락폭 · δ₁ 집단에 따라 하락폭이 다른 정도 · γ₀ 회복기 수준(충격 전 대비) · γ₁ 집단에 따라 회복기 수준이 다른 정도
F 모형 전체가 자료를 얼마나 잘 설명하는지 — 분기점 후보를 고를 때 이 값이 가장 큰 지점을 골랐습니다.
원자료 reponse_all.xlsx로 여섯 모형을 다시 추정해 원고 Table 1과 대조했습니다.
세 건의 불일치가 나왔고, 세 건 모두 분석이 아니라 보고 단계의 오류입니다.
개정 작업에서 이미 발견·정정된 것과 같은 건이며, 여기서는 근거와 계산 과정을 남깁니다.
① 회복 분기점 — 본문 24, 실제 26
논문에 쓰인 것. 3.4절:
모형 정의:
C2t = 1 if round ≥ 24
재현 결과. 두 분기점으로 각각 돌려 F값을 비교했습니다.
| B1의 δ₀ | B1의 F | B2의 F | B3의 F | |
|---|---|---|---|---|
| 분기점 24로 계산 | −0.059 | 6.99 | 3.32 | 5.40 |
| 분기점 26으로 계산 | −0.065 | 8.73 | 4.00 | 6.37 |
| 논문 Table 1 | −0.065 | 8.734 | 3.997 | 6.372 |
세 모형의 F값이 소수점까지 26에서만 일치합니다.
결론. Table 1은 26으로 계산됐고 본문만 24라고 적혀 있습니다. 탐색은 제대로 수행됐고(F 최대값이 26), 그 값을 본문에 옮겨 적을 때 틀렸습니다.
② B1의 γ₀ — 부호가 뒤집혀 있음
논문 Table 1의 B1 행: γ₀ = +0.022 · 재현 결과: γ₀ = −0.0216, p = .228. 크기는 같고 부호만 반대입니다.
γ₀가 무슨 뜻인가. 충격 전 기저 수준 대비 회복기의 조언 수용도입니다. 부호가 뜻을 완전히 바꿉니다.
| 값 | 읽으면 |
|---|---|
| +0.022 | 회복기가 충격 전보다 높다 → 원래보다 더 믿게 됨 (초과 회복) |
| −0.022 | 회복기가 충격 전보다 여전히 낮다 → 부분 회복 |
실제 수준으로 계산하면 이렇습니다.
| 구간 | 조언 수용도 | |
|---|---|---|
| 충격 전 (1–18라운드) | 0.324 | 기저 |
| 침식기 (19–25라운드) | 0.259 | 0.065 떨어짐 |
| 회복기 (26–30라운드) | 0.302 | 절반쯤 돌아왔으나 원래보다 낮음 |
부분 회복이 맞고, 따라서 음수가 맞습니다.
③ B3의 γ₁ — 별표 누락, 그리고 해석 방향
논문 본문: "LS conditions demonstrated marginally significant differential recovery
(Model B3: γ₁ = −0.060, p < .10), indicating more active trust repair attempts"
논문 Table 1: −0.060, 별표 없음 · 표 각주: *p < .10
즉 본문은 p<.10이라 하고 표는 그 등급의 별표를 붙이지 않았습니다. 표와 본문이 서로 다릅니다.
재현 결과. γ₁ = −0.0597, 강건 표준오차 0.0359, p = .0962. 본문이 맞고 표에 별표가 빠진 것입니다.
그런데 더 큰 문제는 해석 방향입니다. γ₁ = −0.060은 "LS 조건의 회복기 수준이 AO보다 0.060 낮다"는 뜻입니다(각자 기저 대비). 그런데 본문은 이를 "더 적극적인 신뢰 회복"으로 읽었습니다. 음수를 "더 많이 회복"으로 읽은 것입니다.
| 조건 | 충격 전 | 침식기 | 회복기 | 회복 변화량 |
|---|---|---|---|---|
| 일시 충격 (AO) | 0.312 | 0.303 | 0.320 | +0.017 |
| 영구 충격 (LS) | 0.336 | 0.216 | 0.285 | +0.069 |
변화량으로 보면 LS가 훨씬 많이 회복한 것이 맞습니다(+0.069 대 +0.017). 본문의 직관은 틀리지 않았습니다. 문제는 γ₁이 재는 것이 변화량이 아니라 수준이라는 점입니다. LS는 훨씬 깊이 떨어졌기 때문에, 많이 회복하고도 회복기 수준은 여전히 AO보다 낮습니다. 두 개는 다른 양인데 본문이 섞어 썼습니다.
정리
| 분석 | 표 | 본문 | |
|---|---|---|---|
| ① 분기점 | 정상 — 26을 찾음 | 정상 — 26으로 계산 | 오기 (24) |
| ② B1 γ₀ | 정상 (−0.022) | 부호 오류 (+0.022) | 표를 따라 잘못 서술 |
| ③ B3 γ₁ | 정상 (p=.096) | 별표 누락 | 해석 방향 오류 |
· 본문 분기점을 26으로 정정
· B1의 γ₀를 −0.022로 정정
· γ 계수 해석을 "수준"과 "변화량"으로 분리해 서술 — "LS가 더 많이 회복했다"(변화량)와 "그래도 여전히 낮다"(수준)를 둘 다 쓰면 정확하면서 오히려 더 흥미로운 서술이 됩니다
· γ₁에는 ·만 표시하고 이를 근거로 주장하지 않음
재현 스크립트는 table1_final.R입니다. 강건 표준오차와 참가자 클러스터 표준오차를 함께 출력하므로, 심사자 1이 요구한 Table 1의 표준오차를 그대로 채울 수 있습니다.
심사의견과 대응
Reviewer response
심사자 1 — 개방과학과 추론의 엄밀성
- 라운드 19 코딩이 사후적으로 보인다. 최소한 라운드 18 기준 강건성 검정을 보고하라 → 요구대로 재추정하고 라운드 17 기준까지 추가해 Appendix C로 제출. 라운드 18 기준에서 효과가 15–28% 감쇠한다는 불리한 결과도 그대로 보고했습니다. 이론적 근거는 위 디스커션.
- 귀무를 긍정 주장으로 쓰지 마라. 사전 검정력 분석 부재 → 관련 문장 전면 톤다운, "marginal significance" 표현 전량 삭제 (Olsson-Collentine 외, 2019).
- H2를 교호작용 가설로. 두 번째 핵심 발견이 AO/LS를 구분하지 않는 A2에 근거함 → Study 1 데이터에 완전 교호작용 모형 A4/B4 추가 추정.
- 랜덤 절편 도입 (Rebholz, Biella & Hütter, 2024) → 혼합효과 추정 병행, ICC 0.441 보고.
- 모형 적합 비교(BIC) → AIC·BIC·모수 수 추가. 두 지표가 다른 모형을 선택한다는 결과를 그대로 보고하고, R² ≤ 0.009인 영역에서 BIC의 복잡도 벌점이 불리하게 작동함을 설명.
- 본문·Figure 5 불일치 → 실제 부호 오류로 확인, 정정.
- AO·LS 크기 차이 설명 → 위 방법 절의 설명 박스로 추가.
- 사전등록·데이터·코드 공개 → OSF 익명 공개 준비.
- Appendix B 누락, Table 1 표준오차, Figure A1 캡션, 절 순서 등 편집 사항 반영.
심사자 2 — 일반화와 이론적 위치
주된 지적 — 모든 참가자가 같은 시계열을 보았는가
먼저 서술이 모호했습니다. "All participants observed the same underlying time series"가
동일 실현값인지 동일 생성방식인지 구분되지 않았습니다. 답은 동일 실현값이며, 그렇게 다시 썼습니다.
그 다음이 실질입니다 — 결과가 그 하나의 실현값에 특수할 수 있다는 것. 이는 편향이 아니라 추론 범위의 문제입니다.
모든 조건이 같은 계열을 공유하므로 조건 간 대비는 자극에 의해 교란되지 않습니다(상수는 교락변수가 될 수 없습니다).
제약되는 것은 일반화이며, 커버레터와 본문의 무조건적 명제를 조건부로 다시 써야 합니다.
동일 노이즈 자체는 정당한 설계 선택입니다. 참가자별로 실현값을 바꾸면 조언자가 연달아 틀리는 횟수가 사람마다 달라져
처치 강도가 흔들립니다. 다만 자극 일반화가 필요하다면 해법은 무작위화가 아니라
소수의 고정 복제 계열을 배정해 자극을 무선효과로 모형화하는 것입니다
(Wells & Windschitl, 1999; Judd, Westfall & Kenny, 2012).
기존 데이터로 가능한 범위에서는 참가자 클러스터 부트스트랩을 수행했고,
이것이 참가자 표집 변동만 다루며 시계열 실현값 변동은 다루지 못한다고 명시했습니다.
가장 무거운 지적 — 완벽성 도식의 패러다임 불일치
Dietvorst 외(2015)는 단서 기반 예측(여러 변수로 하나를 예측, 알고리즘과 사람 중 택일)이고, 본 연구는 시계열 조언 수용(그 변수의 과거만 보고, 조언을 부분 반영)입니다. Harvey & De Baets(2025)에 따르면 두 문헌의 결과는 정반대입니다 — 단서 기반은 피드백 전 선호·후 기피, 시계열은 피드백 전 기피·후 선호. 따라서 완벽성 도식을 본 연구의 설명 기제로 삼을 수 없다는 것이 심사자의 결론입니다.
대응 — 오적용이 아니라 일반화 범위의 검증으로 재정위
두 문헌의 역전을 설명하는 가설은 하나가 아닙니다. 심사자가 인용한 설명은 응답 방식(택일 대 혼합)이지만, 문제의 성격이라는 설명도 가능합니다. Dietvorst의 과제(학점·시험점수로 성적 예측)는 통계 모델이 사람보다 낫다고 널리 알려진 영역이라 알고리즘에 대한 기대가 높습니다. 주가 예측은 그렇지 않습니다.
완벽성 도식은 높은 사전 기대를 전제로 작동하는 기제입니다. 그렇다면 본 연구는 이론의 오적용이 아니라 "알고리즘 우위가 전제되지 않는 영역에서도 이 기제가 작동하는가"를 검증한 일반화 시험이 됩니다.
그리고 이 전제가 충족되지 않았음을 우리 데이터로 보일 수 있습니다. 실험 전 측정한 초기 신뢰(7점 척도)는 AI 2.58, 인간 2.80으로 둘 다 절대적으로 낮았습니다. 발동 조건이 부재했으므로 차별적 침식이 관측되지 않은 것은 이론과 일관됩니다. H1 귀무는 실패가 아니라 완벽성 도식의 경계조건으로 보고할 수 있습니다.
① 서론에 놓아야 합니다. 이 논거를 한계 절에 넣으면 변명으로 읽힙니다. 서론과 이론 절에서 상위 질문으로 제시해야 심사자의 지적을 흡수하는 구조가 됩니다.
② 이 해석은 사후적입니다. 사전에 예측한 것이 아니므로 응답서에 그렇게 명시하고, Study 2에서 검증 가능한 형태로 제시해야 합니다 — "해당 영역에서 알고리즘이 얼마나 잘할 것으로 기대하는가"를 사전 측정하고, 그 기대 수준이 침식 크기를 조절하는지 검정하면 사후 해석이 사전 예측이 됩니다.
③ 초기 신뢰에 대한 원고의 주장은 철회해야 합니다. 원고는 "참가자들이 인간 조언자에 대해 meaningful bias를 갖고 시작했다"고 서술했으나, 참가자 단위(N=120) 검정에서는 유의하지 않습니다 — 차이 −0.217, p = .558, Cohen's d = −0.107. 행 단위(3,600행)로 검정하면 유의해지지만, 이는 동일 참가자의 값을 30회 반복 계수한 유사반복(pseudo-replication)입니다. 개정 분석 스크립트는 이미 참가자 단위 검정으로 수정되어 있습니다.
대신 "두 조언자 모두 초기 신뢰가 낮았다(2.58, 2.80 / 7점)"를 보고하는 것이 사실에도 맞고 위 경계조건 논거에도 부합합니다.
그 외 — WOA를 행동적 신뢰로 명시(O'Neill, 2002), Slovic(1993) 비대칭 원리 추가, 회복의 계단형 모형화 한계와 관찰 구간 절단을 한계로 명시, 낙관 편향 분석 수행(새 4.4절), Appendix B 포함.
남은 결정
Open decision
심사자 2는 "이 실험만으로 게재를 정당화할 만큼 기여가 충분한지 확신이 서지 않는다"고 썼고, 심사자 1은 사전등록된 후속 데이터 수집을 권고했습니다. 두 심사자가 독립적으로 새 데이터를 지목했습니다.
| 톤다운만 하고 제출 | Study 2 실행 | |
|---|---|---|
| 비용 | 없음 | N ≈ 200 · 3주 |
| H1 귀무 | "탐지되지 않음"으로 후퇴 | 검정력 확보 후 주장 가능 |
| 일반화 | "이 환경에서"로 한정 | 복제 계열 + 다른 ARIMA 사양 |
| 개방과학 | 데이터·코드 공개만 | 사전등록까지 충족 |
| 남는 기여 | 1개 | 3개 |
현재 조언자 효과는 0.023이고 참가자 단위 95% 신뢰구간이 대략 [−0.04, +0.09]입니다. 영구 충격 효과가 −0.111인 점을 감안하면 그 절반 크기의 조언자 효과가 실재해도 탐지되지 않습니다.
톤다운은 부당한 주장을 제거할 뿐, "차이가 없다"를 주장 가능하게 만들지는 못합니다. 필요한 것은 세 가지입니다.
① 사전 검정력 분석으로 N을 결정
② 동등성 검정(TOST) — 최소 관심 효과크기(SESOI)를 사전등록하고 효과가 그 구간 안에 있는지 검정. 이것이 있어야 귀무를 결론으로 보고할 수 있습니다
③ 베이즈 인자로 귀무 지지 증거의 강도를 수치화
자극 일반화도 같습니다. 계열을 여러 개 쓰는 것만으로는 검정이 아니며, 고정 씨드마다 복수의 참가자를 배정해 자극을 무선효과로 모형화해야 "효과가 자극에 따라 달라지는가"를 검정할 수 있습니다 (Judd, Westfall & Kenny, 2012).