[논문 리뷰] Simple models predict behavior at least as well as behavioral scientists
이 연구는 행동 과학자들이 인간 행동을 단순한 모델보다 더 정확하게 예측하는지 평가하며, 그 결과 행동 간섭이 효과가 없다는 간단한 히ュ리스틱이나 랜덤 추측보다도 일관되게 열등한 성능을 보이는 것으로 나타났다. 600명 이상의 전문가를 포함한 다섯 개의 연구 데이터를 바탕으로 한 이 연구는 행동 과학자들의 예측이 단순한 모델과 비교해 떨어지며, 전문가 판단에 있어 높은 노이즈와 과신이 존재함을 드러낸다.
How accurately can behavioral scientists predict behavior? To answer this question, we analyzed data from five studies in which 640 professional behavioral scientists predicted the results of one or more behavioral science experiments. We compared the behavioral scientists' predictions to random chance, linear models, and simple heuristics like "behavioral interventions have no effect" and "all published psychology research is false." We find that behavioral scientists are consistently no better than - and often worse than - these simple heuristics and models. Behavioral scientists' predictions are not only noisy but also biased. They systematically overestimate how well behavioral science "works": overestimating the effectiveness of behavioral interventions, the impact of psychological phenomena like time discounting, and the replicability of published psychology research.
연구 동기 및 목표
- 행동 과학자들의 인간 행동에 대한 예측 정확도를 단순한 모델과 히ュ리스틱과 비교하여 평가하는 것.
- 행동 과학 분야의 전문가 판단이 무작위 추측이나 영향 없음 모델과 같은 기본 기준을 초월하는지 조사하는 것.
- 다양한 행동 실험에서 행동 과학자들의 예측에 대한 편향과 노이즈를 정량화하는 것.
- 선형 보간법과 경험 베이즈 추정기와 같은 단순 통계 모델이 전문가 예측을 능가하는지 평가하는 것.
- 행동 과학 예측의 재현 가능성과 전문가 판단이 예측 결과에 대해 얼마나 신뢰할 수 있는지 조사하는 것.
제안 방법
- 행동 간섭의 영향이 없음을 가정하는 근본 모델(즉, 간섭에 따른 행동 변화가 0으로 예측됨)과 행동 과학자들의 예측을 비교하였다.
- 진술적 비모수적 및 모수적 경험 베이즈 추정기를 적용하여 진짜 간섭 효과의 사후 분포를 추정하고 불확실성을 고려했다.
- 디리클레 우선분포를 사용한 베이지안 부트스트랩을 적용하여 간섭 및 행동 과학자 수준에서 표준 오차를 군집화하여 비교의 강건성을 향상시켰다.
- 선형 회귀 모델에서 지그 래핑 샘플링을 사용하여 효과 크기 추정치의 불확실성을 통합하여 재현 확률을 추정하였다.
- 부트스트랩 샘플링을 사용하여 전문가 예측이 모델 예측보다 정확도가 낮을 가능성을 계산하기 위해 비교 위험 분석을 시행하였다.
- OLS와 분산 증폭 오차 구조를 갖는 선형 모델을 적용하여 원래 연구의 효과 크기를 기반으로 재현 가능성 확률을 예측하였다.
실험 결과
연구 질문
- RQ1행동 과학자들은 '간섭이 효과가 없다'와 같은 단순한 히ュ리스틱보다 행동 결과를 더 정확하게 예측하는가?
- RQ2여러 행동 실험에서 행동 과학자들의 예측 정확도는 무작위 추측과 비교해 어떻게 되는가?
- RQ3행동 과학자들의 예측은 어느 정도 편향되어 있으며, 간섭의 효과를 체계적으로 과대평가하는가?
- RQ4선형 보간법이나 경험 베이즈 추정기와 같은 단순 통계 모델이 행동 과학에서 전문가 예측을 능가할 수 있는가?
- RQ5간섭 효과의 불확실성을 고려할 때, 전문가 예측이 모델 기반 예측보다 정확도가 낮을 가능성이 얼마인가?
주요 결과
- 행동 과학자들의 예측은 무작위 추측과 비슷하거나 더 나빴으며, 특히 간섭 효과를 예측할 때 더욱 뚜렷했다.
- 모든 분석된 다섯 개의 연구에서 간섭에 영향이 없다는 근본 모델(모든 간섭에 대해 효과가 0으로 예측됨)이 행동 과학자들의 예측을 뛰어넘었다.
- 전문가들은 체계적으로 간섭의 효과를 과대평가하여, 그들의 예측에 일관된 양의 편향이 존재했다.
- 예측 정확도는 낮고 노이즈가 많았으며, 정상 기관 소속 전문가들 사이에서도 개인 간 변동성이 매우 컸다.
- 단순한 모델, 특히 효과 크기 데이터 포인트 간 선형 보간법이 노력 연구에서 전문가 예측보다 유의미하게 뛰어났다.
- 여러 연구에서 전문가 예측이 모델 예측보다 정확도가 낮을 가능성이 80%를 초과하여 모델의 우월성에 강력한 증거를 제시했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.