Skip to main content
QUICK REVIEW

[论文解读] Simple models predict behavior at least as well as behavioral scientists

Dillon Bowen|arXiv (Cornell University)|Aug 1, 2022
Decision-Making and Behavioral Economics被引用 4
一句话总结

本研究评估了行为科学家是否比简单模型更准确地预测人类行为,发现其表现持续低于诸如“行为干预无效”或随机猜测等基本启发式方法。基于五项研究中超过600名专家的数据,研究显示行为科学家的预测表现不优于——且往往劣于——简单模型,揭示了专家判断中存在显著的噪声和过度自信。

ABSTRACT

How accurately can behavioral scientists predict behavior? To answer this question, we analyzed data from five studies in which 640 professional behavioral scientists predicted the results of one or more behavioral science experiments. We compared the behavioral scientists' predictions to random chance, linear models, and simple heuristics like "behavioral interventions have no effect" and "all published psychology research is false." We find that behavioral scientists are consistently no better than - and often worse than - these simple heuristics and models. Behavioral scientists' predictions are not only noisy but also biased. They systematically overestimate how well behavioral science "works": overestimating the effectiveness of behavioral interventions, the impact of psychological phenomena like time discounting, and the replicability of published psychology research.

研究动机与目标

  • 评估行为科学家对人类行为预测的准确性,与简单模型和启发式方法进行比较。
  • 调查行为科学领域专家判断是否优于随机猜测或零模型等基本基准。
  • 量化在多样化的行为实验中,行为科学家预测的偏差与噪声。
  • 评估简单统计模型(包括线性插值和经验贝叶斯估计器)是否优于专家预测。
  • 检验行为科学预测的可重复性,以及专家判断在预测结果中的可信度。

提出的方法

  • 将行为科学家的预测与假设干预无效应的零模型(即预测行为无变化)进行比较。
  • 应用非参数和参数化的经验贝叶斯估计器,以估计真实处理效应的后验分布,考虑不确定性因素。
  • 使用带有狄利克雷先验的贝叶斯自助法,在干预和行为科学家层级上聚类标准误,提升比较结果的稳健性。
  • 在多元线性回归模型中使用吉布斯抽样,以估计复制概率,整合效应量估计的不确定性。
  • 采用对比风险分析,通过自助抽样计算专家预测不如模型预测的概率。
  • 应用普通最小二乘法(OLS)和方差膨胀误差结构的线性模型,基于原始研究的效应量预测复制可能性。

实验结果

研究问题

  • RQ1行为科学家是否比诸如“干预无影响”之类的简单启发式方法更准确地预测行为结果?
  • RQ2在多个行为实验中,行为科学家的预测准确性与随机猜测相比如何?
  • RQ3行为科学家的预测在多大程度上存在偏差?他们是否系统性地高估了干预措施的有效性?
  • RQ4简单统计模型(如线性插值或经验贝叶斯估计器)是否能优于行为科学中的专家预测?
  • RQ5在处理效应不确定性下,专家预测不如模型预测的概率是多少?

主要发现

  • 行为科学家的预测准确度不高于随机猜测,且在预测干预效果方面往往更差。
  • 在分析的五个研究中,假设所有干预均无效应的零模型均优于行为科学家的预测。
  • 专家系统性地高估了行为干预的有效性,其预测中存在一致的正向偏差。
  • 预测准确度较低且存在显著噪声,个体科学家之间的变异度很高,即使来自顶尖机构的专家亦然。
  • 在努力研究中,简单模型(如基于已知数据点的线性插值)的表现显著优于专家预测。
  • 在多个研究中,专家预测不如模型预测的概率超过80%,表明模型优越性有强有力证据支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。