Skip to main content
QUICK REVIEW

[论文解读] The Experimenters' Dilemma: Inferential Preferences over Populations

Neeraja Gupta, Luca Rigotti|D-Scholarship@Pitt (University of Pittsburgh)|Jul 11, 2021
Experimental Behavioral Economics Studies参考文献 11被引用 4
一句话总结

本文在固定预算下,比较了三个实验群体——实验室本科生、MTurk 和 Prolific——在噪声、每观测成本以及经济博弈中响应弹性的表现。结果发现,Prolific 在噪声和成本方面优于 MTurk;尽管成本更高,实验室群体在响应弹性方面优于两者,因此在检测细微处理效应方面更具优势。

ABSTRACT

We compare three populations commonly used in experiments by economists and other social scientists: undergraduate students at a physical location (lab), Amazon's Mechanical Turk (MTurk), and Prolific. The comparison is made along three dimensions: the noise in the data due to inattention, the cost per observation, and the elasticity of response. We draw samples from each population, examining decisions in four one-shot games with varying tensions between the individual and socially efficient choices. When there is no tension, where individual and pro-social incentives coincide, noisy behavior accounts for 60% of the observations on MTurk, 19% on Prolific, and 14% for the lab. Taking costs into account, if noisy data is the only concern Prolific dominates from an inferential power point of view, combining relatively low noise with a cost per observation one fifth of the lab's. However, because the lab population is more sensitive to treatment, across our main PD game comparison the lab still outperforms both Prolific and MTurk.

研究动机与目标

  • 在固定研究预算下,评估三种常见实验群体(实验室本科生、MTurk 和 Prolific)的推断效力。
  • 评估在无战略张力的博弈中,不同群体决策中的噪声水平(归因于注意力不集中)的差异,尤其关注此类博弈中的表现。
  • 测量在社会困境博弈中,对激励变化的响应弹性,特别是具有不同背叛诱惑力的囚徒困境结构。
  • 确定在平衡成本、噪声和响应性的情况下,哪种群体能提供最高的统计功效以检测处理效应。
  • 指导研究者根据其目标(检测定性方向效应或估计非线性模型中的曲率)选择最优群体。

提出的方法

  • 在三个群体中实施完全相同的单轮经济博弈——两个无战略张力的博弈(用于测量噪声),两个具有囚徒困境结构的博弈(用于测量响应弹性)。
  • 将噪声定义为与激励无关的决策比例,使用自利行为与亲社会行为完全一致的博弈进行测量。
  • 通过框架操纵(首选选项)区分随机选择与选择偏差,从而将注意力不集中与基于偏好的行为分离开来。
  • 固定实验预算,并调整激励规模以匹配各群体的标准支付水平,从而改变所收集的观测数量。
  • 构建等功效和等预算等高线,以建模研究者偏好,将推断效力视为在预算约束下的效用函数。
  • 估计囚徒困境博弈中处理效应的衰减程度,以比较各群体的响应能力,弹性定义为背叛诱惑力每单位变化所引起的合作率变化。

实验结果

研究问题

  • RQ1在无战略张力的博弈中,实验室、MTurk 和 Prolific 群体的噪声行为(注意力不集中)水平如何比较?
  • RQ2各群体的每观测成本是多少?这在固定研究预算下如何影响推断效力?
  • RQ3在社会困境博弈中,对激励变化的响应弹性如何,特别是在具有不同背叛诱惑力的囚徒困境结构中?
  • RQ4在固定预算下,哪种群体能为检测定性方向性处理效应提供最高的统计功效?
  • RQ5在何种条件下,尽管每观测成本更高,实验室群体在推断效力方面仍优于在线平台?

主要发现

  • MTurk 的噪声水平最高,60% 的决策与激励无关,而实验室为 14%,Prolific 为 19%。
  • 当噪声为主要关注因素时,Prolific 在推断效力方面优于 MTurk 和实验室,因其噪声低且每观测成本低(仅为实验室的五分之一)。
  • 尽管每观测成本更高,实验室样本在囚徒困境博弈中对激励变化表现出显著更高的响应弹性,表明其对处理变化更敏感。
  • 在 PD 博弈中,实验室的响应弹性显著高于 Prolific 和 MTurk,后两者对背叛诱惑力变化的响应几乎完全无弹性。
  • 当处理效应大小增加时,由于成本低且噪声低,Prolific 即便弹性较低,其推断效力仍可能超过实验室。
  • MTurk 的显著噪声表明其虽成本低,实为虚假节约;更受管控的平台如 Prolific 更适合可靠推断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。