[논문 리뷰] The Experimenters' Dilemma: Inferential Preferences over Populations
이 논문은 실험 경제학에서 랩 대학생, MTurk, Prolific 세 가지 실험 인구를 소음, 관측당 비용, 경제 게임에서의 반응 탄력성 측면에서 비교한다. 고정된 연구 예산 하에서 Prolific은 소음과 비용이 낮아 MTurk를 압도하며, 랩은 비용이 더 높지만 반응 탄력성 측면에서 두 인구보다 뛰어나, 미세한 처리 효과를 탐지하는 데 더 우수하다.
We compare three populations commonly used in experiments by economists and other social scientists: undergraduate students at a physical location (lab), Amazon's Mechanical Turk (MTurk), and Prolific. The comparison is made along three dimensions: the noise in the data due to inattention, the cost per observation, and the elasticity of response. We draw samples from each population, examining decisions in four one-shot games with varying tensions between the individual and socially efficient choices. When there is no tension, where individual and pro-social incentives coincide, noisy behavior accounts for 60% of the observations on MTurk, 19% on Prolific, and 14% for the lab. Taking costs into account, if noisy data is the only concern Prolific dominates from an inferential power point of view, combining relatively low noise with a cost per observation one fifth of the lab's. However, because the lab population is more sensitive to treatment, across our main PD game comparison the lab still outperforms both Prolific and MTurk.
연구 동기 및 목표
- 고정된 연구 예산 하에서 세 가지 일반적인 실험 인구—랩 대학생, MTurk, Prolific—의 추론 능력을 평가하기 위해.
- 특히 전략적 긴장이 없는 게임에서 의사결정의 소음(무관심으로 기인함)이 이들 인구 간에 어떻게 달라지는지 평가하기 위해.
- 사회적 딜레마 게임, 특히 다양한 배신 유혹 수준을 가진 포로의 딜레마 구조에서 인centive 변화에 대한 반응 탄력성을 측정하기 위해.
- 비용, 소음, 반응성의 균형을 고려할 때 처리 효과를 탐지하기 위한 최고의 통계적 검정력을 제공하는 인구를 특정하기 위해.
- 연구자가 질적 방향 효과를 탐지하는 데 목적이 있는지, 아니면 비선형 모델에서 곡률을 추정하는 데 목적이 있는지에 따라 최적의 인구를 선택하는 데 도움을 주기 위해.
제안 방법
- 세 인구(랩, MTurk, Prolific)에서 동일한 일회성 경제 게임을 시행—전략적 긴장이 없는 두 게임(소음 측정용)과 포로의 딜레마 구조를 가진 두 게임(반응 탄력성 측정용).
- 자기 이익과 공공선 행동이 완전히 일치하는 게임을 사용하여, 인센티브와 무관한 결정 비율로 소음을 측정한다.
- 프레임 조작(첫 번째로 나열된 선택지)을 통해 무작위 선택과 선택 편향을 구별하여, 무관심을 선호 기반 행동과 분리한다.
- 실험 예산을 고정하고 인센티브 척도를 조정하여 각 인구에서 표준 지급 수준을 유지함으로써 수집되는 관측 수를 변화시킨다.
- 연구자 선호도를 모델링하기 위해 등가력 및 등가예산 등고선을 구성하며, 예산 제약 조건 하에서 추론 능력을 효용 함수로 간주한다.
- 포로의 딜레마 게임에서 처리 효과 감쇠를 추정하여 인구 간 반응성 차이를 비교하며, 탄력성은 배신 유혹 수준의 단위 변화에 따른 협력률 변화로 측정한다.
실험 결과
연구 질문
- RQ1전략적 긴장이 없는 게임에서 랩, MTurk, Prolific 인구 간 소음 수준(무관심)은 어떻게 비교되는가?
- RQ2각 인구의 관측당 비용은 얼마이며, 이는 고정된 연구 예산 하에서 추론 능력에 어떻게 영향을 미치는가?
- RQ3사회적 딜레마 게임에서, 특히 다양한 배신 유혹 수준을 가진 포로의 딜레마 구조에서 인센티브 변화에 대한 반응 탄력성은 얼마나 되는가?
- RQ4고정된 예산 하에서 어떤 인구가 질적 방향 처리 효과를 탐지하기 위해 가장 높은 통계적 검정력을 제공하는가?
- RQ5랩 인구가 더 높은 관측당 비용에도 불구하고, 어떤 조건에서 온라인 플랫폼보다 추론 능력에서 뛰어나게 되는가?
주요 결과
- MTurk는 소음 수준이 가장 높으며, 인센티브와 무관한 결정 비율이 60%에 달하는 반면, 랩은 14%, Prolific은 19%였다.
- 소음이 주요 고려 사항일 경우 Prolific이 MTurk와 랩을 모두 압도하며, 낮은 소음과 낮은 관측당 비용(랩의 1/5) 덕분에 추론 능력에서 최고를 기록한다.
- 더 높은 관측당 비용에도 불구하고, 랩 샘플은 포로의 딜레마 게임에서 인센티브 변화에 대해 유의미하게 더 높은 반응 탄력성을 보이며, 처리 변화에 대한 민감도가 높음을 시사한다.
- 포로의 딜레마 게임에서 랩의 반응 탄력성은 Prolific과 MTurk보다 뚜렷하게 높았으며, 두 온라인 플랫폼은 배신 유혹 수준 변화에 거의 탄력성이 없는 것으로 나타났다.
- 처리 효과 크기를 증가시킬 경우, Prolific은 낮은 비용과 낮은 소음 덕분에 탄력성이 낮더라도 랩을 추론 능력에서 능가할 수 있다.
- MTurk의 뚜렷한 소음 수준은 낮은 비용에도 불구하고 거짓 경제적 이득이며, 더 철저한 플랫폼인 Prolific이 신뢰할 수 있는 추론을 위해 더 바람직하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.