Skip to main content
QUICK REVIEW

[论文解读] Recruiting Software Engineers on Prolific

Daniel Russo|arXiv (Cornell University)|Mar 28, 2022
Mobile Crowdsensing and Crowdsourcing被引用 6
一句话总结

本文提出了一套实用的框架,通过 Prolific 众源平台招募软件工程师,以克服抽样偏差并确保实证软件工程研究中的统计功效。通过结合预筛选标准、试点验证和注意力检查,研究人员能够高效获取具有代表性且高质量的样本,同时通过功效分析指导最优样本量,以最小化第一类和第二类错误。

ABSTRACT

Recruiting participants for software engineering research has been a primary concern of the human factors community. This is particularly true for quantitative investigations that require a minimum sample size not to be statistically underpowered. Traditional data collection techniques, such as mailing lists, are highly doubtful due to self-selection biases. The introduction of crowdsourcing platforms allows researchers to select informants with the exact requirements foreseen by the study design, gather data in a concise time frame, compensate their work with fair hourly pay, and most importantly, have a high degree of control over the entire data collection process. This experience report discusses our experience conducting sample studies using Prolific, an academic crowdsourcing platform. Topics discussed are the type of studies, selection processes, and power computation.

研究动机与目标

  • 解决在实证软件工程研究中招募具有代表性的软件工程师的挑战,特别是避免传统方法中常见的自我选择偏差。
  • 克服便利抽样和使用学生作为代理的局限性,这些做法会损害研究结果的可推广性。
  • 通过严格的功效分析确定适当的样本量,确保样本研究具备统计功效。
  • 在进行多重比较时,通过调整显著性水平来控制第一类错误的膨胀,避免过度保守的校正(如 Bonferroni 校正)。
  • 在学术众源平台(如 Prolific)上建立可复现、方法学严谨的参与者招募与数据收集流程。

提出的方法

  • 使用 Prolific 平台招募符合特定人口统计学和行为标准的参与者,包括编程技能、每日技术使用情况以及高通过率(≥95%)。
  • 实施仅限桌面访问的调查策略,以保持参与者专注,减少数据收集过程中的干扰。
  • 进行限时(1 分钟)的试点研究,包含三个选择题,以验证预筛选候选人的软件工程能力。
  • 在每份调查中应用 2–3 个注意力检查,以筛选出注意力不集中的受访者,提升数据质量。
  • 使用 G*Power 进行事前或敏感性分析,基于期望的统计功效和效应量确定最小所需样本量。
  • 在进行多重假设检验时,将显著性水平调整为 p < 0.003,以控制第一类错误的膨胀,避免如 Bonferroni 校正等过度保守的调整。

实验结果

研究问题

  • RQ1研究人员如何在 Prolific 上有效招募软件工程师,同时最小化自我选择偏差并确保参与者质量?
  • RQ2可以使用哪些预筛选和验证技术来确认招募的参与者确实是真正的软件工程师?
  • RQ3在使用众源平台进行涉及软件工程专业人士的样本研究时,如何确保统计功效?
  • RQ4在实证软件工程研究中进行多重假设检验时,哪些策略能有效控制第一类错误率?
  • RQ5Prolific 在多大程度上可以作为传统招募方法的可行替代方案,尤其是在代表性与数据质量方面?

主要发现

  • 截至 2022 年 1 月,Prolific 可为研究人员提供超过 15,500 名经过预筛选的潜在参与者,具备相关技术背景,显著提升了招募效率。
  • 使用包含三个选择题的 1 分钟试点研究,能有效筛选出不合格候选人,确保仅有表现出软件工程能力的人员进入后续流程。
  • 每份调查中设置 2–3 个注意力检查,能显著提升数据质量,通过识别并排除注意力不集中的受访者来实现。
  • 使用 G*Power 进行功效分析,可帮助研究人员确定确保充分统计功效的最小样本量,从而降低第二类错误的风险。
  • 在测试超过 50 个变量时,将显著性阈值调整为 p < 0.003,能有效控制第一类错误的膨胀,且不会像 Bonferroni 校正那样过度保守。
  • 所提出的框架化方法论支持理论驱动、功效充足的样本研究,从而增强实证软件工程研究的可推广性和有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。