[论文解读] CrowdHub: Extending crowdsourcing platforms for the controlled evaluation of tasks designs
CrowdHub 是一种工具,可扩展 Figure Eight 和 Toloka 等众包平台,通过管理工作者资格、人口统计特征和执行时间,实现对任务设计的受控、系统性评估。它通过自动化工作流、资格控制和时间采样,减少实验偏差——在非受控环境中,潜在数据损失高达 38%——从而提高研究人员的数据效用和可靠性。
We present CrowdHub, a tool for running systematic evaluations of task designs on top of crowdsourcing platforms. The goal is to support the evaluation process, avoiding potential experimental biases that, according to our empirical studies, can amount to 38% loss in the utility of the collected dataset in uncontrolled settings. Using CrowdHub, researchers can map their experimental design and automate the complex process of managing task execution over time while controlling for returning workers and crowd demographics, thus reducing bias, increasing utility of collected data, and making more efficient use of a limited pool of subjects.
研究动机与目标
- 解决由重复工作者、条件交叉、时区差异和人口统计失衡引起的众包任务设计评估中的实验偏差。
- 通过受控的工作者群体和执行调度,支持对多种任务设计进行系统化、可重复的比较。
- 减少因未受控评估导致的数据效用损失,此类损失可能高达 38%,原因在于工作者行为和平台限制带来的偏差。
- 为研究人员提供一种工具,可自动化部署和管理在现有众包平台上进行的复杂多配置任务实验。
- 支持对被试间和被试内实验设计的精确控制,包括对工作者访问权限和任务顺序的控制。
提出的方法
- CrowdHub 通过其公开 API 和 JavaScript 扩展,与主要众包平台(如 Figure Eight、Toloka)集成,实现对工作者的身份识别和指标收集。
- 它使用工作流编辑器定义任务序列、数据流和实验组分配,支持串行和并行执行。
- 实施资格控制策略,防止条件交叉并管理返回工作者,确保实验组的纯净性。
- 人口管理功能允许请求者为每个工作者子群体(如国家、信任等级)分配配额,避免特定人口统计特征的主导。
- 时间采样通过在多个时间窗口内安排任务执行,减少因一天中时间或平台活动变化带来的混杂影响。
- 系统解析实验工作流,并自动在目标平台上部署相关数据单元、说明和黄金标准的独立任务。
实验结果
研究问题
- RQ1工作者重复参与在多大程度上会引入任务设计评估中的偏差,以及它如何影响决策时间和准确性?
- RQ2当工作者经历多个任务条件(即条件交叉)时,其表现和对任务支持功能的信任度会受到何种影响?
- RQ3一天中不同时段和时区差异在多大程度上影响同一任务条件在多次运行中的表现一致性?
- RQ4工作者群体中的人口统计失衡(如国家主导)在多大程度上会损害任务设计比较的有效性?
- RQ5与未受控的众包评估相比,受控实验框架在多大程度上能减少数据效用损失?
主要发现
- 在未受控评估中,重复工作者占数据集的 38%,其决策时间更短但准确率无显著提升,表明存在学习效应但无性能增益。
- 经历条件交叉的工作者(尤其是从支持较差的条件转到支持较好的条件)表现出决策时间增加,可能因对支持功能信任度下降而产生认知偏差。
- 同一条件在多次运行中的表现变异性(如决策时间从 14 秒到 24 秒不等)表明,在未受控环境中,一天中时间与平台活动水平会混淆比较结果。
- 贡献最多的前几个国家(委内瑞拉、埃及、乌克兰)提供了 48.1% 的总判断,表明存在强烈的人口统计失衡,可能在未受控实验中扭曲结果。
- 研究表明,未受控评估可能导致高达 38% 的数据集效用损失,凸显了受控框架的必要性。
- CrowdHub 通过资格控制、人口配额和时间采样成功缓解了这些偏差,实现了更可靠、高效的任务设计评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。