[论文解读] CLAMShell: Speeding up Crowds for Low-latency Data Labeling
CLAMShell 是一种众包系统,通过减少慢速响应者、维护工作池以及采用混合主动-被动学习方法,降低数据标注的延迟和方差,在实际的 Amazon Mechanical Turk 工作人员上,实现标注获取速度最高提升 8 倍,方差降低 151 倍。
Data labeling is a necessary but often slow process that impedes the development of interactive systems for modern data analysis. Despite rising demand for manual data labeling, there is a surprising lack of work addressing its high and unpredictable latency. In this paper, we introduce CLAMShell, a system that speeds up crowds in order to achieve consistently low-latency data labeling. We offer a taxonomy of the sources of labeling latency and study several large crowd-sourced labeling deployments to understand their empirical latency profiles. Driven by these insights, we comprehensively tackle each source of latency, both by developing novel techniques such as straggler mitigation and pool maintenance and by optimizing existing methods such as crowd retainer pools and active learning. We evaluate CLAMShell in simulation and on live workers on Amazon's Mechanical Turk, demonstrating that our techniques can provide an order of magnitude speedup and variance reduction over existing crowdsourced labeling strategies.
研究动机与目标
- 为解决众包数据标注中高且不可预测的延迟问题,该问题阻碍了交互式数据分析系统的应用。
- 识别并系统性地减少在单任务、批量处理和端到端标注阶段的主要延迟来源。
- 开发实用且兼容的技术,提升标注速度与可预测性,同时不牺牲质量。
- 实现实时将人工标注数据集成到交互式数据分析与清洗流水线中。
- 在真实工作人员上评估系统,展示在实际部署中显著的速度提升与方差降低。
提出的方法
- 慢速响应者缓解机制通过使用冗余标注者来完成批次中延迟的任务,将批次完成时间的方差从数分钟降低到不足一秒。
- 工作池维护机制采用基于阈值的驱逐策略,通过随时间替换速度慢或质量差的工作人员,持续维持高速且高质量的工作池。
- 混合学习动态结合主动学习与被动学习:当工作人员供给超过主动学习批次大小时,利用被动学习的并行性;在较简单的任务上则更倾向于使用主动学习。
- 该系统与标准的质量控制机制集成,包括基于冗余的投票机制和工作人员质量估计,确保标注的可靠性。
- CLAMShell 通过仿真和在 Amazon Mechanical Turk 上的实际部署进行评估,使用真实数据集如 MNIST 和 CIFAR-10。
- 端到端评估将 CLAMShell 与两个基线进行比较:Base-NR(无优化)和 Base-R(保留池与主动学习),测量模型准确率与实际运行时间。
实验结果
研究问题
- RQ1众包数据标注中的主要延迟来源是什么?这些延迟在单任务、批量处理和端到端阶段如何变化?
- RQ2慢速响应者缓解是否能显著降低批量标注完成时间的方差?
- RQ3工作池维护在长时间内是否能有效维持一个高速且高质量的工作人员池?
- RQ4混合学习策略在标注速度与模型准确率方面是否优于纯主动学习或纯被动学习?
- RQ5在真实世界、实际工作人员部署中,CLAMShell 能在多大程度上减少端到端标注延迟与方差?
主要发现
- 与未优化的众包部署相比,CLAMShell 将标注获取时间最高提升 8 倍。
- 该系统将标注延迟方差降低 151 倍,降至仅 3.1 秒(而 Base-NR 为 475 秒)。
- 在 CIFAR-10 上,混合学习平均比纯主动学习快 1.2 倍,比纯被动学习快 1.6 倍,即可在 85% 准确率下更快训练出模型。
- 在 MNIST 上,混合学习在达到 70% 准确率时,比主动学习快 1.7 倍,比被动学习快 1.2 倍。
- 在 MNIST 上实现 75% 模型准确率时,CLAMShell 所需时间仅为 Base-NR 的 4–5 倍。
- 与 Base-NR 相比,CLAMShell 将标注吞吐量提升 7.24 倍,展示了在真实环境中的强大可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。