Skip to main content
QUICK REVIEW

[论文解读] An Active Learning Approach for Jointly Estimating Worker Performance and Annotation Reliability with Crowdsourced Data

Liyue Zhao, Yu Zhang|arXiv (Cornell University)|Jan 16, 2014
Mobile Crowdsensing and Crowdsourcing参考文献 12被引用 13
一句话总结

该论文提出了一种主动学习框架,通过贝叶斯网络联合估计工作者表现和任务难度,以指导标签选择,在减少标注成本的同时提高在噪声众包数据下的模型准确率。通过优先选择不确定性高的任务和可靠的工作者,该方法仅需随机或遍历策略所需标签的14%即可达到75%的训练准确率。

ABSTRACT

Crowdsourcing platforms offer a practical solution to the problem of affordably annotating large datasets for training supervised classifiers. Unfortunately, poor worker performance frequently threatens to compromise annotation reliability, and requesting multiple labels for every instance can lead to large cost increases without guaranteeing good results. Minimizing the required training samples using an active learning selection procedure reduces the labeling requirement but can jeopardize classifier training by focusing on erroneous annotations. This paper presents an active learning approach in which worker performance, task difficulty, and annotation reliability are jointly estimated and used to compute the risk function guiding the sample selection procedure. We demonstrate that the proposed approach, which employs active learning with Bayesian networks, significantly improves training accuracy and correctly ranks the expertise of unknown labelers in the presence of annotation noise.

研究动机与目标

  • 解决众包数据集中高标注成本与标注噪声的挑战。
  • 在存在不可靠工作者标注的情况下提升主动学习的性能。
  • 联合估计工作者表现与任务难度,以实现更准确的标签选择。
  • 在真实众包环境中,减少训练高准确率分类器所需的标签数量。
  • 即使在低质量工作者造成的标签噪声下,也能实现鲁棒的模型训练。

提出的方法

  • 该方法采用生成式概率模型(GLAD)结合期望最大化(EM)算法,联合估计工作者专业度与任务难度。
  • 提出一种基于风险的采样准则,选择预期能最大程度降低标注风险的工作者-任务对。
  • 使用基于已有标注训练的贝叶斯网络推断出的后验概率计算风险函数。
  • 主动学习基于最高预期风险降低值选择样本,聚焦于不确定性高的任务与可靠的工作者。
  • 在每次获取新标签后,动态重新估计工作者可靠性与任务难度。
  • 基于估计的专业度进行加权投票,以提升标签聚合与模型训练效果。

实验结果

研究问题

  • RQ1通过联合建模工作者表现与任务难度,能否使主动学习在众包数据的标签噪声下更具鲁棒性?
  • RQ2如何设计采样策略,在噪声众包环境中最小化标注成本并最大化模型准确率?
  • RQ3与基线方法相比,该方法在工作者专业度排序上的提升程度如何?
  • RQ4联合估计工作者可靠性与任务难度是否能加快模型训练的收敛速度?
  • RQ5该方法能否在极小标注预算下有效过滤低质量工作者,同时保持高准确率?

主要发现

  • 所提方法在仅请求总标签数14.0%(共500个标签,总计3572个)后即达到75%的训练准确率,优于随机策略与遍历策略,后者需28%(1000个标签)才能达到相同准确率。
  • 该方法收敛速度优于基线策略,在保持高模型性能的同时,将标注成本降低了约50%。
  • epsilon-greedy工作者选择策略的性能与最佳工作者策略相当,仅使用5.6%的标签(200个标签)即达到76%的准确率。
  • 加权选择策略在真实数据中表现出高度不稳定性,表明其在存在噪声标注的场景下实际部署存在局限性。
  • 该方法能有效将工作者划分为高、低表现类别,实现对低质量标注者的高效过滤,且不牺牲模型准确率。
  • 该方法在模拟与真实数据集(包括通过Mechanical Turk标注的人脸图像数据集)上均表现出良好的可扩展性与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。