Skip to main content
QUICK REVIEW

[论文解读] GPM: A Generic Probabilistic Model to Recover Annotator's Behavior and Ground Truth Labeling

Jing Li, Suiyi Ling|arXiv (Cornell University)|Mar 1, 2020
Mobile Crowdsensing and Crowdsourcing参考文献 28被引用 4
一句话总结

该论文提出GPM,一种通用的概率模型,通过将真实标签建模为类别分布而非单一值,实现对真实标签和标注者行为的恢复。该模型利用隐变量和基于EM的MLE方法检测不可靠标注者(如随机、重复或恶意行为),在离散、连续和有序标注任务中均展现出优于最先进模型的准确性和鲁棒性。

ABSTRACT

In the big data era, data labeling can be obtained through crowdsourcing. Nevertheless, the obtained labels are generally noisy, unreliable or even adversarial. In this paper, we propose a probabilistic graphical annotation model to infer the underlying ground truth and annotator's behavior. To accommodate both discrete and continuous application scenarios (e.g., classifying scenes vs. rating videos on a Likert scale), the underlying ground truth is considered following a distribution rather than a single value. In this way, the reliable but potentially divergent opinions from "good" annotators can be recovered. The proposed model is able to identify whether an annotator has worked diligently towards the task during the labeling procedure, which could be used for further selection of qualified annotators. Our model has been tested on both simulated data and real-world data, where it always shows superior performance than the other state-of-the-art models in terms of accuracy and robustness.

研究动机与目标

  • 解决众包数据标注中噪声、不可靠或对抗性标签的挑战。
  • 克服现有模型假设单一真实标签值且无法建模多样化标注者行为的局限性。
  • 通过将真实标签建模为类别分布,实现在离散、连续和有序标注任务中的鲁棒真实标签推断。
  • 在保留可靠标注者有效分歧意见的同时,检测并建模不同类型的不可靠标注者行为(如随机、重复、恶意)。
  • 提供一种通用、可扩展的框架,适用于真实世界和模拟数据,提升准确性和鲁棒性。

提出的方法

  • 将真实标签建模为类别分布而非单一值,以捕捉共识及可靠的分歧意见。
  • 引入一个隐变量,表示标注者在可靠与不可靠行为之间切换的概率。
  • 使用基于期望最大化(EM)算法的最大似然估计(MLE)联合估计真实标签分布与标注者可靠性。
  • 通过在标签上使用均匀分布来建模不可靠行为(如随机、重复、反转),实现通过参数估计进行检测。
  • 通过真实标签分布的熵来估计任务难度,从而支持主动标注策略。
  • 在模拟和真实世界数据集(如面部情绪、MovieLens、Crowd Flower)上应用该模型以进行验证。

实验结果

研究问题

  • RQ1通过将真实标签建模为分布而非单一值,通用概率模型是否能有效在多样化标注任务(离散、连续、有序)中恢复真实标签?
  • RQ2该模型在真实众包环境中,能否有效检测并区分不同类型的不可靠标注者行为(如随机、重复、恶意)?
  • RQ3与将所有分歧视为噪声的模型相比,建模可靠分歧意见在多大程度上提升了真实标签恢复的性能?
  • RQ4在真实世界数据集上,该模型在准确性和鲁棒性方面与最先进方法(如D&S、GLAD、Ord-bin)相比表现如何?
  • RQ5通过熵估计的标注者可靠性与任务难度是否可用于下游应用,如主动标注或标注者选择?

主要发现

  • 在面部情绪数据集上,所提模型的分类准确率(F1)达到0.5431,优于D&S(0.5356)和GLAD(0.5155),并匹配表现最佳的Ord-bin模型。
  • 在MovieLens 20M数据集上,所提模型的PLCC为0.8620,SROCC为0.8420,RMSE为0.2228,显著优于D&S(PLCC: 0.4073,RMSE: 1.2287)和GLAD(RMSE: 0.6361)。
  • 在Crowd Dog数据集上,模型检测到的垃圾信息比率(spamminess ratio)为0%,表明数据可靠性极高,并在多个数据集上展现出优于D&S的鲁棒性。
  • 在连续和有序标注任务中,模型性能始终更优,尤其相较于仅处理离散任务的D&S和GLAD模型。
  • 估计的真实标签分布捕捉到了可靠的分歧意见,且通过熵有效推断出任务难度,为潜在的主动学习应用提供了支持。
  • 模型对不规则标注者行为表现出强鲁棒性,垃圾信息比率极低(MovieLens为1%,Crowd Dog为0%),证实其具备识别并过滤低质量贡献的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。