Skip to main content
QUICK REVIEW

[论文解读] Topic Model Based Multi-Label Classification from the Crowd

Divya Padmanabhan, Satyanath Bhat|arXiv (Cornell University)|Apr 4, 2016
Text and Document Classification Technologies参考文献 1被引用 3
一句话总结

本文提出 ML-PA-LDA,一种用于多标签分类的新颖主题模型,通过显式建模标签的存在与缺失来捕捉标签相关性。该模型进一步扩展为 ML-PA-LDA-C,可处理嘈杂且异质的众包标注者标签,并联合学习标注者质量,在真实数据集上即使训练数据极少也表现出优越性能。

ABSTRACT

Multi-label classification is a common supervised machine learning problem where each instance is associated with multiple classes. The key challenge in this problem is learning the correlations between the classes. An additional challenge arises when the labels of the training instances are provided by noisy, heterogeneous crowdworkers with unknown qualities. We first assume labels from a perfect source and propose a novel topic model where the present as well as the absent classes generate the latent topics and hence the words. We non-trivially extend our topic model to the scenario where the labels are provided by noisy crowdworkers. Extensive experimentation on real world datasets reveals the superior performance of the proposed model. The proposed model learns the qualities of the annotators as well, even with minimal training data.

研究动机与目标

  • 为解决多标签分类中标签相关性建模的挑战,特别是缺失标签的有用信息。
  • 开发一种生成式主题模型,同时纳入类别的存在与缺失,以提升分类性能。
  • 将模型扩展以处理噪声大、异质性高的众包标注标签,其中标注者质量未知且需被学习。
  • 实现在部分标注场景下的有效学习,即标注者无需为文档标注所有类别。
  • 在不同规模的训练数据和不同标注者质量下,验证模型的鲁棒性与准确性。

提出的方法

  • 提出 ML-PA-LDA,一种主题模型,其中存在与缺失的标签均参与主题生成,相比先前方法更有效地建模标签相关性。
  • 引入非共轭变分期望最大化算法,以在存在嘈杂众包标签的情况下推断潜在主题、标签分配及标注者质量。
  • 将每篇文档建模为多个主题的混合,每个主题关联一个词项上的多项分布和一个标签存在/缺失的多项分布。
  • 通过学习反映标注者可靠性的个体标注者质量参数(ρ),建立标注者特定的错误模型。
  • 采用概率框架,通过变分推断推断标签分配,实现主题、标签和标注者质量的端到端学习。
  • 支持部分标注:标注者无需为文档标注所有类别,使模型在真实众包场景中更具实用性。

实验结果

研究问题

  • RQ1与仅考虑标签存在的模型相比,建模标签缺失是否能提升多标签分类性能?
  • RQ2主题模型能否从嘈杂的众包标签中联合学习潜在主题、标签分配和标注者质量?
  • RQ3当训练数据有限且标注者质量异质时,模型表现如何?
  • RQ4在存在对抗性或低质量标注者的情况下,模型是否仍保持鲁棒性?
  • RQ5增加主题数量或训练数据量在多大程度上提升性能,尤其是在数据稀缺条件下?

主要发现

  • 在使用 100% 训练数据的 Reuters 数据集上,ML-PA-LDA-C 的平均准确率达到 0.942,微 F1 达到 0.669,优于 SLDA,尽管仅使用了噪声众包标签。
  • 当使用 100% 训练数据时,模型对标注者质量的估计平均 Ann RMSE 为 0.009,显示出高质量的估计准确性。
  • 性能随训练数据增多和主题数量增加而提升;在数据稀缺时,符合奥卡姆剃刀原则;而在数据充足时,增加主题数有助于性能提升。
  • 即使仅使用 10% 的训练数据,ML-PA-LDA-C 仍达到 92.7% 的准确率和 61.6% 的微 F1,表明在极少监督下仍具强大性能。
  • 在对抗性设置下(10% 的标注者 ρ < 0.5),模型保持高表现,平均准确率达 95.5%,Ann RMSE 为 0.002,显示出强鲁棒性。
  • 在仅使用噪声标签训练时,模型性能始终优于 SLDA,且与非众包版本(ML-PA-LDA)相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。