[论文解读] Learning Visual Classifiers using Human-centric Annotations.
本文提出一种方法,通过建模并解耦人类报告偏差,从嘈杂的、以人类为中心的标注(如标签和描述)中学习视觉对齐的图像分类器。通过利用不一致、主观标注中的结构化噪声,该方法显著提升了分类和描述生成性能,在 MS COCO 和 Yahoo Flickr 100M 等部分基准上将最先进结果提升了一倍。
When human annotators are given a choice about what to label in an image, they apply their own subjective judgments on what to ignore and what to mention. We refer to these noisy human-centric annotations as exhibiting human reporting bias. Examples of such annotations include tags and keywords found on photo sharing sites, or in datasets containing captions. In this paper, we use these noisy annotations for learning visually correct classifiers. Such annotations do not use consistent vocabulary, and miss a significant amount of the information present in an image; however, we demonstrate that the noise in these annotations exhibits structure and can be modeled. We propose an algorithm to decouple the human reporting bias from the correct visually grounded labels. Our results are highly interpretable for reporting what's in the image versus what's worth saying. We demonstrate the algorithm's efficacy along a variety of metrics and datasets, including MS COCO and Yahoo Flickr 100M. We show significant improvements over traditional algorithms for both classification and captioning, doubling the performance of existing methods in some cases.
研究动机与目标
- 解决从现实世界数据集中常见的不一致、主观的人类标注中学习准确视觉分类器的挑战。
- 对以人类为中心的标注(如标签和描述)中的结构化噪声进行建模,这些噪声反映的是人类报告偏差而非视觉真实情况。
- 将人类报告偏差与实际视觉内容解耦,以生成可解释的、视觉对齐的预测结果。
- 通过从嘈杂标注中进行弱监督学习,提升图像分类和图像描述生成任务的性能。
- 在真实标注条件下,证明该方法在 MS COCO 和 Yahoo Flickr 100M 等多样化数据集上的有效性。
提出的方法
- 将人类报告偏差建模为人类生成标注(如标签和描述)中的结构化噪声过程。
- 提出一种概率框架,以分离标注者的潜在视觉内容与主观报告行为。
- 采用联合推理机制,在考虑标注中词汇不一致和信息缺失的前提下,估计视觉对齐的标签。
- 通过学习标注过程的偏差感知表征,利用大规模、嘈杂数据集中的弱监督信号。
- 使用可微分目标端到端训练模型,同时优化视觉准确性和与人类报告模式的一致性。
- 通过区分‘图像中实际存在什么’与‘值得提及的内容’,实现可解释的预测。
实验结果
研究问题
- RQ1能否有效建模以人类为中心的标注中的结构化噪声,以提升视觉分类器性能?
- RQ2在弱监督学习中,人类报告偏差在多大程度上可与真实视觉内容解耦?
- RQ3与传统方法相比,该方法在现实世界数据集上的分类和描述生成性能提升程度如何?
- RQ4该方法是否能在标注质量与词汇多样性各异的数据集(如 MS COCO 和 Yahoo Flickr 100M)上实现泛化?
- RQ5该模型能否生成可解释的输出,以区分视觉内容与主观标注选择?
主要发现
- 所提方法显著提升了图像分类和描述生成性能,在某些基准数据集上,性能达到现有方法的两倍。
- 通过有效建模人类标注中的结构化噪声,该模型在 MS COCO 和 Yahoo Flickr 100M 上均达到最先进水平。
- 该方法通过区分视觉对齐内容与主观报告偏差,展现出高度可解释性。
- 性能提升在多个评估指标上保持一致,表明对标注变异具有鲁棒性。
- 该方法在无需标注或真实标签的情况下,有效处理了标注中的词汇不一致和信息缺失问题。
- 该算法在多样化数据集上泛化良好,即使在高度嘈杂的真实人类标注下也表现有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。