[论文解读] Image Classification and Retrieval from User-Supplied Tags
本文提出了一种鲁棒分类框架,直接从Flickr平台用户提供的未经过滤的标签中进行学习,采用基于随机EM算法的鲁棒逻辑回归来处理标签噪声,并通过极少的人工标注进行校准。结果表明,仅使用免费获取的用户标签进行训练,性能可与昂贵的人工标注相媲美;经校准后,性能甚至超越人工标注,而标注成本仅为1/200。
This paper proposes direct learning of image classification from user-supplied tags, without filtering. Each tag is supplied by the user who shared the image online. Enormous numbers of these tags are freely available online, and they give insight about the image categories important to users and to image classification. Our approach is complementary to the conventional approach of manual annotation, which is extremely costly. We analyze of the Flickr 100 Million Image dataset, making several useful observations about the statistics of these tags. We introduce a large-scale robust classification algorithm, in order to handle the inherent noise in these tags, and a calibration procedure to better predict objective annotations. We show that freely available, user-supplied tags can obtain similar or superior results to large databases of costly manual annotations.
研究动机与目标
- 解决人工精心筛选的图像标注数据集成本高昂且可扩展性有限的问题。
- 探究未经过滤的在线照片分享平台用户提供的标签是否可作为昂贵人工标注的可行替代方案。
- 开发一种鲁棒的学习方法,以应对用户提供的标签中固有的噪声、不一致性和可变性。
- 利用少量人工标注数据对模型预测进行校准,以提升在客观图像标注上的性能。
- 在图像分类、标签预测和多标签图像检索任务上评估该方法。
提出的方法
- 提出一种鲁棒逻辑回归(RLR)模型,联合学习分类器权重与特定标签的异常值概率,以处理随机遗漏的正样本标签。
- 采用随机期望最大化(EM)算法,使RLR可扩展至大规模数据集(如Flickr 100 Million图像数据集)。
- 引入一种校准程序,利用少量人工标注子集(如NUS-WIDE)调整模型输出概率,使其与客观标注对齐。
- 使用F100M数据集进行用户标签的预训练,使用NUS-WIDE进行校准和客观标签的评估。
- 将校准后的模型应用于标签预测、客观标注预测以及基于多标签查询的图像检索。
- 采用平均标签的精确率、召回率与F1分数评估性能,检索任务使用归一化精确率在前5名的指标。
实验结果
研究问题
- RQ1是否可以有效利用照片分享平台用户提供的标签,而无需人工筛选,实现大规模图像分类?
- RQ2基于随机EM算法的鲁棒逻辑回归在存在噪声和未经过滤标签的情况下,如何提升分类性能?
- RQ3当与大规模用户标签预训练结合时,少量人工标注是否能显著提升模型性能?
- RQ4与传统人工标注方法相比,该方法在准确率和标注成本效率方面是否更具优势?
- RQ5与标准逻辑回归相比,该方法在多标签图像检索任务中的有效性如何?
主要发现
- 仅使用Flickr 100 Million(F100M)数据集中的用户标签进行训练,性能与在较小规模人工标注数据集(如NUS-WIDE)上训练的模型相当。
- 使用仅1/200的人工标注量对F100M训练模型进行校准,其在客观标注预测上的性能优于在完整人工数据集上训练的模型。
- 鲁棒逻辑回归(RLR)在标签预测和图像检索任务中均持续优于标准逻辑回归(LR),尤其在较长的多标签查询中表现更优。
- 校准后的RLR模型在NUS-WIDE数据集上的标签预测任务中达到71.9的平均F1分数,优于该基准上的最先进方法。
- 在多标签图像检索任务中,校准后的RLR模型在双标签查询中达到11.0的归一化精确率在前5名,显著优于标准LR及其他基线方法。
- 即使在没有人工标注的情况下,该方法也能通过利用用户标签的规模与多样性,实现对数千个标签的高质量图像分类与检索。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。