[论文解读] Attention-Aware Noisy Label Learning for Image Classification
本文提出 A²NL,一种用于图像分类的注意力感知噪声标签学习框架,采用具有多个噪声特异性单元的噪声-注意力模型,以捕捉跨类别和图像的多样化标签噪声分布。该方法进一步采用递归学习策略,从先前迭代中蒸馏知识,显著提升了在合成数据集和真实世界噪声数据集上的鲁棒性,相较于强基线模型,错误率最高降低4%,且无需使用干净数据。
Deep convolutional neural networks (CNNs) learned on large-scale labeled samples have achieved remarkable progress in computer vision, such as image/video classification. The cheapest way to obtain a large body of labeled visual data is to crawl from websites with user-supplied labels, such as Flickr. However, these samples often tend to contain incorrect labels (i.e. noisy labels), which will significantly degrade the network performance. In this paper, the attention-aware noisy label learning approach ($A^2NL$) is proposed to improve the discriminative capability of the network trained on datasets with potential label noise. Specifically, a Noise-Attention model, which contains multiple noise-specific units, is designed to better capture noisy information. Each unit is expected to learn a specific noisy distribution for a subset of images so that different disturbances are more precisely modeled. Furthermore, a recursive learning process is introduced to strengthen the learning ability of the attention network by taking advantage of the learned high-level knowledge. To fully evaluate the proposed method, we conduct experiments from two aspects: manually flipped label noise on large-scale image classification datasets, including CIFAR-10, SVHN; and real-world label noise on an online crawled clothing dataset with multiple attributes. The superior results over state-of-the-art methods validate the effectiveness of our proposed approach.
研究动机与目标
- 解决因网络爬取图像数据集中存在噪声标签而导致深度学习性能下降的问题。
- 对不同类别和单个图像中的异质标签噪声分布进行建模,而非假设每类具有统一的噪声。
- 在不增加模型参数量的前提下,提升噪声标签鲁棒性网络的学习能力。
- 开发一种递归训练策略,利用先前迭代的软预测结果来提升泛化能力。
- 在合成标签噪声和来自在线来源的真实世界噪声数据上验证该方法。
提出的方法
- 噪声-注意力(NA)模型由多个噪声特异性单元组成,每个单元学习一组图像中特定的噪声标签分布。
- 每个噪声特异性单元被训练以建模特定类型的标签混淆,例如将狗误分类为猫或马。
- 递归学习策略将真实标签与先前训练的注意力网络生成的软预测结果结合,用于监督当前迭代。
- 递归过程通过利用先前迭代的高层知识,迭代式地优化网络,从而在不增加参数的情况下提升特征表示能力。
- 该框架即插即用,兼容任意标准 CNN 架构,可应用于合成和真实世界噪声数据集。
- 该方法采用端到端训练,使用交叉熵损失,结合真实标签与前一迭代的软输出进行联合监督。
实验结果
研究问题
- RQ1为每个类别建模多个独立的噪声标签分布,是否能提升图像分类对标签噪声的鲁棒性?
- RQ2通过蒸馏先前迭代的软预测结果所构建的递归学习策略,对噪声数据上的模型泛化能力有何影响?
- RQ3所提出的注意力感知框架是否在合成与真实世界噪声标签基准上均优于现有方法?
- RQ4噪声-注意力模型在多大程度上能捕捉类别内部的标签噪声差异,例如相似类别间不同的误分类模式?
- RQ5该方法是否能在不依赖额外干净数据进行预训练或微调的情况下,实现优异性能?
主要发现
- 所提出的 A²NL 框架在具有多个属性的真实世界服装数据集上,相较于基线模型,错误率降低了 4%,使用 M=6 个噪声特异性单元。
- 仅经过一次迭代,递归学习策略即使测试错误率降低超过 1%,在 5 次迭代后进一步提升,之后增益趋于平缓。
- 在递归微调前,该方法在错误率上比 Bottom-up 模型 [20] 低 2%;在递归学习后,错误率降低达 4%,且仅使用噪声训练数据。
- 即使无法获取干净数据,采用递归学习的 A²NL 模型在性能上仍可匹配或超越需要 2,000 张人工净化测试图像进行预训练的 Distillation [15] 方法。
- 消融实验确认,增加噪声特异性单元数量可提升性能,直至达到饱和点,其中 M=6 为服装数据集的最优选择。
- 该方法在合成标签噪声(CIFAR-10、SVHN)和真实世界噪声数据上均表现出良好泛化能力,证明了对多样化噪声模式的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。