Skip to main content
QUICK REVIEW

[论文解读] Learning from Noisy Web Data with Category-level Supervision

Li Niu, Qingtao Tang|arXiv (Cornell University)|Mar 10, 2018
Domain Adaptation and Few-Shot Learning参考文献 35被引用 5
一句话总结

该论文提出WSCI方法,通过联合训练变分自编码器(VAE)和分类网络,并利用类别级监督(如词向量、属性或视觉编码)来缓解网络爬取图像中的标签噪声,从而提升弱监督学习性能。该方法通过语义嵌入同时增强重建与分类能力,在SUN、AwA2和CUB三个基准数据集上均取得当前最优性能,且在不同噪声水平下表现均优于现有基线方法。

ABSTRACT

As tons of photos are being uploaded to public websites (e.g., Flickr, Bing, and Google) every day, learning from web data has become an increasingly popular research direction because of freely available web resources, which is also referred to as webly supervised learning. Nevertheless, the performance gap between webly supervised learning and traditional supervised learning is still very large, owning to the label noise of web data. To be exact, the labels of images crawled from public websites are very noisy and often inaccurate. Some existing works tend to facilitate learning from web data with the aid of extra information, such as augmenting or purifying web data by virtue of instance-level supervision, which is usually in demand of heavy manual annotation. Instead, we propose to tackle the label noise by leveraging more accessible category-level supervision. In particular, we build our method upon variational autoencoder (VAE), in which the classification network is attached on the hidden layer of VAE in a way that the classification network and VAE can jointly leverage the category-level hybrid semantic information. The effectiveness of our proposed method is clearly demonstrated by extensive experiments on three benchmark datasets.

研究动机与目标

  • 为解决由于网络数据中存在标签噪声而导致弱监督学习与传统监督学习之间性能差距持续存在的问题。
  • 通过利用更易获取的类别级监督(如词向量、属性或视觉编码)来减少对昂贵实例级监督的依赖。
  • 构建一种联合学习框架,使VAE与分类网络通过共享类别级监督的语义信息相互提升鲁棒性。
  • 在多个数据集和不同噪声水平下,持续证明该方法优于现有基线方法。

提出的方法

  • 该方法基于一个变分自编码器(VAE),并在其潜在层上附加一个分类网络,形成共享编码器与VAE结构。
  • 分类网络利用类别级语义信息(如词向量、属性或视觉编码)生成预测得分,为潜在变量赋予语义意义。
  • VAE使用重建概率密度作为异常值检测指标,对通过该指标识别出的非异常值样本赋予更高的损失权重。
  • 分类网络将判别性信息注入VAE的潜在空间,提升嵌入的语义质量,从而增强异常值检测能力。
  • 提出一种新型视觉编码方法:通过平均每个类别内的视觉特征得到初始编码,并进一步优化以提升鲁棒性与判别性。
  • 模型采用端到端联合优化训练,其中VAE通过异常值加权提升分类器的鲁棒性,而分类器则增强VAE的语义表征能力。

实验结果

研究问题

  • RQ1类别级监督能否提升在噪声网络数据上训练的分类器的鲁棒性?
  • RQ2VAE与分类网络之间的联合学习相比孤立训练,能否显著提升性能?
  • RQ3当缺乏属性信息时,基于网络图像提取的视觉编码是否仍能提升性能?
  • RQ4在标签噪声水平变化时(尤其是噪声无法精确控制的情况下),该方法表现如何?
  • RQ5所提出方法能否超越依赖实例级监督或人工数据清洗的现有基线方法?

主要发现

  • WSCI在SUN、AwA2和CUB三个基准数据集上均取得最佳性能,全面超越所有基线方法,包括使用实例级监督的方法。
  • 在SUN数据集上,WSCI在最高质量检索设置(s(1))下达到42.26%的准确率,优于最强基线方法(Xiao et al. [4])的40.56%。
  • 即使在更高噪声水平下(s(201)和s(401)),WSCI仍保持一致优势,准确率分别为41.79%和41.47%,在所有设置下均优于基线方法。
  • 消融实验表明,移除视觉编码(WSCI w/o ve)会导致性能下降,证实其在增强类别级表征方面的有效性。
  • 当属性不可用时,WSCI (w/o attr) 仍优于所有基线方法,证明其仅使用免费且自动提取的语义信息即可保持有效性。
  • 定性分析表明,模型能成功识别出高重建概率的非异常值和低重建概率的异常值,验证了其异常值检测能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。