Skip to main content
QUICK REVIEW

[论文解读] A Topological Filter for Learning with Label Noise

Pengxiang Wu, Songzhu Zheng|arXiv (Cornell University)|Dec 9, 2020
Topological and Geometric Data Analysis被引用 15
一句话总结

本文提出 TopoFilter,一种新颖的拓扑方法,通过利用潜在特征空间中干净数据的空间聚类特性,在深度学习中过滤标签噪声。通过迭代选择每类最大的连通分量并优化表示,TopoFilter 在 CIFAR-10、CIFAR-100 和真实世界 Clothing1M 数据集上,在多种噪声设置下均实现了最先进的鲁棒性,且在干净数据收集的纯净度与丰富度方面具有理论保证。

ABSTRACT

Noisy labels can impair the performance of deep neural networks. To tackle this problem, in this paper, we propose a new method for filtering label noise. Unlike most existing methods relying on the posterior probability of a noisy classifier, we focus on the much richer spatial behavior of data in the latent representational space. By leveraging the high-order topological information of data, we are able to collect most of the clean data and train a high-quality model. Theoretically we prove that this topological approach is guaranteed to collect the clean data with high probability. Empirical results show that our method outperforms the state-of-the-arts and is robust to a broad spectrum of noise types and levels.

研究动机与目标

  • 为解决深度学习中的标签噪声问题,该问题因模型对损坏标签的记忆化而严重降低性能。
  • 克服现有方法仅依赖预测置信度的局限性,这些方法缺乏理论基础且在不同噪声模式下泛化能力不足。
  • 利用潜在表示空间中数据的空间拓扑结构,其中干净样本形成密集聚类,而噪声样本则孤立存在。
  • 开发一种在收集干净数据时既谨慎(高纯净度)又激进(高丰富度)的方法,以确保模型训练的鲁棒性。
  • 在关于数据分布和表示的弱假设下,为干净数据收集提供理论保证。

提出的方法

  • TopoFilter 通过检测每类特征表示的 k-近邻图中的最大连通分量来识别干净数据。
  • 它通过迭代剥离最大分量的最外层,仅保留核心部分,从而对来自噪声分类器的偏斜表示保持鲁棒性。
  • 该算法使用 k-近邻图来建模局部连通性,k 值根据数据密度和验证性能进行选择。
  • 该方法联合优化表示学习与数据选择:在收集的干净数据上重新训练深度神经网络,通过迭代提升特征质量。
  • 它利用拓扑不变量——特别是连通分量——来指导数据选择,避免依赖预测置信度或损失值。
  • 理论分析证明,在温和假设下(紧支集、连续条件分布、连通决策区域),TopoFilter 以高概率收集干净数据。

实验结果

研究问题

  • RQ1即使表示因标签噪声而发生偏斜,潜在特征空间中的拓扑结构是否可被可靠地用于区分干净与噪声数据?
  • RQ2基于拓扑连通性的数据选择方法是否能同时实现高纯净度与高丰富度的干净数据,优于基于置信度的方法?
  • RQ3是否存在一种具有理论基础的标签噪声过滤方法,能在多种噪声类型与水平下保持强性能?
  • RQ4对表示与数据选择进行迭代优化,是否能引导模型收敛至鲁棒且高精度的模型?
  • RQ5在真实世界噪声数据集(如 Clothing1M)上,该拓扑方法与最先进方法相比的实证表现如何?

主要发现

  • 在 CIFAR-10 数据集上,当噪声率为 60% 时,TopoFilter 达到 74.10% 的测试准确率,优于次佳方法(PENCIL 为 73.49%),创下新的 SOTA 记录。
  • 在真实世界 Clothing1M 数据集上(估计标签准确率为 61.54%),TopoFilter 在 10,000 个干净测试样本上达到 74.10% 的分类准确率,优于所有基线方法,包括 SL、GCE 和 DY。
  • TopoFilter 在 CIFAR-10 和 CIFAR-100 上对多种噪声类型与水平均表现出一致的优越性,显示出对不同噪声模式的鲁棒性。
  • 该方法实现了高纯净度与高丰富度的干净数据收集,这在弱假设下的数据分布与表示条件下,理论上已得到证明。
  • 数据选择的计算成本(k-NN 与连通分量)可控(每轮约 25 秒),使该方法适用于大规模训练。
  • 实证结果证实,即使在噪声训练导致表示偏斜的情况下,拓扑直觉依然成立,验证了该方法的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。