[论文解读] SOSELETO: A Unified Approach to Transfer Learning and Training with Noisy Labels
SOSELETO 提出了一种统一的双层优化框架,联合学习源样本权重和目标分类模型,以提升迁移学习与含噪声标签的训练效果。通过端到端优化动态选择有信息量的源样本,SOSELETO 在数据稀缺的迁移学习和含噪声标签学习基准上均取得了当前最优性能。
We present SOSELETO (SOurce SELEction for Target Optimization), a new method for exploiting a source dataset to solve a classification problem on a target dataset. SOSELETO is based on the following simple intuition: some source examples are more informative than others for the target problem. To capture this intuition, source samples are each given weights; these weights are solved for jointly with the source and target classification problems via a bilevel optimization scheme. The target therefore gets to choose the source samples which are most informative for its own classification task. Furthermore, the bilevel nature of the optimization acts as a kind of regularization on the target, mitigating overfitting. SOSELETO may be applied to both classic transfer learning, as well as the problem of training on datasets with noisy labels; we show state of the art results on both of these problems.
研究动机与目标
- 解决标准迁移学习的局限性,即对所有源样本一视同仁,尽管其与目标任务的相关性各不相同。
- 通过学习哪些源样本对目标分类问题最具信息量,提升数据稀缺目标设置下的泛化能力。
- 通过引入一种双层优化机制,利用源样本加权对目标分类器进行正则化,缓解含噪声标签学习中的过拟合问题。
- 在单一、端到端可训练的框架下统一两种不同的学习范式——迁移学习与含噪声标签学习。
- 实现在无需对标签重叠或分布相似性做先验假设的前提下,自动、基于数据地剔除无用或含噪声的源样本。
提出的方法
- 构建一个双层优化问题:内层最小化固定样本权重下的源分类损失,外层最小化关于样本权重与分类器参数的目标分类损失。
- 为每个源样本引入可学习的、实例特定的权重,以表示其与目标任务的相关性。
- 以端到端方式联合优化共享表示、源分类器与目标分类器以及源样本权重。
- 利用双层结构作为隐式正则化:目标不直接控制表示学习,从而降低过拟合风险。
- 将该框架应用于迁移学习(类别不相交或部分重叠)与含噪声标签学习(干净的目标数据与含噪声的源数据)。
- 通过基于梯度的优化求解双层问题,支持反向传播通过两层,实现所有参数的同步更新。
实验结果
研究问题
- RQ1统一框架是否能通过动态选择有信息量的源样本,在迁移学习与含噪声标签学习中均实现性能提升?
- RQ2SOSELETO 中的双层优化机制如何对目标分类器进行正则化,并在数据稀缺设置下减少过拟合?
- RQ3SOSELETO 在训练过程中能多大程度上自动识别并过滤无用或错误标注的源样本?
- RQ4当源与目标标签空间非重叠或仅部分重叠时,该方法在迁移学习中是否优于现有方法?
- RQ5当存在少量干净目标数据时,SOSELETO 在大规模数据集上缓解标签噪声负面影响的效果如何?
主要发现
- SOSELETO 在迁移学习与含噪声标签学习的多个基准上均达到当前最优性能,显著优于先前方法。
- 在 CIFAR-10 数据集上,当标签噪声比例为 30% 时,SOSELETO 达到 88.7% 的测试准确率,显著优于基线方法。
- 在 SVHN 0-9 到 MNIST 5-9 的迁移学习任务中,SOSELETO 通过有效选择视觉相似、居中且低噪声的源样本,将准确率提升至 90.3%。
- 该方法识别并降低了约 3–5% 的错误标注样本在 SVHN 数据集中的影响,证明其具备检测与缓解噪声样本的能力。
- SVHN 中高权重的源样本通常具有清晰、居中、轴对齐、尺寸适中等良好视觉特征,而低权重样本则常表现出模糊、旋转或标注错误。
- SOSELETO 学习到的源样本权重与视觉质量及对齐程度的相关性,强于与类别标签的相关性,表明该方法更关注样本质量而非类别重叠。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。