Skip to main content
QUICK REVIEW

[论文解读] Data Pruning via Moving-one-Sample-out

Haoru Tan, Sitong Wu|arXiv (Cornell University)|Oct 23, 2023
Domain Adaptation and Few-Shot Learning被引用 6
一句话总结

该论文提出了一种名为Moving-one-Sample-out(MoSo)的新颖数据剪枝方法,通过测量在排除某个样本时其对最优经验风险的影响来识别并移除信息量较少的样本。该方法采用基于一阶梯度的近似方法,具有线性时间复杂度和保证的误差界,能够捕捉训练动态,在高剪枝比例下显著优于先前方法,且在不同架构上具有良好的泛化能力,对噪声数据也表现出强鲁棒性。

ABSTRACT

In this paper, we propose a novel data-pruning approach called moving-one-sample-out (MoSo), which aims to identify and remove the least informative samples from the training set. The core insight behind MoSo is to determine the importance of each sample by assessing its impact on the optimal empirical risk. This is achieved by measuring the extent to which the empirical risk changes when a particular sample is excluded from the training set. Instead of using the computationally expensive leaving-one-out-retraining procedure, we propose an efficient first-order approximator that only requires gradient information from different training stages. The key idea behind our approximation is that samples with gradients that are consistently aligned with the average gradient of the training set are more informative and should receive higher scores, which could be intuitively understood as follows: if the gradient from a specific sample is consistent with the average gradient vector, it implies that optimizing the network using the sample will yield a similar effect on all remaining samples. Experimental results demonstrate that MoSo effectively mitigates severe performance degradation at high pruning ratios and achieves satisfactory performance across various settings.

研究动机与目标

  • 为解决现有数据剪枝方法将困难或噪声样本与真正有信息量的样本混淆的问题,通过测量经验风险变化来衡量样本重要性。
  • 开发一种计算高效、可扩展的替代方案,以近似计算昂贵的留一法微调过程,从而衡量样本影响。
  • 通过分析训练各阶段梯度的一致性,将训练动态纳入样本重要性估计中。
  • 提升经剪枝数据集在不同架构上的泛化能力,并增强在标签噪声下的鲁棒性。

提出的方法

  • MoSo将样本重要性定义为从训练集中移除单个样本后最优经验风险的变化,从而捕捉该样本对模型性能的贡献。
  • 提出一种一阶近似器,通过比较单个样本的梯度与各训练阶段的平均梯度,来估计该变化。
  • 该方法基于每个训练周期中样本梯度与期望梯度向量之间的余弦相似度计算得分,更高的对齐度表示更高的重要性。
  • 该近似方法实现线性时间复杂度,并提供近似误差的理论保证,避免了完整的重新训练过程。
  • 引入并行加速机制,将数据集划分到多个设备上,通过局部子集近似全局MoSo得分,实现可扩展的MoSo评分。
  • 该框架结合了代理网络训练与MoSo评分,其中代理模型在子集上进行训练,以实现高效的梯度计算。
(a) (a) CIFAR-100
(a) (a) CIFAR-100

实验结果

研究问题

  • RQ1通过测量样本移除后经验风险的变化,是否能比基于难度的指标更有效地识别真正有信息量的样本?
  • RQ2如何高效地近似计算昂贵的留一法微调过程,同时保持准确性?
  • RQ3通过分析各训练周期中梯度的演化过程,是否能增强样本重要性估计?
  • RQ4通过MoSo选择的剪枝核心集是否能在不重新训练的情况下良好泛化到不同架构上?
  • RQ5在高标签噪声条件下,MoSo相较于现有基于重要性的剪枝方法表现如何?

主要发现

  • MoSo在CIFAR-100、Tiny-ImageNet和ImageNet-1K上显著优于最先进方法,尤其在高剪枝比例下表现突出,在CIFAR-100上20%剪枝比例下达到76.58%的Top-1准确率。
  • MoSo选择的剪枝核心集在未见过的架构(如SENet和EfficientNet)上表现出良好泛化能力,展现出强大的可迁移性。
  • MoSo在合成标签噪声下保持高性能,在鲁棒性基准测试中远超基于难度的方法。
  • 将代理网络训练周期数从100以上增加,并未统一提升剪枝性能,从50到200个周期仅带来0.82%的准确率提升,证实了近似误差中的理论权衡。
  • 将数据集划分为更多子集可提升剪枝性能,表明更小的局部集合能更好地捕捉单个样本的影响。
  • MoSo估计器实现线性复杂度并提供近似误差保证,使其在大规模数据集上具备可扩展性和可靠性。
(b) (b) Tiny-ImageNet
(b) (b) Tiny-ImageNet

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。