Skip to main content
QUICK REVIEW

[论文解读] Towards Sustainable Learning: Coresets for Data-efficient Deep Learning

Yang Yu, Hao Kang|arXiv (Cornell University)|Jun 2, 2023
Advanced Neural Network Applications被引用 4
一句话总结

Crest 是一个可扩展且具有理论基础的框架,通过动态核心集选择识别深度神经网络中的高价值训练样本。通过将非凸损失建模为分段二次近似,并从随机子集迭代更新核心集,它在仅造成轻微准确率下降的情况下,将训练速度提升1.7倍至2.5倍,并在随机梯度下降下保证收敛至驻点。

ABSTRACT

To improve the efficiency and sustainability of learning deep models, we propose CREST, the first scalable framework with rigorous theoretical guarantees to identify the most valuable examples for training non-convex models, particularly deep networks. To guarantee convergence to a stationary point of a non-convex function, CREST models the non-convex loss as a series of quadratic functions and extracts a coreset for each quadratic sub-region. In addition, to ensure faster convergence of stochastic gradient methods such as (mini-batch) SGD, CREST iteratively extracts multiple mini-batch coresets from larger random subsets of training data, to ensure nearly-unbiased gradients with small variances. Finally, to further improve scalability and efficiency, CREST identifies and excludes the examples that are learned from the coreset selection pipeline. Our extensive experiments on several deep networks trained on vision and NLP datasets, including CIFAR-10, CIFAR-100, TinyImageNet, and SNLI, confirm that CREST speeds up training deep networks on very large datasets, by 1.7x to 2.5x with minimum loss in the performance. By analyzing the learning difficulty of the subsets selected by CREST, we show that deep models benefit the most by learning from subsets of increasing difficulty levels.

研究动机与目标

  • 为解决在大规模数据集上训练大型深度学习模型所产生的不可持续的计算成本和碳足迹问题。
  • 开发一种核心集框架,为非凸模型(尤其是深度网络)提供严格的理论收敛保证。
  • 通过保持梯度近乎无偏且方差低,确保与随机梯度方法(如(小批量)SGD)的兼容性。
  • 通过在训练后期阶段排除已学习样本,提升核心集选择的可扩展性和效率。
  • 在有限的训练预算下,通过多样化的视觉和自然语言处理基准对方法进行实证验证。

提出的方法

  • Crest 将非凸损失建模为当前模型参数附近的分段二次函数,从而实现对真实损失和梯度的局部近似。
  • 它为每个二次子区域选择一个核心集,使其在该参数点处的梯度与完整数据集的梯度高度匹配,从而在整个训练过程中保持梯度误差有界。
  • 为支持(小批量)SGD,Crest 从多个数据的随机子集中采样,并从每个子集中提取小批量核心集,确保梯度近乎无偏且方差小。
  • 该框架根据二次近似的有效性动态更新核心集,在训练进展过程中降低更新频率,因为损失逐渐变得更局部凸。
  • 它识别并从核心集选择中排除梯度接近零的样本(即已学习样本),从而在训练后期提升效率。
  • Crest 使用梯度和曲率的平滑近似来稳定二次建模,并避免核心集更新过程中的不稳定性。

实验结果

研究问题

  • RQ1能否为非凸深度学习模型设计一种核心集框架,使其具有收敛至驻点的可证明保证?
  • RQ2如何使核心集选择与(小批量)随机梯度下降兼容,同时保持梯度偏差和方差较低?
  • RQ3有哪些策略可以提升核心集选择在大规模深度学习数据集上的可扩展性和效率?
  • RQ4所选样本的学习难度在训练过程中如何演变?核心集选择能否自适应地聚焦于更难的样本?
  • RQ5排除已学习样本在多大程度上能提升核心集选择性能和训练速度?

主要发现

  • Crest 在多个视觉和自然语言处理基准上实现了1.7倍至2.5倍的训练加速,包括在CIFAR-10上的ResNet20、在CIFAR-100上的ResNet18、在TinyImageNet上的ResNet-50,以及在SNLI上的RoBERTa,且性能下降可忽略不计。
  • 与基线方法相比,该方法将核心集更新次数减少了46%,同时达到了更高的最终准确率。
  • 排除已学习样本可同时提升训练效率和模型性能,表现为相对误差从4.61%降至4.33%。
  • Crest 随时间选择的学习难度逐渐增加,表现为平均遗忘分数上升,表明其聚焦于难以学习的样本。
  • 二次近似策略使Crest能够扩大近似有效的邻域范围,从而在训练过程中减少核心集更新频率。
  • Crest 在核心集选择时间上显著优于随机采样和Craig-based核心集选择方法,核心集选择速度比Craig快13倍(每次更新0.006秒 vs. 0.089秒)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。