Skip to main content
QUICK REVIEW

[论文解读] GRAD-MATCH: Gradient Matching based Data Subset Selection for Efficient Deep Model Training

Krishnateja Killamsetty, Durga Sivasubramanian|arXiv (Cornell University)|Feb 27, 2021
Advanced Neural Network Applications参考文献 39被引用 11
一句话总结

该论文提出 Grad-Match,一种通过最小化子集与完整数据集之间的梯度匹配误差,利用正交匹配追踪(orthogonal matching pursuit)识别训练子集的数据子集选择框架。该方法在准确率与效率之间实现了当前最优的权衡,在 ImageNet 上将训练时间最多减少 7 倍,准确率仅下降 1–3%,且在 CIFAR-10、CIFAR-100 和 MNIST 上均优于 Craig 和 Glister 等方法。

ABSTRACT

The great success of modern machine learning models on large datasets is contingent on extensive computational resources with high financial and environmental costs. One way to address this is by extracting subsets that generalize on par with the full data. In this work, we propose a general framework, GRAD-MATCH, which finds subsets that closely match the gradient of the training or validation set. We find such subsets effectively using an orthogonal matching pursuit algorithm. We show rigorous theoretical and convergence guarantees of the proposed algorithm and, through our extensive experiments on real-world datasets, show the effectiveness of our proposed framework. We show that GRAD-MATCH significantly and consistently outperforms several recent data-selection algorithms and achieves the best accuracy-efficiency trade-off. GRAD-MATCH is available as a part of the CORDS toolkit: \url{https://github.com/decile-team/cords}.

研究动机与目标

  • 解决在大规模数据集上训练深度学习模型所带来的高计算成本与环境负担。
  • 开发一种数据子集选择方法,在大幅减少训练数据量的同时保持模型泛化能力。
  • 为通过梯度匹配实现的自适应数据子集选择提供理论收敛保证。
  • 与现有最先进子集选择方法相比,实现更优的准确率-效率权衡。
  • 通过快速、准确的子集选择,实现在低资源硬件上的高效训练,并加速超参数调优。

提出的方法

  • 将数据子集选择建模为最小化完整数据集梯度与子集梯度之间残差误差的问题,从而获得依赖于梯度匹配质量的理论收敛界。
  • 将子集选择建模为弱次模最大化问题,以确保在理论保证下实现近似最优的子集选择。
  • 实现一种正交匹配追踪(OMP)算法,迭代选择能最大程度减少梯度匹配误差的数据点。
  • 引入 PerClassPerGradient 和 PerBatch 等优化技术,以提升可扩展性与训练效率。
  • 与 CORDS 工具包集成,实现开源部署与可扩展性,并支持基于代理的子集选择方法。
  • 使用验证集梯度匹配作为代理,以提升泛化能力,尤其是在训练初期阶段。

实验结果

研究问题

  • RQ1数据子集与完整数据集之间的梯度匹配是否能带来深度学习中更好的收敛性与泛化能力?
  • RQ2自适应数据子集选择的理论收敛界如何依赖于梯度匹配误差?
  • RQ3贪心正交匹配追踪算法能否有效最小化梯度匹配误差,同时保持可扩展性?
  • RQ4与 Craig 和 Glister 等最先进子集选择方法相比,Grad-Match 在准确率与训练效率方面表现如何?
  • RQ5Grad-Match 在不造成显著准确率下降的前提下,能在多大程度上减少训练时间与能耗?

主要发现

  • 在 ImageNet 上使用 ResNet-18 时,Grad-Match 在仅使用 30% 数据的情况下实现 3 倍加速,准确率仅下降 1%;在训练超过 300 个 epoch 时,整体实现 2.5 倍加速。
  • 在 CIFAR-10 和 CIFAR-100 上,Grad-Match 分别实现最高 4 倍和 7 倍的训练加速,使用 20% 和 10% 的子集时仍保持具有竞争力的准确率。
  • 在 MNIST 上,Grad-Match 使用仅 1% 的数据实现 27 倍加速,准确率仅下降 0.35%,且优于使用早停策略的完整训练。
  • Grad-Match 的 PerBatch 变体在准确率与训练效率之间实现了最佳平衡,优于 PerClass 和 PerClassPerGradient 在速度与准确率上的表现。
  • 在 CIFAR-10 和 CIFAR-100 上,Grad-Match 的表现优于基于代理的方法(如 Facility Location、Entropy 和 Forgetting Events),即使使用更小的 ResNet-18 模型也是如此。
  • 与其它方法相比,Grad-Match 的梯度近似误差显著更低,在 MNIST 上使用 1% 子集大小时,保留了 91.12% 的完整梯度幅值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。