Skip to main content
QUICK REVIEW

[論文レビュー] GRAD-MATCH: Gradient Matching based Data Subset Selection for Efficient Deep Model Training

Krishnateja Killamsetty, Durga Sivasubramanian|arXiv (Cornell University)|Feb 27, 2021
Advanced Neural Network Applications参考文献 39被引用数 11
ひとこと要約

本論文は、直交マッチング・プルーリングを用いて、サブセットとフルデータセット間の勾配マッチング誤差を最小化することで、トレーニングサブセットを特定するGrad-Matchというデータサブセット選択フレームワークを提案する。この手法は、最先端の精度・効率のトレードオフを達成しており、ImageNetでは最大7倍のトレーニング時間を短縮しながらも、1〜3%の精度低下にとどめ、CIFAR-10、CIFAR-100、MNISTの各データセットでCraig や Glister などの手法を上回っている。

ABSTRACT

The great success of modern machine learning models on large datasets is contingent on extensive computational resources with high financial and environmental costs. One way to address this is by extracting subsets that generalize on par with the full data. In this work, we propose a general framework, GRAD-MATCH, which finds subsets that closely match the gradient of the training or validation set. We find such subsets effectively using an orthogonal matching pursuit algorithm. We show rigorous theoretical and convergence guarantees of the proposed algorithm and, through our extensive experiments on real-world datasets, show the effectiveness of our proposed framework. We show that GRAD-MATCH significantly and consistently outperforms several recent data-selection algorithms and achieves the best accuracy-efficiency trade-off. GRAD-MATCH is available as a part of the CORDS toolkit: \url{https://github.com/decile-team/cords}.

研究の動機と目的

  • 大規模データセット上でディープラーニングモデルをトレーニングする際の高い計算コストおよび環境への影響を軽減すること。
  • モデルの一般化性能を維持しつつ、トレーニングデータサイズを大幅に削減できるデータサブセット選択手法を開発すること。
  • 勾配マッチングを用いた適応的データサブセット選択の理論的収束保証を提供すること。
  • 既存の最先端のサブセット選択手法と比較して、優れた精度・効率のトレードオフを達成すること。
  • 低リソース環境での効率的なトレーニングを可能とし、高速かつ正確なサブセット選択によりハイパーパramータチューニングを加速すること。

提案手法

  • フルデータセットの勾配とサブセットの勾配の残差誤差を最小化する形でデータサブセット選択を定式化し、勾配マッチングの品質に依存する理論的収束バウンダリーを導出する。
  • 近似的に最適なサブセット選択を保証する理論的根拠を持つ、弱い部分集合性(weakly submodular)最大化問題としてサブセット選択をモデル化する。
  • 勾配マッチング誤差を最も効果的に低減するデータポイントを段階的に選択するため、直交マッチング・プルーリング(OMP)アルゴリズムを実装する。
  • スケーラビリティとトレーニング効率を向上させるために、PerClassPerGradientおよびPerBatchの変種を導入する。
  • オープンソースでのデプロイと拡張性を実現するため、CORDSツールキットと統合し、プロキシベースの選択手法への拡張を可能にする。
  • 一般化性能を向上させるために、特に初期トレーニング段階で、バリデーション勾配マッチングをプロキシとして使用する。

実験結果

リサーチクエスチョン

  • RQ1データサブセットとフルデータセット間の勾配マッチングは、ディープラーニングにおける収束性および一般化性能の向上に寄与するか?
  • RQ2適応的データサブセット選択の理論的収束バウンダリーは、勾配マッチング誤差にどのように依存するか?
  • RQ3グリーディな直交マッチング・プルーリングアルゴリズムは、勾配マッチング誤差を効果的に最小化しつつ、スケーラビリティを維持できるか?
  • RQ4Grad-Matchは、Craig や Glister などの最先端のサブセット選択手法と比較して、精度およびトレーニング効率において優れているか?
  • RQ5Grad-Matchは、顕著な精度低下を伴わずに、トレーニング時間およびエネルギー消費量をどの程度まで削減できるか?

主な発見

  • ResNet-18を用いたImageNetでは、30%のデータを使用して1%の精度低下で3倍の高速化を達成し、300エポックを超えてトレーニングする際には全体で2.5倍の高速化を実現した。
  • CIFAR-10およびCIFAR-100では、それぞれ20%および10%のサブセットを使用して、最大4倍および7倍の高速化を達成しながらも、競争力のある精度を維持した。
  • MNISTでは1%のデータのみを用いて27倍の高速化を達成し、0.35%の精度低下で、早期停止を適用したフルトレーニングを上回った。
  • Grad-MatchのPerBatchバージョンは、速度と精度の両面でPerClassおよびPerClassPerGradientを上回り、最も優れたバランスを実現した。
  • CIFAR-10およびCIFAR-100において、Facility Location や エントロピー、Forgetting Events といったプロキシベース手法でさえ、より小さなResNet-18モデルを用いても、Grad-Matchに劣った性能を示した。
  • 他の手法と比較して、Grad-Matchの勾配近似誤差は顕著に低く、MNISTでは1%のサブセットサイズで、フル勾配の大きさの91.12%が保持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。