Skip to main content
QUICK REVIEW

[論文レビュー] Towards Sustainable Learning: Coresets for Data-efficient Deep Learning

Yang Yu, Hao Kang|arXiv (Cornell University)|Jun 2, 2023
Advanced Neural Network Applications被引用数 4
ひとこと要約

Crestは、動的コアセット選択を用いて深層ニューラルネットワークの高価値な学習例を同定するスケーラブルで理論的裏付けのあるフレームワークである。非凸損失を局所的な二次近似としてモデル化し、ランダムサブセットから繰り返しコアセットを更新することで、精度の低下を最小限に抑えつつ学習を1.7倍〜2.5倍高速化し、確率的勾配降下法における静的点への収束を保証する。

ABSTRACT

To improve the efficiency and sustainability of learning deep models, we propose CREST, the first scalable framework with rigorous theoretical guarantees to identify the most valuable examples for training non-convex models, particularly deep networks. To guarantee convergence to a stationary point of a non-convex function, CREST models the non-convex loss as a series of quadratic functions and extracts a coreset for each quadratic sub-region. In addition, to ensure faster convergence of stochastic gradient methods such as (mini-batch) SGD, CREST iteratively extracts multiple mini-batch coresets from larger random subsets of training data, to ensure nearly-unbiased gradients with small variances. Finally, to further improve scalability and efficiency, CREST identifies and excludes the examples that are learned from the coreset selection pipeline. Our extensive experiments on several deep networks trained on vision and NLP datasets, including CIFAR-10, CIFAR-100, TinyImageNet, and SNLI, confirm that CREST speeds up training deep networks on very large datasets, by 1.7x to 2.5x with minimum loss in the performance. By analyzing the learning difficulty of the subsets selected by CREST, we show that deep models benefit the most by learning from subsets of increasing difficulty levels.

研究の動機と目的

  • 大規模データセット上で大規模な深層学習モデルを訓練する際の持続不可能な計算コストと炭素排出量を軽減すること。
  • 特に深層ネットワークを対象として、非凸モデルに対して厳密な理論的収束保証を提供するコアセットフレームワークを開発すること。
  • 勾配のバイアスと分散を低く保ちながら、(ミニバッチ)SGDと互換性を持つこと。
  • 後期の学習段階ですでに学習済みの例をコアセット選択から除外することで、スケーラビリティと効率性を向上させること。
  • 限られた訓練予算のもとで、多様なビジョンおよびNLPベンチマークにおいて、実験的に本手法の有効性を検証すること。

提案手法

  • Crestは、現在のモデルパラメータの周囲で非凸損失を二次関数の列としてモデル化し、真の損失と勾配の局所的近似を可能にする。
  • 各二次部分領域に対して、そのパラメータ点における全勾配をよく再現するコアセットを選択し、学習全体を通して勾配誤差が有界であることを保証する。
  • (ミニバッチ)SGDをサポートするため、Crestは複数のデータのランダムサブセットをサンプリングし、それぞれからミニバッチコアセットを抽出する。これにより、バイアスがほとんどなく分散が小さい勾配が得られる。
  • フレームワークは、二次近似の有効性に基づいてコアセットを動的に更新し、学習が進むにつれて近似の有効範囲が広がり、更新頻度を低下させる。
  • 勾配がほぼゼロ(=すでに学習済み)の例をコアセット選択から除外することで、後期の学習段階での効率性を向上させる。
  • Crestは勾配と曲率の滑らかな近似を用いて二次モデルの安定性を高め、コアセット更新時の不安定性を回避する。

実験結果

リサーチクエスチョン

  • RQ1非凸な深層学習モデルに対して、静的点への収束保証が保証されるコアセットフレームワークを設計できるか?
  • RQ2勾配バイアスと分散を低く保ちながら、(ミニバッチ)確率的勾配降下法と互換性を持つコアセット選択はどのように実現できるか?
  • RQ3大規模な深層学習データセットにおけるコアセット選択のスケーラビリティと効率性を向上する戦略は何か?
  • RQ4選択された例の学習難易度は学習過程でどのように変化するか?また、コアセット選択は困難な例に自発的に焦点を当てることができるか?
  • RQ5すでに学習済みの例を除外することで、コアセット選択の性能と学習速度はどの程度向上するか?

主な発見

  • Crestは、CIFAR-10のResNet20、CIFAR-100のResNet18、TinyImageNetのResNet-50、SNLIのRoBERTaを含む複数のビジョンおよびNLPベンチマークで、最小限の性能低下で1.7倍〜2.5倍の高速化を達成した。
  • コアセットをより頻繁に更新するベースラインと比較して、コアセット更新回数を46%削減しながらも、より高い最終精度を達成した。
  • すでに学習済みの例を除外することで、訓練効率とモデル性能の両方が向上し、除外しない場合と比較して相対誤差が4.33%(対象:4.61%)に低下した。
  • Crestは、平均の忘れがなさスコアの上昇によって示されるように、時間経過とともに学習難易度が増す例を選択しており、学習が難しいインスタンスに焦点を当てる傾向があることがわかった。
  • 二次近似戦略により、近似が成立する近傍領域のサイズを拡大でき、学習が進むにつれてコアセット更新頻度を低下させた。
  • CrestはランダムサンプリングおよびCraigベースのコアセット選択を上回り、Craig(0.089秒/更新)と比較してコアセット選択時間を13倍高速化(0.006秒/更新)した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。