Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Second Order Coresets for Data-efficient Machine Learning

Omead Pooladzandi, David Davini|arXiv (Cornell University)|Jul 28, 2022
Stochastic Gradient Optimization Techniques被引用数 5
ひとこと要約

AdaCoreは、ヘッセ行列に基づく曲率推定を用いて、動的に重み付き学習サブセットを選択する適応的2次コアセット手法を提案する。この手法は、プリコンディショニングされた勾配を近似することで、理論的保証とともにより高速な収束を実現する。深層ネットワークの学習において、ランダムサブセットに比べ4.5倍以上、全データに比べ2.9倍以上の高速化を達成しながら、モデルの精度を維持する。その際、多様性・不確実性・忘れやすさに優れたサンプルを優先的に選択する。

ABSTRACT

Training machine learning models on massive datasets incurs substantial computational costs. To alleviate such costs, there has been a sustained effort to develop data-efficient training methods that can carefully select subsets of the training examples that generalize on par with the full training data. However, existing methods are limited in providing theoretical guarantees for the quality of the models trained on the extracted subsets, and may perform poorly in practice. We propose AdaCore, a method that leverages the geometry of the data to extract subsets of the training examples for efficient machine learning. The key idea behind our method is to dynamically approximate the curvature of the loss function via an exponentially-averaged estimate of the Hessian to select weighted subsets (coresets) that provide a close approximation of the full gradient preconditioned with the Hessian. We prove rigorous guarantees for the convergence of various first and second-order methods applied to the subsets chosen by AdaCore. Our extensive experiments show that AdaCore extracts coresets with higher quality compared to baselines and speeds up training of convex and non-convex machine learning models, such as logistic regression and neural networks, by over 2.9x over the full data and 4.5x over random subsets.

研究の動機と目的

  • 既存のデータ効率的学習手法がサブセット選択にヒューリスティクスに依存するため、理論的保証が欠如しているという問題に対処すること。
  • ヘッセ行列で前提づけられた勾配を近似するコアセットを選択することで、モデルの収束速度と品質を向上させること。
  • 学習に不要な重複や情報のないデータポイントを排除しつつ、学習に不可欠な重要な例を保持すること。
  • 選択されたコアセットに適用される一次および二次最適化手法の両方について、厳密な収束保証を提供すること。
  • 学習中に変化するデータポイントの重要性(例:不確実性や記憶のしやすさ)に応じて、サブセット選択を動的に適応させること。

提案手法

  • AdaCoreは、損失関数の曲率をリアルタイムで近似するために、ヘッセ行列の指数的平均推定を用いる。
  • コアセット選択を、ヘッセ行列の対角成分で前提づけられた勾配情報を捉えるサブモジュラ関数を最大化する形で定式化する。
  • 計算効率を維持するため、ヘッセ行列の完全計算を避けることで、ヘッセフリー最適化に依存する。
  • 局所的な曲率および勾配推定のノイズを低減するために、一次および二次勾配情報と指数的スムージングを統合する。
  • データポイントがプリコンディショニングされた勾配に与える寄与度に応じて重み付けされるため、反復的にコアセットを構築する。
  • AdaCoreは、不確実性が高く忘れやすさが高いサンプルを優先し、一般化に不可欠であると判断される。

実験結果

リサーチクエスチョン

  • RQ1曲率情報を組み込んだコアセット選択手法は、理論的保証とともにより高速な収束を達成できるか?
  • RQ2勾配のみまたはヒューリスティクスに基づく手法と比較して、適応的でヘッセ行列に基づくコアセット選択は、学習速度と精度においてどのように異なるか?
  • RQ3AdaCoreは、非凸的深層学習設定において、学習に不可欠な多様性があり冗長性のない例を効果的に特定・優先できるか?
  • RQ4適応的ヘッセ推定によるプリコンディショニングされた勾配近似は、フルバッチ学習と比較して最適化ダイナミクスを改善するか?
  • RQ5選択頻度とバッチサイズは、AdaCoreが生成するコアセットの性能にどのように影響を与えるか?

主な発見

  • CIFAR-100とResNet18を用いた実験で、AdaCoreはランダムサブセットに比べ4.5倍以上、全データ学習に比べ2.9倍以上の高速化を達成した。
  • BDD100kとResNet50を用いた実験では、AdaCoreは全データに比べ2.5倍、ランダムサブセットに比べ1.7倍の高速化を達成した。
  • Craigと比較して、AdaCoreはより多様なサブセットを選択し、選択頻度分布が平坦になり、冗長性が低減された。
  • トップランクの例において、忘却スコアと不確実性の平均が高いため、忘れやすさと不確実性の高いサンプルを優先していることが示された。
  • Craigとは異なり、AdaCoreではコアセット上で大きなバッチサイズを用いても勾配誤差が増加せず、重みの高い要素による悪影響を回避できた。
  • 非凸的モデル(例:深層ネットワーク)において、AdaCoreはPolyak-Łojasiewicz (PL*) 条件のもとで指数的収束率を保証し、全データ学習のダイナミクスと同等の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。