Skip to main content
QUICK REVIEW

[論文レビュー] On Optimal Generalizability in Parametric Learning

Ahmad Beirami, Meisam Razaviyayn|arXiv (Cornell University)|Nov 14, 2017
Machine Learning and Data Classification参考文献 17被引用数 14
ひとこと要約

本稿では、正則化パラメトリック学習におけるleave-one-out cross validation (ALOOCV) の効率的な近似を提案し、サンプル外一般化誤差の高速かつ高精度な推定を可能にする。影響関数と理論的保証を活用して、勾配降下法により正則化ハイパーパrameterを最適化し、O(n)の計算量でO(n²)のLOOCVに匹敵する精度を達成する。

ABSTRACT

We consider the parametric learning problem, where the objective of the learner is determined by a parametric loss function. Employing empirical risk minimization with possibly regularization, the inferred parameter vector will be biased toward the training samples. Such bias is measured by the cross validation procedure in practice where the data set is partitioned into a training set used for training and a validation set, which is not used in training and is left to measure the out-of-sample performance. A classical cross validation strategy is the leave-one-out cross validation (LOOCV) where one sample is left out for validation and training is done on the rest of the samples that are presented to the learner, and this process is repeated on all of the samples. LOOCV is rarely used in practice due to the high computational complexity. In this paper, we first develop a computationally efficient approximate LOOCV (ALOOCV) and provide theoretical guarantees for its performance. Then we use ALOOCV to provide an optimization algorithm for finding the regularizer in the empirical risk minimization framework. In our numerical experiments, we illustrate the accuracy and efficiency of ALOOCV as well as our proposed framework for the optimization of the regularizer.

研究の動機と目的

  • 大規模なパラメトリック学習におけるleave-one-out cross validation (LOOCV) の高い計算コストを解消すること。
  • サンプル外リスクを高精度に推定できる、計算的に効率的なLOOCVの近似(ALOOCV)を開発すること。
  • ALOOCVに基づく勾配降下法を用いて、正則化ハイパーパrameterとモデルパラメータを同時に最適化すること。
  • ALOOCVに理論的根拠を提示し、正則性条件下でTakeuchi情報基準(TIC)と漸近的に同等であることを示すこと。
  • ロジスティック回帰やエラスティックネットを含む、準滑らかで滑らかでない正則化問題においても、強固な性能を示すこと。

提案手法

  • 影響関数を用いた一階近似としてALOOCVを提案し、陰関数定理に基づいてLOO変化を推定する。
  • 定理1を用いて、損失関数の勾配と正則化された損失関数のヘッセ行列を介して、ALOOCV推定を効率的に計算する。
  • ALOOCV推定量を用いて、正則化ハイパーパrameterに関するサンプル外リスクの勾配を計算し、勾配ベースの最適化を可能にする。
  • ℓ1などの非滑らか正則化子を扱うために、部分勾配に基づく近似とスムージング技術を適用する。
  • アルゴリズム1と2をハイパーパramータチューニングに実装し、特にアルゴリズム2ではALOOCVを用いて反復的最適化の勾配を計算する。
  • MNISTおよびCIFAR-10データセットを用いたロジスティック回帰とエラスティックネット回帰のタスクで、ALOOCVを正確なLOOCVおよび影響関数近似と比較して検証する。

実験結果

リサーチクエスチョン

  • RQ1サンプル外一般化誤差を高精度に推定できる、計算的に効率的なLOOCVの近似を導出できるか?
  • RQ2実世界のデータセットにおいて、ALOOCVの精度と実行時間は、正確なLOOCVおよび影響関数に基づく近似と比べてどの程度か?
  • RQ3ALOOCVを用いて、正則化学習における正則化ハイパーパrameterの勾配ベース最適化をどの程度実現できるか?
  • RQ4特に、TICなどの確立された情報基準との漸近的同等性を示す理論的保証は、ALOOCVに対してどの程度確立できるか?
  • RQ5エラスティックネット回帰におけるℓ1ノルムのような非滑らか正則化子が存在する状況でも、ALOOCVはどの程度の性能を示すか?

主な発見

  • MNISTおよびCIFAR-10データセットにおいて、ALOOCVは正確なLOOCVとほぼ同一の性能を示し、95%のケースでCVとACVベクトルの正規化差が5%未満であった。
  • MNISTでは、インサンプル損失の上位8件の外れ値について、ALOOCV推定値はLOOCVから0.24以内に収まり、一方で影響関数近似は真のサンプル外損失を捉えきれなかった。
  • ロジスティック回帰では、ALOOCVは1サンプルあたり約1秒で実行されたのに対し、LOOCVは約60秒を要し、ハイパーパラメータチューニングの総実行時間を数日から数時間に短縮した。
  • エラスティックネット回帰では、ALOOCVは反復ステップ全体を通じてLOOCVとよく一致し、両アルゴリズムとも10ステップ未満で顕著に損失を低減した。
  • ALOOCVの実行時間はnに線形に比例(O(n))するが、LOOCVはnの二乗に比例(O(n²))するため、サンプルサイズが増加するにつれて実行時間比が著しく上昇した。
  • 正則性条件下で、ALOOCVはTakeuchi情報基準(TIC)と漸近的に同等であったため、理論的基盤が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。