Skip to main content
QUICK REVIEW

[論文レビュー] Whitening and second order optimization both destroy information about the dataset, and can make generalization impossible

Neha S. Wadia, Daniel Duckworth|arXiv (Cornell University)|May 4, 2021
Stochastic Gradient Optimization Techniques参考文献 83被引用数 7
ひとこと要約

本稿は、データホワイトニングおよび特定の2次最適化手法が、全結合層を有するモデルにおける一般化に不可欠な、データセットのサンプル間2次モーメント行列の重要情報を破壊することを示している。高次元設定では、この情報損失が一般化を不可能にすることがあるが、正則化された2次最適化は、一部の一般化能力を保持する実用的な妥協を提供する。

ABSTRACT

Machine learning is predicated on the concept of generalization: a model achieving low error on a sufficiently large training set should also perform well on novel samples from the same distribution. We show that both data whitening and second order optimization can harm or entirely prevent generalization. In general, model training harnesses information contained in the sample-sample second moment matrix of a dataset. For a general class of models, namely models with a fully connected first layer, we prove that the information contained in this matrix is the only information which can be used to generalize. Models trained using whitened data, or with certain second order optimization schemes, have less access to this information; in the high dimensional regime they have no access at all, resulting in poor or nonexistent generalization ability. We experimentally verify these predictions for several architectures, and further demonstrate that generalization continues to be harmed even when theoretical requirements are relaxed. However, we also show experimentally that regularized second order optimization can provide a practical tradeoff, where training is accelerated but less information is lost, and generalization can in some circumstances even improve.

研究の動機と目的

  • データホワイトニングおよび2次最適化が、全結合層を有する機械学習モデルにおける一般化に必要な情報にどのように影響を与えるかを調査すること。
  • 全結合層を有するモデルにおいて、サンプル間2次モーメント行列が一般化に関連する情報の主な源である役割を特定すること。
  • これらの手法が高次元領域において、この重要な情報へのアクセスを完全に消失させることで、一般化が著しく低下または不可能になることを実証すること。
  • 正則化された2次最適化が、訓練速度の利点を維持しながら情報損失を緩和し、一般化に必要な情報を保持できるかどうかを検討すること。

提案手法

  • 一般化がサンプル間2次モーメント行列にのみ依存することを示す理論的分析を、全結合層を有するモデルに対して実施。
  • データホワイトニングおよび特定の2次最適化スキーム(例:自然勾配)が、この行列へのアクセスを減少または完全に消失させる条件を導出。
  • 高次元漸近的解析を用いて、次元が高くなる極限において、これらの手法が2次モーメント行列へのアクセスを完全に失うことを示す。
  • 複数のアーキテクチャを対象に実験的検証を実施し、ホワイトニングおよび2次最適化下での一般化不能の理論的予測を確認。
  • 正則化された2次最適化の変種を提案し、訓練を高速化しつつも一般化に必要な情報を十分に保持できるかどうかを評価。
  • さまざまなモデルアーキテクチャにおいて、標準的、ホワイトニング、正則化された2次最適化の設定下での一般化性能を比較する実験を実施。

実験結果

リサーチクエスチョン

  • RQ1データホワイトニングは、全結合モデルにおける一般化に不可欠なサンプル間2次モーメント行列の情報を消去するか?
  • RQ2自然勾配などの2次最適化手法は、高次元設定において完全に一般化能力を失う可能性があるか?
  • RQ32次モーメント情報の損失は、深層学習モデルにおける悪いテスト性能とどの程度相関するか?
  • RQ4正則化された2次最適化は、訓練速度の向上を維持しながら、一般化に必要な十分な情報を保持できるか?
  • RQ5正則化付きの2次最適化を用いる場合、一般化を改善または維持できる条件は何か?

主な発見

  • データホワイトニングおよび特定の2次最適化スキームは、全結合第一層を有するモデルにおいて一般化に関連する情報の唯一の源たるサンプル間2次モーメント行列へのアクセスを破壊する。
  • 高次元領域では、これらの手法により2次モーメント行列へのアクセスが完全に失われ、一般化は不可能になる。
  • 実験的結果は、複数のアーキテクチャにわたり、ホワイトニングデータおよび標準的2次最適化下で一般化性能が著しく低下することを確認した。
  • 理論的仮定を緩和しても一般化は依然として損なわれるため、実用的設定においても問題が一貫して顕在することが示された。
  • 正則化された2次最適化は、実用的な妥協を提供する:訓練速度の向上を維持しながら、一般化に必要な情報を十分に保持でき、一部のケースでは一般化性能で向上すら示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。