[論文レビュー] The Implicit Regularization of Ordinary Least Squares Ensembles
この論文は、特徴量とサンプルのランダムサブサンプルを用いて訓練された、通常最小二乗法(OLS)予測子のアンサンブルが、ガウス分布の仮定の下でリッジ回帰と同様に暗黙の正則化を示すことを示している。特徴量サブサンプルを最適に調整した場合、アンサンブルの漸近的リスクは最適なリッジ回帰のリスクと一致し、サブサンプルから生じる隠れた正則化効果がディープラーニングにおけるドロップアウトに類似していることが明らかになった。
Ensemble methods that average over a collection of independent predictors that are each limited to a subsampling of both the examples and features of the training data command a significant presence in machine learning, such as the ever-popular random forest, yet the nature of the subsampling effect, particularly of the features, is not well understood. We study the case of an ensemble of linear predictors, where each individual predictor is fit using ordinary least squares on a random submatrix of the data matrix. We show that, under standard Gaussianity assumptions, when the number of features selected for each predictor is optimally tuned, the asymptotic risk of a large ensemble is equal to the asymptotic ridge regression risk, which is known to be optimal among linear predictors in this setting. In addition to eliciting this implicit regularization that results from subsampling, we also connect this ensemble to the dropout technique used in training deep (neural) networks, another strategy that has been shown to have a ridge-like regularizing effect.
研究の動機と目的
- OLSベースのアンサンブル手法における特徴量およびサンプルのサブサンプルが及ぼす暗黙の正則化効果を理解すること。
- このようなアンサンブルが、線形予測子の中で最適とされるリッジ回帰と同等の性能を達成できるかどうかを特定すること。
- OLSアンサンブルとディープラーニングにおけるドロップアウトの間の理論的関連性を確立すること。両者ともリッジに類似した正則化を示す。
- 高次元漸近的設定下で、サブサンプルパラメータの関数としてアンサンブルの漸近的リスクを特徴づけること。
提案手法
- 著者たちは、全データ行列 X ∈ ℝⁿˣᵖ およびターゲットベクトル y ∈ ℝⁿ から、ランダムに選択された行(サンプル)と列(特徴量)のサブセットを用いて訓練される、k 個の独立なOLS予測子のアンサンブルを研究している。
- 各予測子は、ランダムに選択された行と列からなる部分行列に対して通常最小二乗法を適用し、最終的な予測はすべてのk個の予測子の平均値として得られる。
- 特徴量とモデル重みにi.i.d.ガウス分布の仮定を置き、n, p → ∞ の極限においてアンサンブルの漸近的リスクを導出している。
- ランダム行列理論と疑似逆行列の性質を活用して、期待リスクを計算し、リッジ回帰のリスクに収束することを示している。
- 確率的勾配降下法を介してドロップアウトとの関連を確立し、アンサンブルの挙動がドロップアウト正則化で訓練されたものと等価であることを示している。
- 主な数学的ツールには、核空間への射影作用素およびランダムサブサンプル行列の期待値の使用が含まれる。
実験結果
リサーチクエスチョン
- RQ1OLSアンサンブルにおける特徴量サブサンプルは、リッジ回帰の性能と一致する暗黙の正則化を引き起こすか?
- RQ2OLSアンサンブルの漸近的リスクは、各予測子が選択する特徴量の数とサンプル数にどのように依存するか?
- RQ3アンサンブルの挙動を、ディープニューラルネットワークにおけるドロップアウト正則化と正式に結びつけることができるか?
- RQ4同じデータ仮定下で、OLSアンサンブルの最適リスクは最適なリッジ回帰のリスクと等しいか?
主な発見
- 各予測子が選択する特徴量の数を最適に調整した場合、OLSアンサンブルの漸近的リスクは最適な漸近的リッジ回帰のリスクに等しくなる。
- 漸近的リスクは、特徴量サブサンプルの程度にのみ依存し、サンプルサブサンプルの程度には依存しない。ただし、各OLS問題が未定義(アンダーダータン)であることが条件である。
- 個々のOLS予測子が正則化されていないにもかかわらず、アンサンブルはリッジ回帰と同様に暗黙の正則化を示す。
- i.i.d.ガウス分布の仮定下で、高次元極限 n, p → ∞ において、アンサンブルの理論的リスクはリッジ回帰のリスクと一致する。
- OLSアンサンブルとドロップアウトの間には正式な関連性が確立され、両者ともランダムサブサンプルによってリッジに類似した正則化を誘発する。
- 指定された漸近的設定下で、予測子の数 k が増加するに従い、アンサンブルのリスクは最適リスクに収束する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。