Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Regularization of Random Feature Models

Arthur Paul Jacot, Berfin Şimşek|arXiv (Cornell University)|Feb 19, 2020
Face and Expression Recognition参考文献 35被引用数 8
ひとこと要約

本稿では、有限個の特徴を有するランダム特徴(RF)モデルが、カーネルリッジ回帰(KRR)におけるリッジペナルティを効果的に増加させることで、暗黙の正則化を実行することを確立している。ランダム行列理論を用いて、期待されるRF予測子が有効なリッジ $ ilde{\lambda} > \lambda$ を持つKRR予測子と非常に近いことを示しており、特徴数 $P$ が増加するにつれて $ ilde{\lambda}$ は $ olinebreak\lambda$ に単調に減少する。これは有限サンプルにおける暗黙の正則化効果を明らかにする。平均RF予測子のテスト誤差は、理論的および実験的に、$ olinebreak\tilde{\lambda}$-KRR予測子のそれとほぼ同一であることが示されている。

ABSTRACT

Random Feature (RF) models are used as efficient parametric approximations of kernel methods. We investigate, by means of random matrix theory, the connection between Gaussian RF models and Kernel Ridge Regression (KRR). For a Gaussian RF model with $P$ features, $N$ data points, and a ridge $λ$, we show that the average (i.e. expected) RF predictor is close to a KRR predictor with an effective ridge $ ildeλ$. We show that $ ildeλ > λ$ and $ ildeλ \searrow λ$ monotonically as $P$ grows, thus revealing the implicit regularization effect of finite RF sampling. We then compare the risk (i.e. test error) of the $ ildeλ$-KRR predictor with the average risk of the $λ$-RF predictor and obtain a precise and explicit bound on their difference. Finally, we empirically find an extremely good agreement between the test errors of the average $λ$-RF predictor and $ ildeλ$-KRR predictor.

研究の動機と目的

  • 有限ランダム特徴(RF)モデルの一般化挙動を理解すること。RFモデルはカーネル法の近似であるが、その漸近的対応物ほど十分に理解されていない。
  • 特徴抽出のランダム性がRFモデルに与える暗黙の正則化の仕組み、特にリッジペナルティのチューニングとの関係を解明すること。
  • 期待されるRF予測子と有効なリッジパラメータ $\tilde{\lambda}$ を持つKRR予測子との明示的関係を確立し、それによる一般化誤差の差を定量化すること。
  • 平均RF予測子と対応する $\tilde{\lambda}$-KRR予測子とのリスク差に理論的バウンディングを提供し、実験的に検証すること。

提案手法

  • RF予測子 $\hat{f}^{(RF)}_{\lambda}$ が $P$ 個のi.i.d.ガウス特徴とリッジ $\lambda$ を持つ場合、ランダム行列理論を用いてその分布を分析する。
  • 期待されるRF予測子を導出し、それが有効なリッジ $\tilde{\lambda} > \lambda$ を持つカーネルリッジ回帰(KRR)予測子と非常に良く近似されることを示す。$\tilde{\lambda}$ は $P$、$\lambda$、およびデータのグラム行列に依存する。
  • 特徴数 $P$ が増加するにつれて $\tilde{\lambda}$ が $\lambda$ に単調に減少することを確立し、有限サンプリングによる暗黙の正則化効果を明らかにする。
  • 固定された $\gamma = P/N$ のもとで、$\lambda$-RF予測子の期待リスクと $\tilde{\lambda}$-KRR予測子のリスクとの差に明示的なバウンディングを提供し、$\mathbb{E}[L(\hat{f}^{(RF)}_{\lambda})] = L(\hat{f}^{(K)}_{\tilde{\lambda}}) + \mathcal{O}(P^{-1})$ が成り立つことを示す。
  • RF予測子の平均まわりの分散を、$\mathrm{Var}(\hat{f}^{(RF)}_{\lambda}(x)) \leq \frac{c_3 K(x,x) \|y\|_{K^{-1}}^2}{P}$ という形のバウンディングにより制御し、$P$ が増加するにつれて予測子が平均に集中することを示す。

実験結果

リサーチクエスチョン

  • RQ1有限サンプリングによるランダム特徴が、RFモデルの一般化性能にどのように影響を与えるか?
  • RQ2期待されるRF予測子が近似する有効なリッジパラメータ $\tilde{\lambda}$ は何か? そして、明示的なリッジ $\lambda$ とどのように関係するか?
  • RQ3平均RF予測子のテスト誤差は、有効リッジ $\tilde{\lambda}$ を持つ対応するKRR予測子のそれとどれほど近いか?
  • RQ4RF予測子の分散は、$P$ とデータ依存量の観点から明示的にバウンディング可能か?
  • RQ5RFモデルにおける暗黙の正則化は、現代の学習モデルで観察されるダブルデセント現象を説明できるか?

主な発見

  • リッジ $\lambda$ を持つ期待されるRF予測子は、有効なリッジ $\tilde{\lambda} > \lambda$ を持つKRR予測子と非常に良く近似される。$P$ が有限のとき $\tilde{\lambda}$ は $\lambda$ より厳密に大きく、$P$ が増加すると $\lambda$ に収束する。
  • $\tilde{\lambda}$ は特徴数 $P$ が増加するにつれて $\lambda$ に単調に減少する。これは有限サンプリングによる暗黙の正則化効果を示している。
  • 固定された $\gamma = P/N$ のもとで、$\lambda$-RF予測子と $\tilde{\lambda}$-KRR予測子の期待テスト誤差の差は $\mathcal{O}(P^{-1})$ でバウンディングされ、$\lambda$、$\gamma$、およびデータに依存する明示的な定数を伴う。
  • 実験的に、平均 $\lambda$-RF予測子と $\tilde{\lambda}$-KRR予測子のテスト誤差は、$P$ や $N$ が小さくても極めて近いことが確認された。
  • RF予測子の分散は $\frac{c_3 K(x,x) \|y\|_{K^{-1}}^2}{P}$ でバウンディングされ、$P$ が増加するにつれて予測子が平均に集中することが示された。
  • 結果は訓練データがi.i.d.であると仮定せず、固定された訓練データとランダムな特徴抽出にのみ依存している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。