Skip to main content
QUICK REVIEW

[論文レビュー] On the number of variables to use in principal component regression

Ji Xu, Daniel Hsu|arXiv (Cornell University)|Jun 4, 2019
Statistical Methods and Inference参考文献 16被引用数 9
ひとこと要約

この論文は、特徴数 $ p $ が標本サイズ $ n $ を超える高次元設定における主成分回帰(PCR)を分析し、予測誤差が $ p $ の増加に伴い「ダブルデセント」曲線を示すことを示している。驚くべきことに、共分散行列の固有値がゆっくりと減少する場合、過剰適合($ p > n $)の領域で最小誤差が達成されるが、これは $ p > n $ では過剰適合が生じるとの一般的な直観に反する。

ABSTRACT

We study least squares linear regression over $N$ uncorrelated Gaussian features that are selected in order of decreasing variance. When the number of selected features $p$ is at most the sample size $n$, the estimator under consideration coincides with the principal component regression estimator; when $p>n$, the estimator is the least $\ell_2$ norm solution over the selected features. We give an average-case analysis of the out-of-sample prediction error as $p,n,N o \infty$ with $p/N o α$ and $n/N o β$, for some constants $α\in [0,1]$ and $β\in (0,1)$. In this average-case setting, the prediction error exhibits a "double descent" shape as a function of $p$. We also establish conditions under which the minimum risk is achieved in the interpolating ($p>n$) regime.

研究の動機と目的

  • 選択された成分数 $ p $ が標本サイズ $ n $ を超える場合の主成分回帰(PCR)の外挿予測誤差を分析すること。
  • 高次元漸近的枠組みにおいて平均的誤差を検討することで、$ p > n $ がPCRにおいて過剰適合を引き起こすという一般的な信念に挑戦すること。
  • 最小予測誤差が過剰決定領域($ p < n $)ではなく、補間領域($ p > n $)で達成される条件を特定すること。
  • PCRにおいて「ダブルデセント」リスク曲線の存在を確立すること。ここで誤差は $ p $ の増加に伴い最初に減少し、増加し、再び減少する。

提案手法

  • 著者らは、真の係数ベクトル $ \boldsymbol{\theta} $ が等方的事前分布から抽出され、設計行列 $ \boldsymbol{X} $ が既知の対角共分散 $ \boldsymbol{\Sigma} = \operatorname{diag}(\lambda_1, \dots, \lambda_N) $ を持つ i.i.d. $ \mathcal{N}(0, \boldsymbol{\Sigma}) $ 特徴から成る平均的状況を考察する。
  • ランダム行列理論と経験的固有値分布のストイエルジェス変換を用いて、$ N, n, p \to \infty $ となる極限においてPCRの漸近的予測誤差を導出する。ここで $ p/N \to \alpha \in [0,1] $ かつ $ n/N \to \beta \in (0,1) $ とする。
  • PCR推定量は、$ p \leq n $ の場合 $ \hat{\boldsymbol{\theta}}_P = (\boldsymbol{X}_P^\top \boldsymbol{X}_P)^{-1} \boldsymbol{X}_P^\top \boldsymbol{y} $ で定義され、$ p > n $ の場合 $ \hat{\boldsymbol{\theta}}_P = \boldsymbol{X}_P^\top (\boldsymbol{X}_P \boldsymbol{X}_P^\top)^{-1} \boldsymbol{y} $ で定義され、$ \hat{\boldsymbol{\theta}}_{P^c} = \mathbf{0} $ である。
  • 設計行列とその一般化逆行列を含む二次形式の極限挙動を特徴づけることにより、マーチェンコ=パストール則やストイエルジェス変換を用いた固定点方程式の解法といった道具を用いる。
  • 予測誤差はバイアスとバイアス成分に分解され、集中法とスペクトルモーメントの収束を用いて漸近的誤差が導出される。
  • 主な技術的革新は、ストイエルジェス変換 $ m_f(z) $ と関数 $ q_f(s, \nu) $ を含む関数方程式の使用であり、これにより漸近的誤差が固有値分布 $ f(t) $ と正則化パラメータ $ s^* $ と結びつく。

実験結果

リサーチクエスチョン

  • RQ1成分数 $ p $ が標本サイズ $ n $ を超えて増加する際、PCRの予測誤差はダブルデセント曲線を示すか?
  • RQ2PCRにおける最小予測誤差が過剰決定領域($ p < n $)ではなく補間領域($ p > n $)で達成可能か?
  • RQ3PCRにおけるダブルデセント現象が生じる共分散行列の固有値分布の条件は何か?
  • RQ4高次元極限において $ p/N \to \alpha $ かつ $ n/N \to \beta $ のとき、PCRの漸近的予測誤差はどのように振る舞うか?
  • RQ5固有値の減少率は、$ p > n $ が $ p < n $ よりも低い誤差をもたらすかどうかを決定づける役割を果たすか?

主な発見

  • PCRの予測誤差は $ p $ の関数として「ダブルデセント」の形状を示し、初期の減少、$ p \approx n $ 付近のピーク、そして $ p > n $ での再びの減少を示す。
  • 共分散行列の固有値がゆっくりと減少する場合、特にスペクトル測度 $ f(t) $ が特定の正則性条件を満たす場合、最小誤差は補間領域($ p > n $)で達成される。
  • 同じ条件下で、$ p > n $ 領域における漸近的予測誤差は、$ p < n $ 領域で達成可能な最良の誤差よりも厳密に小さい。
  • ダブルデセント現象は、高次元極限におけるバイアスとバイアスのキャンセルに起因し、$ p $ 個の特徴に対する最小 $ \ell_2 $-ノルム解が、任意の $ p < n $ 解よりも低い誤差を達成する。
  • 極限予測誤差は固有値分布 $ f(t) $ に依存し、最適な $ p $ はストイエルジェス変換 $ m_f(z) $ と関数 $ q_f(s, \nu) $ を含む固定点方程式によって決定される。
  • 本論文は、最小リスクがある $ p > n $ で達成されるための必要十分条件として、$ h_f(\nu) = 0 $ が $ f $ の台において解を持つこと、あるいは同値的に $ \beta s^* < \delta \int_{\eta_1}^\infty t f(t) dt $ が成り立つことであることを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。