Skip to main content
QUICK REVIEW

[論文レビュー] Pac-bayesian bounds for sparse regression estimation with exponential weights

Pierre Alquier, Karim Lounici|Sep 14, 2010
Statistical Methods and Inference被引用数 5
ひとこと要約

本稿は、$ p > n $ である高次元スパース回帰に対して、PAC-Bayesian不等式を活用した新しい指数型重み推定法を提案する。統計的性能の向上を実現し、弱い設計仮定のもとで真の過剰リスクに対するスパarsityオラクル不等式(確率的に)を確立する。予測リスクの明示的で明確な上限が得られ、スパarsityレベル $ p_0 $ およびサンプルサイズ $ n $ に有利に依存する。

ABSTRACT

We consider the sparse regression model where the number of parameters $p$ is larger than the sample size $n$. The difficulty when considering high-dimensional problems is to propose estimators achieving a good compromise between statistical and computational performances. The BIC estimator for instance performs well from the statistical point of view \cite{BTW07} but can only be computed for values of $p$ of at most a few tens. The Lasso estimator is solution of a convex minimization problem, hence computable for large value of $p$. However stringent conditions on the design are required to establish fast rates of convergence for this estimator. Dalalyan and Tsybakov \cite{arnak} propose a method achieving a good compromise between the statistical and computational aspects of the problem. Their estimator can be computed for reasonably large $p$ and satisfies nice statistical properties under weak assumptions on the design. However, \cite{arnak} proposes sparsity oracle inequalities in expectation for the empirical excess risk only. In this paper, we propose an aggregation procedure similar to that of \cite{arnak} but with improved statistical performances. Our main theoretical result is a sparsity oracle inequality in probability for the true excess risk for a version of exponential weight estimator. We also propose a MCMC method to compute our estimator for reasonably large values of $p$.

研究の動機と目的

  • パラメータ数 $ p $ がサンプルサイズ $ n $ を上回る高次元回帰の課題に対処する。この領域では、Lassoのような古典的推定法に限界がある。
  • 既存手法の計算的・統計的トレードオフを克服するため、計算可能性と強力な理論的性能の両立を図る指数型重み推定法を提案する。
  • 真の過剰リスクに対するスパarsityオラクル不等式(確率的に)を確立し、期待値に関する境界しか得られなかった先行研究を改善する。
  • 真のスパースサポートを知っているオラクル推定法の予測性能に近い性能を達成することを保証する理論的枠組みを提供する。
  • 設計行列に対してきつい条件を要しない弱い仮定のもとで推定法を分析し、Lasso型手法が高速収束率を達成するために要する制限的条件を回避する。

提案手法

  • 回帰係数の後退分布を指数型重みで定義する。各係数ベクトル $ \theta $ の重みは、$ r(\theta) $(経験的リスク)に比例する $ \exp(-\lambda r(\theta)) $ に比例する。
  • PAC-Bayesian不等式を適用し、過剰リスク $ R(\hat{\theta}) - R(\bar{\theta}) $ の高確率境界を導出する。ここで $ \hat{\theta} $ は指数型重み推定法、$ \bar{\theta} $ は最適パラメータである。
  • 仮説クラスの複雑さを制御するため、$ \Theta_{K+1} $ と呼ばれる切り捨てられたパrameter空間を導入する。これは非ゼロ成分が最大 $ K+1 $ 個のベクトルに制限される。
  • 集中不等式とジェンセンの不等式の組み合わせを用いて、リスク差のモーメント生成関数を制御し、高確率境界を可能にする。
  • スパarsityレベル $ |J(\bar{\theta})| = p_0 $、サンプルサイズ $ n $、および $ p $、$ K $、信頼水準に関する対数項に依存する予測リスクの境界を導出する。
  • バイアスとバリアンスのトレードオフを最適化するため、正則化パrameter $ \lambda $ を最適化する。最終的に、最適収束率を得るために $ \lambda = n/(2\mathcal{C}_1) $ と設定する。

実験結果

リサーチクエスチョン

  • RQ1弱い設計仮定のもとで、$ p > n $ である高次元スパース回帰において、指数型重み推定法が確率的スパarsityオラクル不等式を達成できるか?
  • RQ2高次元設定において、Lassoと比較して、提案手法の統計的性能と計算可能性はどのように異なるか?
  • RQ3指数型重みフレームワークにおいて、バイアスとバリアンスのトレードオフを最適にバランスさせる正則化パrameter $ \lambda $ の最適選択は何か?
  • RQ4PAC-Bayesian理論は、スパース回帰推定法の真の過剰リスクに対する高確率境界を効果的に導出できるか?
  • RQ5予測リスクの明示的依存関係とスパarsityレベル $ p_0 $、サンプルサイズ $ n $、次元 $ p $ におけるスケーリングは何か?

主な発見

  • 提案された指数型重み推定法は、確率的スパarsityオラクル不等式を達成する。確率 $ 1 - \varepsilon $ 以上で、真の過剰リスクは $ R(\bar{\theta}) + \mathcal{O}\left(\frac{p_0 \log(p/n)}{n}\right) $ で有界であり、$ p_0 $ は非ゼロ係数の数である。
  • 境界には、経験的リスクによる推定誤差を反映する項 $ \frac{3L^2}{n^2} $ が含まれており、$ n \to \infty $ のとき消える。
  • 最終的な高確率境界は、$ \frac{8\mathcal{C}_1}{n} \left( |J(\bar{\theta})| \log(K+1) + |J(\bar{\theta})| \log\left(\frac{enp}{\alpha|J(\bar{\theta})|}\right) + \log\left(\frac{2}{\varepsilon(1 - \alpha)}\right) \right) $ と表され、$ p_0 $ および $ n $ に有利に依存する。
  • 設計行列に対する強い仮定(Lassoが高速収束率を達成するために必要とする制限的固有値条件など)を要しないため、近似的オラクル性能を達成する。
  • 解析により、組み合わせ最適化を避けており、凸型指数重みに依存するため、$ p $ がやや大きい場合でも計算可能であることが示された。
  • 最終的な境界は非漸近的であり、高確率で成り立つ。期待値に関する先行研究よりも強い有限サンプル保証を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。