Skip to main content
QUICK REVIEW

[論文レビュー] Rank-based Lasso -- efficient methods for high-dimensional robust model selection

Wojciech Rejchel, Małgorzata Bogdan|arXiv (Cornell University)|May 14, 2019
Statistical Methods and Inference参考文献 53被引用数 5
ひとこと要約

本稿では、応答変数の値を順位に置き換え、Lasso回帰を適用することで、計算的に効率的な高次元ロバストモデル選択手法であるRankLassoを提案する。順位に基づくLassoの変種として、しきい値付きおよび適応的RankLassoを導入し、重い尾を持つ誤差分布や非線形リンク関数を含むより広い条件下でもモデル選択の一貫性を達成する。シミュレーションおよび実データにおいて、LADLassoを上回る性能を示す。

ABSTRACT

We consider the problem of identifying significant predictors in large data bases, where the response variable depends on the linear combination of explanatory variables through an unknown link function, corrupted with the noise from the unknown distribution. We utilize the natural, robust and efficient approach, which relies on replacing values of the response variables by their ranks and then identifying significant predictors by using well known Lasso. We provide new consistency results for the proposed procedure (called ,,RankLasso") and extend the scope of its applications by proposing its thresholded and adaptive versions. Our theoretical results show that these modifications can identify the set of relevant predictors under much wider range of data generating scenarios than regular RankLasso. Theoretical results are supported by the simulation study and the real data analysis, which show that our methods can properly identify relevant predictors, even when the error terms come from the Cauchy distribution and the link function is nonlinear. They also demonstrate the superiority of the modified versions of RankLasso in the case when predictors are substantially correlated. The numerical study shows also that RankLasso performs substantially better in model selection than LADLasso, which is a well established methodology for robust model selection.

研究の動機と目的

  • 予測子と応答変数の真の関係が未知で、非線形である可能性がある高次元モデル選択の課題に対処すること。
  • 複雑な損失関数と最適化アルゴリズムに依存する従来のロバストな正則化手法に対する、計算的に効率的な代替手法を開発すること。
  • 重い尾を持つ誤差分布や未知のリンク関数を含む弱い分布的仮定のもとでもモデル選択の一貫性を保証すること。
  • 予測子間の相関が強い状況でも有限標本での性能と選択精度を向上させるために、RankLassoにしきい値付きおよび適応的バージョンを拡張すること。
  • 標準LassoやLADLassoが非正規誤差やモデル不適合の状況で失敗するような状況において、提案手法のロバスト性と優位性を示すこと。

提案手法

  • 外れ値や未知の誤差分布への感受性を低減するため、観測された応答変数 $Y_i$ を中心化された順位 $R_i/n - 0.5$ に置き換える。
  • RankLasso推定量を、順位付けされた応答と線形予測子の間の二乗損失を最小化する標準的なLasso問題として定式化する:$\hat{\theta} = \arg\min_\theta \frac{1}{2n}\sum_{i=1}^n (R_i/n - 0.5 - \theta^T X_i)^2 + \lambda \|\theta\|_1$。
  • 初期推定値 $\tilde{\theta}_j$ を用いて $l_1$ 正則化項に重みを付けることで適応的RankLassoを導入し、選択の一貫性を向上させる。$\lambda \sum_j |\theta_j| / |\tilde{\theta}_j|$ を用いる。
  • 推定後に小さな係数をゼロに設定するしきい値付きRankLassoを提案し、スパarsityと選択精度を向上させる。
  • epi収束および $U$-統計量に基づく漸近的理論を用いて、最小限の仮定のもとで推定量の一貫性と漸近正規性を導出する。
  • $\sqrt{n}(\hat{\theta} - \theta^*)$ の収束結果を活用し、変更されたRankLasso推定量の漸近正規性およびモデル選択の一貫性を確立する。

実験結果

リサーチクエスチョン

  • RQ1未知のリンク関数や重い尾を持つ誤差分布を伴う高次元設定において、順位に基づくアプローチが関連予測子の一貫した同定を達成できるか?
  • RQ2予測子間の相関や非正規誤差下で、しきい値付きおよび適応的RankLassoは標準RankLassoに比べてモデル選択性能をどのように向上させるか?
  • RQ3選択精度と計算効率の観点から、LADLassoなどの確立されたロバスト手法に比べてRankLassoはどの程度優れているか?
  • RQ4適応的およびしきい値付きRankLasso推定量がモデル選択の一貫性を達成する条件は何か?
  • RQ5誤差分布の分散が無限大(例:コーシー分布)である場合でも、RankLassoは高い検出力と低い誤発見率を維持できるか?

主な発見

  • 適応的およびしきい値付きRankLasso推定量は、標準RankLassoよりも広い条件下でモデル選択の一貫性($\mathbb{P}(\hat{T}^a = T) \to 1$)を達成する。これは誤差分布の分散が無限大である場合を含む。
  • しきい値付きRankLassoは、予測子間の相関が強く非正規誤差が存在する状況でも、真のモデルを確率1で正しく同定する。
  • シミュレーション研究では、誤差がコーシー分布に従う場合を含め、さまざまな状況下でRankLassoが高い検出力と低い誤発見率(FDR)を維持することが示された。
  • 遺伝子発現データを用いた実データ解析により、外れ値が存在する状況でもLADLassoよりもRankLassoが関連予測子をより正確に同定することが確認された。
  • 適応的RankLasso推定量は漸近正規性を達成し、一貫した変数選択が可能であり、$\sqrt{n}(\hat{\theta}^a_T - \theta^*_T) \to_d -H_1^{-1}(W_T + \bar{c})$ が成り立つ。
  • 提案手法は、特に高次元かつ重い尾を持つ設定において、LADLassoに比べて計算速度と選択精度の両面で顕著に優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。