[論文レビュー] A Likelihood Ratio Framework for High Dimensional Semiparametric Regression
本稿は、非凸罰則、欠損データ、モデル不適合の下でも有効な正則化後推論を可能にする高次元半パラメトリック回帰の尤度比フレームワークを提案する。高次U統計量と方向的尤度比を活用することで、ノイズ非パラメトリック部の推定を必要とせず、複雑なデータ設定においても頑健性と効率性を達成する信頼性の高い信頼域と仮説検定を構築する。
We propose a likelihood ratio based inferential framework for high dimensional semiparametric generalized linear models. This framework addresses a variety of challenging problems in high dimensional data analysis, including incomplete data, selection bias, and heterogeneous multitask learning. Our work has three main contributions. (i) We develop a regularized statistical chromatography approach to infer the parameter of interest under the proposed semiparametric generalized linear model without the need of estimating the unknown base measure function. (ii) We propose a new framework to construct post-regularization confidence regions and tests for the low dimensional components of high dimensional parameters. Unlike existing post-regularization inferential methods, our approach is based on a novel directional likelihood. In particular, the framework naturally handles generic regularized estimators with nonconvex penalty functions and it can be used to infer least false parameters under misspecified models. (iii) We develop new concentration inequalities and normal approximation results for U-statistics with unbounded kernels, which are of independent interest. We demonstrate the consequences of the general theory by using an example of missing data problem. Extensive simulation studies and real data analysis are provided to illustrate our proposed approach.
研究の動機と目的
- 不完全なデータと選択バイアスを伴う高次元半パラメトリックモデルの頑健な推論フレームワークの構築を目的とする。
- 信号強度の仮定を必要とせずに、高次元パラメータの低次元成分に対する正則化後推論を可能にする。
- 非凸罰則とモデル不適合の下でも有効な信頼域と仮説検定を構築すること。
- ベース測度関数がタスクごとに異なるマルチタスク学習設定におけるデータ不均一性に対処すること。
- 関心パラメータをノイズ非パラメトリック部から分離する新しい統計的クロマトグラフィー法の提供。
提案手法
- 関心パラメータβとノイズ非パラメトリック部f(·)を分離するためにランクおよび順序統計を利用する正則化付き統計的クロマトグラフィー手法を提案する。
- k次U統計量のランクおよび順序統計に基づく疑似尤度を構築し、f(·)の推定を回避する。
- 仮説検定のための方向的尤度比統計量と、高次元設定における信頼域のための最大方向尤度推定器を導入する。
- 高次U統計量理論を用いて推定器の漸近分布を導出し、非有界カーネルに対する集中不等式を導出する。
- ロジスティック回帰に基づく脱スパース化法を用いてスパースな高次元パラメータを回復する。
- 一般的な推定器bβk = argmax ℓk(β) − ∑pλ(βj)を採用し、bℓk(α) = ℓk(α, bγk + (bαk − α)bwk)として方向的尤度を定義する。
実験結果
リサーチクエスチョン
- RQ1未知のベース測度関数f(·)の推定を回避できる高次元半パラメトリックモデル向けの尤度比フレームワークを開発できるか?
- RQ2非凸罰則を用いる場合やモデル不適合下でも、低次元成分に対する有効な正則化後推論をどのように達成できるか?
- RQ3欠損データと選択バイアスは標準的な正則化推定器にどのような影響を及ぼし、高次元設定ではどのように是正できるか?
- RQ4提案フレームワークは、現実のデータにおける欠損率の増加に対してもパワーと妥当性を維持できるか?
- RQ5データ不均一性下で、方向的尤度比検定は Wald 型検定と比べてどのように頑健性とパワーにおいて優れるか?
主な発見
- 提案された尤度比フレームワークは、10%の欠損率(C = 0.1)下でも、すべての手法においてcg20792833が卵巣がんと有意に関連していることを明確に特定した。
- 10%の欠損率下で、完全ケース脱スパース化法(CC-Desparsity)は有意な遺伝子座標を検出できず、過剰に慎重であることが示された。
- 補完に基づく手法(Imp-Desparsity)は欠損率の影響を強く受け、C = 0.1でのみ追加の遺伝子座標を検出するが、一貫した回復はされなかった。
- 提案された方向的尤度比検定(DLRT)は、中程度の欠損率下でも検出パワーを維持し、C = 0.1でcg20792833を同定した。
- C = 0.2ではDLRTのパワーが低下し、高欠損率に対して感受性があることが示されたが、依然として比較手法を上回った。
- 理論的結果として、方向的尤度推定器の漸近正規性と、非有界カーネルを持つU統計量に対する集中不等式が確立され、これらは独立に価値ある結果である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。