[論文レビュー] High Dimensional M-Estimation with Missing Outcomes: A Semi-Parametric Framework
本稿は、欠損した結果と高次元の共変量を伴う設定に対して、半パラメトリックで高次元のM推定量フレームワークを提案し、L1正則化付きデバイアス除去二重ロバスト(DDR)推定量を導入する。両方のプロパティススコアおよびアウトカム回帰モデルが正しく指定されている場合、最適な$L_2$誤差率$ \sqrt{s(\log d)/n}$を達成する。一方、片方のモデルのみが正しい場合でも一貫性と二重ロバスト性を維持し、モデル誤指定下でも有効な推論を可能にする。
We consider high dimensional $M$-estimation in settings where the response $Y$ is possibly missing at random and the covariates $\mathbf{X} \in \mathbb{R}^p$ can be high dimensional compared to the sample size $n$. The parameter of interest $\boldsymbolθ_0 \in \mathbb{R}^d$ is defined as the minimizer of the risk of a convex loss, under a fully non-parametric model, and $\boldsymbolθ_0$ itself is high dimensional which is a key distinction from existing works. Standard high dimensional regression and series estimation with possibly misspecified models and missing $Y$ are included as special cases, as well as their counterparts in causal inference using 'potential outcomes'. Assuming $\boldsymbolθ_0$ is $s$-sparse ($s \ll n$), we propose an $L_1$-regularized debiased and doubly robust (DDR) estimator of $\boldsymbolθ_0$ based on a high dimensional adaptation of the traditional double robust (DR) estimator's construction. Under mild tail assumptions and arbitrarily chosen (working) models for the propensity score (PS) and the outcome regression (OR) estimators, satisfying only some high-level conditions, we establish finite sample performance bounds for the DDR estimator showing its (optimal) $L_2$ error rate to be $\sqrt{s (\log d)/ n}$ when both models are correct, and its consistency and DR properties when only one of them is correct. Further, when both the models are correct, we propose a desparsified version of our DDR estimator that satisfies an asymptotic linear expansion and facilitates inference on low dimensional components of $\boldsymbolθ_0$. Finally, we discuss various of choices of high dimensional parametric/semi-parametric working models for the PS and OR estimators. All results are validated via detailed simulations.
研究の動機と目的
- 欠損した結果が存在する高次元M推定量の問題に対処すること。この場合、注目するパラメータ自体が高次元である。
- プロパティススコアまたはアウトカム回帰モデルのいずれかが正しく指定されていても一貫性を保つ二重ロバストで、デバイアス除去され、正則化された推定量を開発すること。
- プロパティススコアおよびアウトカム回帰の作業モデルに対する弱い尾部および高レベルのモデリング仮定の下で、提案された推定量の有限標本性能バウンドを確立すること。
- DDR推定量のデスパーシファイド版を用いて、高次元パrameter $\bm{\theta}_0$ の低次元成分に対する有効な推論を可能にすること。
- 帰納的関数の高次元パラメトリックまたは半パラメトリック作業モデルを選択するための柔軟なフレームワークを提供すること。
提案手法
- スパarsityを仮定した高次元設定に古典的な二重ロバスト推定量を適応させることで、L1正則化付きデバイアス除去二重ロバスト(DDR)推定量を提案する。
- プロパティススコアまたはアウトカム回帰モデルが正しく指定されている限り、二重ロバスト性を満たす高次元適応型二重ロバスト構成を用いる。
- プロパティススコアおよびアウトカム回帰の作業モデルに対する弱い尾部仮定と高レベルの条件の下で、有限標本$L_2$誤差バウンドを確立する。
- 漸近線形展開を満たすDDR推定量のデスパーシファイド版を導入し、$\bm{\theta}_0$ の低次元成分に関する漸近正規性と推論を可能にする。
- 高次元パラメータ$\bm{\theta}_0$ が$s \ll n$ 個の非ゼロ成分を持つスパース構造を示すことを踏まえ、高次元シリーズ推定および正則化技術に依存する。
- 潜在的リスク関数の柔軟な非パラメトリックモデリングを可能にしつつ、有限標本性能保証を維持する半パラメトリックフレームワークを採用する。
実験結果
リサーチクエスチョン
- RQ1欠損した結果と高次元共変量を伴う状況下でも、最適な$L_2$誤差率を維持する高次元M推定量を構築できるか?
- RQ2プロパティススコアまたはアウトカム回帰モデルのいずれかが正しく指定されていても、提案された推定量が二重ロバスト性を保持するか?
- RQ3モデル誤指定および欠損データ下でも、高次元パrameter $\bm{\theta}_0$ の低次元成分に対する有効な推論が可能か?
- RQ4弱い尾部仮定およびモデリング仮定の下で、提案されたDDR推定量の有限標本性能バウンドは何か?
- RQ5帰納的関数の高次元パラメトリックまたは半パラメトリックモデルの選択が、推定量の性能にどのように影響するか?
主な発見
- 提案されたDDR推定量は、プロパティススコアおよびアウトカム回帰モデルが両方とも正しく指定されている場合、最適な$L_2$誤差率$\sqrt{s(\log d)/n}$を達成する。
- プロパティススコアまたはアウトカム回帰モデルのいずれか一方のみが正しく指定されている場合でも、一貫性と二重ロバスト性を維持し、モデル誤指定下でも有効な推論を保証する。
- DDR推定量のデスパーシファイド版は漸近線形展開を満たし、$\bm{\theta}_0$ の低次元成分に関する漸近正規性と有効な推論を可能にする。
- 弱い尾部仮定および作業モデルに関する高レベルの条件の下で、有限標本性能バウンドが確立され、モデル誤指定に対してロバストであることが保証される。
- 詳細なシミュレーションを通じてフレームワークが検証され、さまざまな高次元および欠損データのシナリオにおいて推定量のロバスト性と効率性が示された。
- 本手法は、標準的な高次元回帰、シリーズ推定、および潜在的アウトカムを伴う因果推論に適用可能であり、既存のフレームワークを高次元パラメータに拡張する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。