Skip to main content
QUICK REVIEW

[論文レビュー] Penalized pairwise pseudo likelihood for variable selection with nonignorable missing data

Jiwei Zhao, Yang Yang|arXiv (Cornell University)|Mar 19, 2017
Statistical Methods and Inference参考文献 42被引用数 6
ひとこと要約

本稿では、非無作為な欠損データを伴う高次元一般化線形モデルにおける変数選択のためのペナルティ付き対ごとの仮説尤度法を提案する。非パラメトリックで柔軟な欠損データメカニズムを活用し、同定不能な場合でも推定可能な分散スケーリング済みパラメータに焦点を当てることで、完全なパラメータ同一定が不可能であっても変数選択の一貫性を達成し、モデルの誤指定や非無作為な欠損に対してもロバストである。

ABSTRACT

The regularization approach for variable selection was well developed for a completely observed data set in the past two decades. In the presence of missing values, this approach needs to be tailored to different missing data mechanisms. In this paper, we focus on a flexible and generally applicable missing data mechanism, which contains both ignorable and nonignorable missing data mechanism assumptions. We show how the regularization approach for variable selection can be adapted to the situation under this missing data mechanism. The computational and theoretical properties for variable selection consistency are established. The proposed method is further illustrated by comprehensive simulation studies and real data analyses, for both low and high dimensional settings.

研究の動機と目的

  • データが非無作為に欠損している(MNAR)状況下で、高次元一般化線形モデルにおける変数選択の課題に取り組むこと。この状況では、標準的な尤度法が機能しない。
  • パラメトリックな欠損データメカニズム仮定の限界を克服すること。これは誤指定に敏感であり、MNAR状況ではしばしば適用不能である。
  • 無作為かつ非無作為な両ケースを含む、柔軟で明示的に指定されない欠損データメカニズムに耐えうる、有効で一貫性のある手法を開発すること。
  • 完全なパラメータ推定が欠損データのため同定不能であっても、変数選択における理論的および計算的整合性を確立すること。
  • 強いパラメトリック仮定を避ける一方で、高次元設定下でも選択の一貫性を維持する、ロバストで計算的に実行可能なアプローチを提供すること。

提案手法

  • 非パラメトリックで柔軟な欠損データメカニズムを想定し、条件付き尤度の原則に基づいて対ごとの仮説尤度関数を構築する。
  • 元の回帰パラメータの分散スケーリング版を推定することに焦点を当てる。これは完全な同一定が失敗しても依然として推定可能である。
  • 正則化(LASSO、SCAD、またはMCP)を仮説尤度に適用し、真の係数ベクトルにおけるスパarsityを狙う変数選択を実施する。
  • 反復的アルゴリズム(例:座標デセントまたはマジョライゼーション・ミニマライゼーション)を用いてペナルティ付き仮説尤度を最適化し、スパース解への収束を保証する。
  • 正則性条件のもとで、推定された係数ベクトルのサポートが真のサポートと一致する確率が高くなることを証明することで理論的一致性を確立する。
  • 集中不等式および制限固有値条件を用いて、非凸ペナルティ下でも収束速度および選択の一貫性を導出する。

実験結果

リサーチクエスチョン

  • RQ1非無作為に欠損している(MNAR)状況で、かつ欠損データメカニズムが明示的に指定されていない場合、高次元一般化線形モデルにおける変数選択を一貫して行うことは可能か?
  • RQ2非無作為な欠損に対して有効で、かつ欠損の原因をパラメトリックモデルとして仮定しない仮説尤度アプローチをどのように構築できるか?
  • RQ3部分的な非同一定性があるにもかかわらず、ペナルティ付き対ごとの仮説尤度法が選択の一貫性を達成するための理論的条件は何か?
  • RQ4MNARメカニズム下で、従来の尤度ベースまたはEMベースの手法と比較して、本手法の性能はいかがであるか?
  • RQ5真の係数ベクトルがスパースであり、予測変数の数が標本サイズとともに増加する場合でも、本手法は選択の一貫性を維持できるか?

主な発見

  • 提案されたペナルティ付き対ごとの仮説尤度法は、非無作為なケースを含む柔軟で明示的に指定されない欠損データメカニズムのもとで、変数選択の一貫性を達成する。
  • 完全なパラメータ同一定が不可能であっても、推定されたモデルのサポートが真のモデルのサポートと高確率で一致することが保証される。
  • 理論的分析により、正則性条件のもとで推定器がオракル推定器に収束することが示された。特に $ s^* \sqrt{\log p / n} = o_p(1) $ を満たすことで一貫性が保証される。
  • パラメータ推定器の収束速度は $ \| \widehat{\bm{\gamma}}^{(l)} - \bm{\gamma}^* \|_2 \leq c_{14} \rho_*^{-1} \sqrt{s^*} \lambda $ で有界であり、真のパラメータへの収束速度を支持する。
  • 欠損データメカニズムの仮定が非パラメトリックであるため、誤ったパラメトリックモデル化によるバイアスを回避でき、モデルの誤指定に対してもロバストである。
  • シミュレーションおよび実データからの数値結果により、非無作為な欠損状況下でも関連変数を正しく同定できることを確認した。MNAR状況ではMARベースの手法を上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。