Skip to main content
QUICK REVIEW

[論文レビュー] Model-free controlled variable selection via data splitting

Yixin Han, Xu Guo|arXiv (Cornell University)|Oct 22, 2022
Control Systems and Identification被引用数 4
ひとこと要約

本稿では、特定の回帰モデルを仮定せずに、データ分割を用いて誤り発見率(FDR)を制御するモデルフリーな変数選択手法を提案する。応答変数を変換し、分割データから得られる検定統計量の対称性を活用することで、有限標本および漸近的FDR制御を達成するとともに、高い検出力を持つ。シミュレーションでは、既存の手法を上回る性能を示した。

ABSTRACT

Addressing the simultaneous identification of contributory variables while controlling the false discovery rate (FDR) in high-dimensional data is a crucial statistical challenge. In this paper, we propose a novel model-free variable selection procedure in sufficient dimension reduction framework via a data splitting technique. The variable selection problem is first converted to a least squares procedure with several response transformations. We construct a series of statistics with global symmetry property and leverage the symmetry to derive a data-driven threshold aimed at error rate control. Our approach demonstrates the capability for achieving finite-sample and asymptotic FDR control under mild theoretical conditions. Numerical experiments confirm that our procedure has satisfactory FDR control and higher power compared with existing methods.

研究の動機と目的

  • 高次元の十分次元削減における誤り発見率(FDR)を制御するモデルフリーな変数選択手順を開発すること。
  • 特に有限標本において、既存のモデルフリーなSDR手法に誤り率制御の欠如がある問題を解決すること。
  • パrametricモデルの仮定なしに、真に寄与する変数を効果的に特定し、情報のない変数を除外すること。
  • ややきつい正則性条件の下で、有限標本および漸近的FDR制御を達成すること。
  • 対称性の性質に基づくデータ駆動型しきい値を用いることで、既存の手法と比較して検出力と正確性を向上させること。

提案手法

  • 変数選択問題を、最小二乗フレームワークにおける複数の応答変数の変換を通じた回帰係数の推論問題に変換する。
  • データ分割を用いて2つの独立な標本を生成し、各共変数に対して対称な検定統計量を構築する。
  • 2つのデータ分割における推定係数の差から導かれる対称統計量は、帰無仮説の下でグローバルな対称性を保証する。
  • 対称性の性質を用いてデータ駆動型しきい値を構築し、p値やパラメトリックな仮定に依存せずにFDRを制御する。
  • この手順は、背後にあるSDR手法に依存せず、SIRやスライス逆回帰などの既存のSDR技術と統合可能である。
  • 検定統計量の対称性に基づくノックオフ風のしきい値ルールを用いることでFDR制御を達成し、ややきつい条件下で理論的裏付けが与えられる。

実験結果

リサーチクエスチョン

  • RQ1特定のパラメトリックモデルを仮定せずに、十分次元削減における誤り発見率(FDR)を制御するモデルフリーな変数選択手順は可能か?
  • RQ2データ分割から得られる検定統計量の対称性をどのように活用し、FDR制御のためのデータ駆動型しきい値を構築できるか?
  • RQ3提案手法は、ややきつい正則性条件の下で、有限標本および漸近的FDR制御を達成するか?
  • RQ4高次元設定において、この手法の検出力は、既存のモデルフリーおよびモデルベースの変数選択手順と比較してどうか?
  • RQ5この手法は、さまざまな既存のSDR手法と柔軟に組み合わせ可能であり、FDR制御を損なわないか?

主な発見

  • 提案手法は、設計モーメントの有界性や十分な信号強度を含むややきつい正則性条件下で、有限標本および漸近的FDR制御を達成する。
  • 理論的解析により、FDP(誤り発見率)が名目水準αに確率的に収束することが示され、FDR制御が保証される。
  • シミュレーションにより、真の信号の検出が優れた性能を示し、高い統計的検出力を維持していることが確認された。
  • 対称性の性質に基づくデータ駆動型しきい値は、固定しきい値を上回り、p値や漸近的近似に依存しない。
  • モデルの誤指定に対してもロバストであり、さまざまなSDR技術とシームレスに統合可能で、関連する予測子のみを選択することで解釈性を高める。
  • 数値実験により、名目水準でのFDR制御が確認され、低次元および高次元の両設定で、競合手法よりも高い検出力を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。