Skip to main content
QUICK REVIEW

[論文レビュー] Post-Regularization Confidence Bands for High Dimensional Nonparametric Models with Local Sparsity

Junwei Lu, Mladen Kolar|arXiv (Cornell University)|Mar 10, 2015
Statistical Methods and Inference参考文献 68被引用数 6
ひとこと要約

本稿では、関心のある説明変数の周囲で局所的なスパarsityパターンを許容することで、スパース加法モデルを一般化する高次元非パラメトリックモデルATLASを提案する。局所的カーネル回帰とBスプライン近似を組み合わせたカーネルシーブ推定量を提案し、マージナル影響関数 $ f_j^* $ を推定することで、上限ノルムにおける最適収束速度を達成し、統計的・計算的トレードオフを制御した有効な信頼区間の構築を可能にする。

ABSTRACT

We propose a novel high dimensional nonparametric model named ATLAS which naturally generlizes the sparse additive model. Given a covariate of interest $X_j$, the ATLAS model assumes the mean function can be locally approximated by a sparse additive function whose sparsity pattern may vary from the global perspective. We propose to infer the marginal influence function $f_j^*(z) = \mathbb{E}[f(X_1,\ldots, X_d) \mid X_j = z]$ using a new kernel-sieve approach that combines the local kernel regression with the B-spline basis approximation. We prove the rate of convergence for estimating $f_j^*$ under the supremum norm. We also propose two types of confidence bands for $f_j^*$ and illustrate their statistical-comptuational tradeoffs. Thorough numerical results on both synthetic data and real-world genomic data are provided to demonstrate the efficacy of the theory.

研究の動機と目的

  • 高次元非パラメトリックモデルにおけるグローバルスパarsity仮定の制限を克服するため、関心のある説明変数の周囲で局所的スパarsityパターンを許容するモデルを導入すること。
  • 真の平均関数が局所的構造を示す高次元設定において、マージナル影響関数 $ f_j^* $ を推定する手法を開発すること。
  • 設計および誤差分布に関する正則性条件の下で、提案手法の推定量の上限ノルムにおける収束速度に関する理論的保証を確立すること。
  • 統計的精度と計算効率の両立を図った、$ f_j^* $ に対する有効な信頼区間の構築方法を提供すること。
  • 合成データおよび実世界のゲノムデータ上で本手法を実証的に評価し、実用的有効性を示すこと。

提案手法

  • 平均関数が、説明変数に依存するスパース加法関数によって局所的に近似可能であると仮定するATLASモデルを提案する。
  • 局所的カーネル回帰とBスプライン基底近似を組み合わせたカーネルシーブアプローチを用い、マージナル影響関数 $ f_j^* $ を推定する。
  • 2段階推定手順を採用する:第1段階では、$ X_j = z $ の周囲で局所的カーネル重み付けを行う。第2段階では、条件付き平均関数をBスプライン基底展開でモデル化する。
  • 設計および誤差分布に関する正則性条件の下で、推定量の上限ノルムにおける収束速度を導出する。
  • 信頼区間の構築に向け、カバレッジ精度と計算コストのトレードオフが異なる2種類の信頼区間を提案する。
  • 高次元設定における推定の安定性と推論の信頼性を向上させるために、後処理正則化技術を適用する。

実験結果

リサーチクエスチョン

  • RQ1関心のある特定の説明変数の周囲でスパarsityパターンが変化する高次元非パラメトリックモデルを構築することは可能か?
  • RQ2このようなモデルにおいて、上限ノルムにおけるマージナル影響関数 $ f_j^* $ の推定の最適収束速度は何か?
  • RQ3統計的信頼性と計算可能性の両立を図る上で、$ f_j^* $ に対する有効な信頼区間をどのように構築できるか?
  • RQ4局所的スパarsityの下で、異なる信頼区間構築戦略に内在する統計的・計算的トレードオフは何か?
  • RQ5提案手法は、合成データおよび実世界のゲノムデータにおいて有限標本でも良好な性能を示すか?

主な発見

  • 提案されたカーネルシーブ推定量は、局所的スパarsityを有する高次元非パラメトリックモデルにおいて、上限ノルムにおける収束速度が最適であることを示した。
  • カバレッジ精度と計算複雑性のトレードオフが異なる2種類の信頼区間構築法を提案した。
  • 合成データにおいて、本手法は良好な実証的性能を示し、局所的スパarsityパターンを正しく同定し、真のマージナル影響関数を回復した。
  • 実世界のゲノムデータにおいて、ATLASモデルは生物学的に意味のある影響を持つ説明変数を効果的に同定し、グローバルスパarsityに基づく代替手法を上回る性能を示した。
  • 理論的分析により、説明変数の数が標本サイズとともに増大する状況でも、推定量が良好な有限標本性能を維持することが確認された。
  • 後処理正則化技術は、高次元領域における推定の安定性と推論の信頼性を顕著に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。