Skip to main content
QUICK REVIEW

[論文レビュー] Tree-Values: selective inference for regression trees

Anna Neufeld, Lucy L. Gao|PubMed|Jun 15, 2021
Statistical Methods and Inference参考文献 17被引用数 10
ひとこと要約

本稿では、データから選択された特定の木構造を条件付けることで、第一種誤りを制御し、名目上のカバレッジを達成する、回帰木における選択的仮説検定フレームワークを導入する。終端ノード間の平均応答を比較するための選択的Z検定と、単一のノードの平均に対する信頼区間を提案し、特化した条件付き集合を用いた効率的な計算が可能であり、シミュレーションおよび栄養研究からの実データを用いた検証が行われた。

ABSTRACT

We consider conducting inference on the output of the Classification and Regression Tree (CART) (Breiman et al., 1984) algorithm. A naive approach to inference that does not account for the fact that the tree was estimated from the data will not achieve standard guarantees, such as Type 1 error rate control and nominal coverage. Thus, we propose a selective inference framework for conducting inference on a fitted CART tree. In a nutshell, we condition on the fact that the tree was estimated from the data. We propose a test for the difference in the mean response between a pair of terminal nodes that controls the selective Type 1 error rate, and a confidence interval for the mean response within a single terminal node that attains the nominal selective coverage. Efficient algorithms for computing the necessary conditioning sets are provided. We apply these methods in simulation and to a dataset involving the association between portion control interventions and caloric intake.

研究の動機と目的

  • データ駆動の木構造生成による選択バイアスのため、回帰木における有効な統計的推論が不足している問題に対処すること。
  • CART木における平均応答の比較および推定について、有限標本フレームワークとして選択的第一種誤りと選択的カバレッジを制御すること。
  • 統計的妥当性を損なわずにパワーまたは精度を落とさない、条件付き集合の計算効率の良い手法を提供すること。
  • シミュレーションおよびカロリー摂取量の研究への実世界応用を通じて、フレームワークの頑健性と実用的有用性を示すこと。

提案手法

  • データから特定のCART木構造が選択されたという事象を条件付け、選択バイアスを補正するための選択的仮説検定を用いる。
  • 2つの終端ノード間の平均応答の差を検定するための選択的Z検定を提案し、p値は条件付けられた事象の下で計算する。
  • 同じ条件付け枠組みを用いて、単一の終端ノード内の平均応答の信頼区間を構築し、名目的選択的カバレッジを確保する。
  • 必要な条件付き集合を計算するための効率的なアルゴリズムを開発し、恒等置換を用いた計算効率の良い近似も含む。
  • 理論的妥当性のための完全な条件付き集合と、計算効率のための恒等置換を用い、性能損失が最小限であることを実証的に検証する。
  • 残差分散の推定には、平均二乗誤差(SSE)または保守的推定子(cons)を用い、正規性の不満たす状況下でも頑健性を維持する。

実験結果

リサーチクエスチョン

  • RQ1選択的仮説検定を回帰木に適用することで、終端ノードの平均応答の差を検定する際、選択的第一種誤り率を制御できるか?
  • RQ2提案手法が、個々の終端ノード内の平均応答の信頼区間に対して名目的選択的カバレッジを達成するか?
  • RQ3恒等置換を用いた計算効率の良い近似と完全な条件付き集合との間で、パワーおよび区間幅の観点から性能に差は生じるか?
  • RQ4応答変数の正規性の仮定が満たされない場合でも、選択的仮説検定フレームワークは頑健か?
  • RQ5有限標本におけるパワーとカバレッジの観点から、本手法はサンプル分割法およびCTreeと比較して優れているか?

主な発見

  • 完全な条件付き集合に基づく選択的Z検定は、正規性仮定が満たされない場合でも、帰無仮説の下で選択的第一種誤り率を制御する(ベルヌーイ(0.1)のような極端な状況を除く)。
  • 完全な条件付き集合から恒等置換への置き換えによるパワー損失は無視できるほど小さく、パワー曲線を詳細に検討してもわずかな差異しか認められない。
  • 恒等置換に基づく信頼区間は完全な条件付き集合に基づくものよりわずかに広いが、これはサンプルサイズが小さい場合にのみ顕著に現れる。
  • ポアソン(10)、ベルヌーイ(0.5)、ガンマ(1,10)分布の下で、グローバル帰無仮説の下でp値がほぼ一様になることが確認され、非正規性に対する頑健性が示された。
  • ボックスランチ研究への応用では、選択的仮説検定フレームワークが、保守的推定子を含むさまざまな分散推定子に対して一貫した有効なp値と信頼区間を生成した。
  • 特に剪定が行われる状況において、有限標本シミュレーションにおいて、サンプル分割法およびCTreeに比べ、パワーと精度の両面で本フレームワークが優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。