[论文解读] Tree-Values: selective inference for regression trees
本文提出了一种针对回归树的筛选推断框架,通过基于从数据中选择的特定树结构进行条件化,控制第一类错误并实现名义覆盖率。该框架提出了一种用于比较终端节点之间均值响应的筛选Z检验,以及针对单个节点均值的置信区间,通过定制的条件集实现高效计算,并在模拟数据和一项营养学研究的真实数据中得到验证。
We consider conducting inference on the output of the Classification and Regression Tree (CART) (Breiman et al., 1984) algorithm. A naive approach to inference that does not account for the fact that the tree was estimated from the data will not achieve standard guarantees, such as Type 1 error rate control and nominal coverage. Thus, we propose a selective inference framework for conducting inference on a fitted CART tree. In a nutshell, we condition on the fact that the tree was estimated from the data. We propose a test for the difference in the mean response between a pair of terminal nodes that controls the selective Type 1 error rate, and a confidence interval for the mean response within a single terminal node that attains the nominal selective coverage. Efficient algorithms for computing the necessary conditioning sets are provided. We apply these methods in simulation and to a dataset involving the association between portion control interventions and caloric intake.
研究动机与目标
- 为解决由于数据驱动的树构建导致的选择偏差,回归树缺乏有效统计推断的问题。
- 开发一个有限样本框架,控制CART树中均值响应比较和估计的筛选第一类错误与筛选覆盖率。
- 提供计算高效的条件集方法,在不牺牲统计效能或精度的前提下保持统计有效性。
- 通过模拟和对卡路里摄入研究的真实世界应用,展示该框架的稳健性与实际应用价值。
提出的方法
- 基于从数据中选择特定CART树结构的事件进行条件化,利用筛选推断校正选择偏差。
- 提出一种用于比较两个终端节点之间均值响应差异的筛选Z检验,p值在条件事件下计算。
- 使用相同的条件化框架构建单个终端节点内均值响应的置信区间,以确保名义上的筛选覆盖率。
- 开发高效算法以计算必要的条件集,包括使用恒等置换的计算高效近似方法。
- 使用完整条件集保证理论有效性,使用恒等置换实现计算效率,经验验证表明性能损失可忽略不计。
- 使用均方误差(SSE)或保守估计量(cons)来估计残差方差,以在非正态性条件下保持稳健性。
实验结果
研究问题
- RQ1筛选推断能否应用于回归树,以在检验终端节点均值差异时控制筛选第一类错误率?
- RQ2所提出的方法在单个终端节点内均值响应的置信区间中是否实现名义上的筛选覆盖率?
- RQ3与使用恒等置换的计算高效近似相比,完整条件集在统计效能和区间宽度方面的表现如何?
- RQ4当响应变量违反正态性假设时,筛选推断框架是否仍具有稳健性?
- RQ5与样本分割法和CTree相比,该方法在有限样本中的统计效能和覆盖率表现如何?
主要发现
- 基于完整条件集的筛选Z检验即使在正态性假设被违反的情况下,也能在原假设下控制筛选第一类错误率,仅在极端情况(如伯努利(0.1))下例外。
- 使用恒等置换代替完整条件集导致的效能损失可忽略不计,仅在仔细检查效能曲线时可见微小差异。
- 基于恒等置换的置信区间略宽于基于完整条件集的区间,但差异仅在样本量较小时最为明显。
- 在全局原假设下,该方法对泊松(10)、伯努利(0.5)和伽马(1,10)分布的p值近似均匀,表明对非正态性的稳健性。
- 在Box Lunch研究应用中,筛选推断框架产生的p值和置信区间在不同方差估计量(包括保守估计量)下保持一致,结果有效。
- 在有限样本模拟中,该框架在效能和精度方面优于样本分割法和CTree,尤其在剪枝操作涉及时表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。