Skip to main content
QUICK REVIEW

[论文解读] Model-free controlled variable selection via data splitting

Yixin Han, Xu Guo|arXiv (Cornell University)|Oct 22, 2022
Control Systems and Identification被引用 4
一句话总结

该论文提出了一种在充分降维中无需模型的变量选择方法,通过数据分割控制错误发现率(FDR),且不假设特定回归模型。通过变换响应变量并利用从分割数据中导出的检验统计量的对称性,该方法在保持高统计功效的同时,实现了有限样本和渐近FDR控制,模拟结果表明其性能优于现有方法。

ABSTRACT

Addressing the simultaneous identification of contributory variables while controlling the false discovery rate (FDR) in high-dimensional data is a crucial statistical challenge. In this paper, we propose a novel model-free variable selection procedure in sufficient dimension reduction framework via a data splitting technique. The variable selection problem is first converted to a least squares procedure with several response transformations. We construct a series of statistics with global symmetry property and leverage the symmetry to derive a data-driven threshold aimed at error rate control. Our approach demonstrates the capability for achieving finite-sample and asymptotic FDR control under mild theoretical conditions. Numerical experiments confirm that our procedure has satisfactory FDR control and higher power compared with existing methods.

研究动机与目标

  • 开发一种无模型的变量选择程序,以在高维充分降维中控制错误发现率(FDR)。
  • 解决现有无模型SDR方法在有限样本中缺乏误差率控制的问题。
  • 在不假设参数模型的前提下,有效识别真正有贡献的变量,同时过滤掉无关变量。
  • 在较弱的正则性条件下,实现有限样本和渐近FDR控制。
  • 通过利用对称性性质导出的数据驱动阈值,相较于现有方法提升统计功效和准确性。

提出的方法

  • 该方法将变量选择问题转化为在最小二乘框架下通过多重响应变换对回归系数进行推断。
  • 使用数据分割生成两个独立样本,从而为每个协变量构建对称的检验统计量。
  • 通过对两个数据分割中估计系数差异的分析,推导出对称统计量,确保在原假设下具有全局对称性。
  • 利用对称性性质构建数据驱动的阈值,以控制FDR,且不依赖p值或参数假设。
  • 该程序对底层SDR方法保持无偏性,可与多种现有SDR技术(如SIR或切片逆回归)无缝集成。
  • 通过基于检验统计量对称性的类似 knockoff 的阈值规则实现FDR控制,并在较弱条件下提供理论支持。

实验结果

研究问题

  • RQ1是否存在一种无模型的变量选择程序,可在充分降维中控制错误发现率,且不假设特定参数模型?
  • RQ2如何利用从数据分割中导出的检验统计量的对称性,构建用于FDR控制的数据驱动阈值?
  • RQ3所提出的方法是否在较弱正则性条件下实现有限样本和渐近FDR控制?
  • RQ4在高维设置下,该方法的统计功效与现有无模型及基于模型的变量选择程序相比如何?
  • RQ5该方法是否能灵活地与不同现有SDR方法结合,而不会损害FDR控制性能?

主要发现

  • 所提出的方法在较弱正则性条件下实现了有限样本和渐近FDR控制,包括设计矩的有界性及足够的信号强度。
  • 理论分析表明,FDP(错误发现比例)以概率收敛于不超过名义水平α的值,从而确保FDR控制。
  • 该方法保持了高统计功效,模拟结果表明其在检测真实信号方面优于现有方法。
  • 基于对称性性质导出的数据驱动阈值优于固定阈值,且不依赖p值或渐近近似。
  • 该方法对模型误设具有鲁棒性,可无缝集成于多种SDR技术中,通过仅选择相关预测变量提升可解释性。
  • 数值实验表明,该程序在名义水平下有效控制FDR,且在低维和高维设置下均优于竞争方法,表现出更高的统计功效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。