Skip to main content
QUICK REVIEW

[论文解读] A Likelihood Ratio Framework for High Dimensional Semiparametric Regression

Yang Ning, Tianqi Zhao|arXiv (Cornell University)|Dec 6, 2014
Statistical Methods and Inference参考文献 60被引用 9
一句话总结

本文提出了一种高维半参数回归的似然比框架,可在非凸惩罚、缺失数据和模型误设条件下实现有效的后正则化推断。通过利用高阶U统计量和方向似然比,该方法在无需估计干扰非参数分量的情况下构建置信区域和假设检验,从而在复杂数据情境下实现稳健性与效率。

ABSTRACT

We propose a likelihood ratio based inferential framework for high dimensional semiparametric generalized linear models. This framework addresses a variety of challenging problems in high dimensional data analysis, including incomplete data, selection bias, and heterogeneous multitask learning. Our work has three main contributions. (i) We develop a regularized statistical chromatography approach to infer the parameter of interest under the proposed semiparametric generalized linear model without the need of estimating the unknown base measure function. (ii) We propose a new framework to construct post-regularization confidence regions and tests for the low dimensional components of high dimensional parameters. Unlike existing post-regularization inferential methods, our approach is based on a novel directional likelihood. In particular, the framework naturally handles generic regularized estimators with nonconvex penalty functions and it can be used to infer least false parameters under misspecified models. (iii) We develop new concentration inequalities and normal approximation results for U-statistics with unbounded kernels, which are of independent interest. We demonstrate the consequences of the general theory by using an example of missing data problem. Extensive simulation studies and real data analysis are provided to illustrate our proposed approach.

研究动机与目标

  • 开发一种适用于不完全数据和选择偏差的高维半参数模型稳健推断框架。
  • 在无需信号强度假设的前提下,实现对高维参数中低维分量的后正则化推断。
  • 在非凸惩罚和模型误设条件下,构建有效的置信区域和假设检验。
  • 解决多任务学习情境下基测度函数在不同任务间存在差异时的数据异质性问题。
  • 提出一种新型统计色谱法,将感兴趣参数与干扰非参数分量分离。

提出的方法

  • 提出一种基于秩和顺序统计量的正则化统计色谱方法,用于将感兴趣参数β与干扰非参数分量f(·)分离。
  • 基于秩和顺序统计量的k阶U统计量构建伪似然函数,从而避免对f(·)的估计需求。
  • 引入方向似然比统计量用于假设检验,并在高维设置下提出最大方向似然估计器用于构建置信区域。
  • 利用高阶U统计量理论推导估计量的渐近分布,并为无界核函数建立浓度不等式。
  • 采用基于逻辑回归的去稀疏化方法以恢复稀疏高维参数。
  • 使用通用估计器 bβk = argmax ℓk(β) − ∑pλ(βj),并通过 bℓk(α) = ℓk(α, bγk + (bαk − α)bwk) 定义方向似然。

实验结果

研究问题

  • RQ1能否为高维半参数模型构建一种似然比框架,以避免估计未知基测度函数f(·)?
  • RQ2在使用非凸惩罚和模型误设条件下,如何实现对低维分量的有效后正则化推断?
  • RQ3缺失数据和选择偏差对标准惩罚估计量有何影响?在高维设置下如何校正?
  • RQ4所提出的框架在现实世界数据中缺失率增加时是否仍能保持检验效能和有效性?
  • RQ5在数据异质性条件下,方向似然比检验与Wald型检验相比,在稳健性和效能方面表现如何?

主要发现

  • 所提出的似然比框架在所有方法中均成功识别出cg20792833位点与卵巢癌显著相关,即使在10%缺失率(C = 0.1)下依然成立。
  • 在C = 0.1时,完整案例去稀疏化方法(CC-Desparsity)未能检测到任何显著位点,显示出其保守性。
  • 基于插补的方法(Imp-Desparsity)受缺失率影响严重,在C = 0.1时仅检测到额外位点,但这些位点无法稳定恢复。
  • 所提出的定向似然比检验(DLRT)在C = 0.1时保持了检测效能,并成功识别出cg20792833,显示出对中等缺失率的稳健性。
  • 在C = 0.2时,DLRT效能下降,表明对高缺失率敏感,但仍优于对比方法。
  • 理论结果建立了方向似然估计量的渐近正态性,以及无界核函数U统计量的浓度不等式,后者本身具有独立研究价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。