Skip to main content
QUICK REVIEW

[论文解读] Smoothed Quantile Regression with Large-Scale Inference

Xuming He, Xiaoou Pan|arXiv (Cornell University)|Dec 9, 2020
Statistical Methods and Inference参考文献 21被引用 5
一句话总结

本文提出 CONQUER,一种平滑分位数回归方法,通过基于卷积的平滑技术将不可导的分位数损失函数转化为二阶可导、凸的代理损失函数。该方法利用 Barzilai-Borwein 梯度下降实现快速、可扩展的优化,并通过乘子自展法实现有效的大规模推断。主要贡献在于在比经典分位数回归更弱的条件下,建立了估计量的渐近正态性,尤其针对回归变量数量增长的情形。

ABSTRACT

Quantile regression is a powerful tool for learning the relationship between a response variable and a multivariate predictor while exploring heterogeneous effects. In this paper, we consider statistical inference for quantile regression with large-scale data in the "increasing dimension" regime. We provide a comprehensive and in-depth analysis of a convolution-type smoothing approach that achieves adequate approximation to computation and inference for quantile regression. This method, which we refer to as {\it{conquer}}, turns the non-differentiable quantile loss function into a twice-differentiable, convex and locally strongly convex surrogate, which admits a fast and scalable Barzilai-Borwein gradient-based algorithm to perform optimization, and multiplier bootstrap for statistical inference. Theoretically, we establish explicit non-asymptotic bounds on both estimation and Bahadur-Kiefer linearization errors, from which we show that the asymptotic normality of the conquer estimator holds under a weaker requirement on the number of the regressors than needed for conventional quantile regression. Moreover, we prove the validity of multiplier bootstrap confidence constructions. Our numerical studies confirm the conquer estimator as a practical and reliable approach to large-scale inference for quantile regression. Software implementing the methodology is available in the exttt{R} package exttt{conquer}.

研究动机与目标

  • 解决在样本量 n 和维度 p 同时增长的高维、大规模设定下分位数回归面临的计算与推断挑战。
  • 克服分位数损失函数不可导性带来的问题,该问题阻碍了大规模数据中高效优化与推断。
  • 在 p ≍ n^a(a ∈ (0,1))的“维度增加”设定下,开发一种可扩展且统计上有效的推断方法。
  • 建立估计误差与 Bahadur-Kiefer 线性化误差的非渐近界,以在更弱的正则性条件下证明渐近正态性。
  • 提供一种实用、计算高效的框架,用于大规模分位数回归,并通过乘子自展法构建有效的置信区间。

提出的方法

  • 对分位数回归中的检查函数应用基于卷积的平滑,构造出二阶可导、凸且局部强凸的代理损失函数。
  • 采用高斯核平滑方法近似不可导的分位数损失,从而支持基于梯度的方法实现平滑优化。
  • 实现一种快速、可扩展的 Barzilai-Borwein 梯度下降算法,以在大规模设定下高效优化平滑后的损失函数。
  • 推导出平滑估计量的估计误差与 Bahadur-Kiefer 线性化误差的显式非渐近界。
  • 提出并验证一种乘子自展程序,用于构建置信区间,确保在复杂设计与误差分布下的稳健性。
  • 集成带宽选择策略,包括基于 oracle 的 AMSE 选择与默认选择 h_de = {(p + log n)/n}^{2/5},以在平滑过程中平衡偏差与方差。

实验结果

研究问题

  • RQ1能否构造一种平滑损失函数,以在保持统计有效性的同时,实现在大规模分位数回归中的快速、可扩展优化?
  • RQ2当回归变量数量随样本量增长时,平滑估计量在何种条件下可实现渐近正态性?
  • RQ3在不同误差分布下,乘子自展法在覆盖概率与区间宽度方面相较于其他重抽样方法表现如何?
  • RQ4带宽选择对高维分位数回归中估计精度与推断可靠性有何影响?
  • RQ5在大规模设定下,所提方法的计算效率与标准分位数回归及其他平滑方法相比如何?

主要发现

  • CONQUER 估计量在回归变量数量 p 的条件弱于经典分位数回归时实现渐近正态性,具体为当 p ≍ n^a 且 a < 1/2 时。
  • 建立了估计误差与 Bahadur-Kiefer 线性化误差的非渐近界,表明在温和正则性条件下,平滑估计量可一致收敛。
  • 证明了 CONQUER 的乘子自展法在构建置信区间方面是有效的,其经验覆盖概率在各种误差分布与分位数水平下均接近名义水平。
  • 数值研究表明,CONQUER 在估计精度上与标准 QR 相当或更优,且计算速度显著更快,尤其在高维设定下。
  • 该方法在 n 与 p 上均具有高效可扩展性,运行时间呈亚三次方增长,适用于包含超过 200 万个观测值与 920 个协变量的数据集。
  • 通过 h_de = {(p + log n)/n}^{2/5} 选择带宽可实现稳定性能,而基于 oracle 的 AMSE 选择在有限样本中可进一步提升估计精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。