QUICK REVIEW
[论文解读] Provable More Data Hurt in High Dimensional Least Squares Estimator
Zeng Li, Chuanlong Xie|arXiv (Cornell University)|Aug 14, 2020
Random Matrices and Applications参考文献 35被引用 6
一句话总结
本文建立了高维最小二乘回归中预测风险的首个有限样本中心极限定理,证明在过参数化区域中,由于风险的非单调行为,更多数据反而可能降低性能。利用随机矩阵理论,推导出置信区间,证实当 p/n → c > 1 时存在“更多数据有害”的现象。
ABSTRACT
This paper investigates the finite-sample prediction risk of the high-dimensional least squares estimator. We derive the central limit theorem for the prediction risk when both the sample size and the number of features tend to infinity. Furthermore, the finite-sample distribution and the confidence interval of the prediction risk are provided. Our theoretical results demonstrate the sample-wise nonmonotonicity of the prediction risk and confirm "more data hurt" phenomenon.
研究动机与目标
- 严格刻画高维最小二乘估计中预测风险的有限样本分布。
- 解决过参数化模型中‘更多数据有害’的悖论,即样本量增加反而可能恶化预测性能。
- 通过分析二阶波动,为预测风险的非单调行为提供理论基础。
- 推导预测风险的渐近置信区间,使高维设置下的统计推断成为可能。
提出的方法
- 应用随机矩阵理论,特别是线性谱统计的中心极限定理,分析最小二乘估计器的预测风险。
- 在 n 和 p 同时趋于无穷且满足 p/n → c 的渐近框架下,推导预测风险的极限分布。
- 引入标准化检验统计量 T_n, T_{n,0}, T_{n,1}, T_{n,2}, T_{n,3},它们在中心极限定理下收敛于标准正态分布。
- 采用两种类型的预测风险:条件于设计矩阵和系数的预测风险,以及在模型假设下的无条件风险。
- 利用 Bai & Silverstein (2004) 和 Bai et al. (2007) 的理论工具,推导收敛速度和极限方差。
- 通过蒙特卡洛模拟验证理论结果,模拟重复 1000 次,涵盖多种分布(正态分布、伽马分布、t 分布)。
实验结果
研究问题
- RQ1能否通过有限样本分布正式证明高维回归中‘更多数据有害’的现象?
- RQ2当样本量 n 和特征数量 p 同时趋于无穷且满足 p/n → c 时,预测风险如何变化?
- RQ3过参数化线性模型中预测风险的有限样本分布是什么?
- RQ4能否构建反映风险随 n 增加而呈现非单调行为的预测风险置信区间?
- RQ5预测风险的二阶波动如何影响模型性能相对于样本量的单调性?
主要发现
- 在 n,p→∞ 且 p/n→c 的联合渐近框架下,预测风险的有限样本分布收敛于正态分布,从而支持统计推断。
- 预测风险的置信区间表现出非单调行为:在过参数化区域(c>1)中,存在 n₁ < n₂,使得 n₁ 处的置信上限低于 n₂ 处的置信下限,从而证实了‘更多数据有害’。
- 当 c=1/2 时,随着 p 增大,95% 置信区间的经验覆盖概率趋近于 95%,验证了中心极限定理近似的有效性。
- 当 c=2 时,改进统计量 T_{n,3} 的有限样本性能优于 T_{n,2},且随着 p 增大,覆盖概率趋近于名义水平。
- 预测风险呈现出样本尺度的双 descent 曲线,在 p/n≈1 附近风险达到峰值,随后下降,解释了为何更多数据可能有害。
- 理论结果证实,‘更多数据有害’现象源于过参数化与风险二阶波动之间的相互作用,而不仅仅是渐近偏差所致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。