[论文解读] Sublinear expectation linear regression
本文提出了一种次线性期望线性回归模型,以应对模型不确定性下的统计推断问题,其中误差分布的均值不明确,位于一个区间内。该文提出了基于极小化最大优化的估计量,建立了参数估计的渐近正态性,并提出了一种新颖的高维设定下的变量选择方法,为不同于经典方法的非线性期望统计学提供了基础。
Nonlinear expectation, including sublinear expectation as its special case, is a new and original framework of probability theory and has potential applications in some scientific fields, especially in finance risk measure and management. Under the nonlinear expectation framework, however, the related statistical models and statistical inferences have not yet been well established. The goal of this paper is to construct the sublinear expectation regression and investigate its statistical inference. First, a sublinear expectation linear regression is defined and its identifiability is given. Then, based on the representation theorem of sublinear expectation and the newly defined model, several parameter estimations and model predictions are suggested, the asymptotic normality of estimations and the mini-max property of predictions are obtained. Furthermore, new methods are developed to realize variable selection for high-dimensional model. Finally, simulation studies and a real-life example are carried out to illustrate the new models and methodologies. All notions and methodologies developed are essentially different from classical ones and can be thought of as a foundation for general nonlinear expectation statistics.
研究动机与目标
- 建立线性回归在模型不确定性下的统计框架,其中误差均值并非确定已知,而是位于一个区间内。
- 定义次线性期望线性回归模型,并在均值不确定性下证明其可识别性。
- 开发对分布模糊性具有鲁棒性的参数估计与预测方法,特别是采用极小化最大优化。
- 将经典统计推断(如渐近正态性与模型选择)扩展至非线性期望设定。
- 为非线性期望模型中的统计推断提供一种新基础,区别于经典参数、非参数或贝叶斯框架。
提出的方法
- 提出一种次线性期望线性回归模型,其中误差均值不确定且位于已知区间内,利用次线性期望的表示定理。
- 通过在多个分布上对经验风险进行极小化最大优化来定义估计量,确保对模型模糊性的鲁棒性。
- 通过将林德伯格-弗勒利奇中心极限定理应用于极限目标函数,推导出参数估计量的渐近正态性。
- 提出一种基于极小化最大估计的新变量选择方法,实现在均值不确定性下的高维模型选择。
- 利用最小化最大经验风险与最小化包含残差和设计矩阵的凸目标函数之间的等价性。
- 将理论应用于真实数据与模拟研究,验证了该方法在分布模糊性下的鲁棒性与一致性。
实验结果
研究问题
- RQ1当误差均值不确定且位于区间内而非固定时,如何一致地定义线性回归模型?
- RQ2在次线性期望下,哪些估计方法是有效且一致的?它们是否保持经典性质(如渐近正态性)?
- RQ3在模型不确定性下,能否在高维设定中有效执行变量选择?其与经典方法有何不同?
- RQ4在分布模糊性下,所提出的估计量与经典最小二乘或最大似然估计相比如何?
- RQ5非线性期望模型中统计推断的理论基础是什么?它与经典统计学有何不同?
主要发现
- 所提出的回归系数估计量具有渐近正态性,其极限分布通过将林德伯格-弗勒利奇中心极限定理应用于极小化最大目标函数推导得出。
- 估计量具有极小化最大预测性能,即在模糊集内所有可能分布中最小化最坏情况下的预测误差。
- 当真实均值为零时,参数估计量等价于经典最小二乘估计量,但当均值不确定时则不同。
- 变量选择方法在高维设定下具有一致性,能有效识别在模型不确定性下的相关预测变量。
- 模拟研究与关于中国非贷款比率的实际案例分析证实了该模型在均值不确定性下的鲁棒性与实际应用价值。
- 该模型与推断框架与经典统计学根本不同,因其不依赖于单一已知概率分布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。