Skip to main content
QUICK REVIEW

[论文解读] Semiparametric Mixtures of Regressions with Single-index for Model Based Clustering

Sijia Xiang, Weixin Yao|arXiv (Cornell University)|Aug 11, 2017
Bayesian Methods and Mixture Models参考文献 21被引用 4
一句话总结

该论文提出了两种半参数混合回归模型——单指数模型混合(MSIM)和变化单指数比例的回归模型混合(MRSIP)——通过单指数结构降低高维预测变量的影响,实现在无维度灾难情况下的非参数建模。该方法采用改进的期望最大化(EM)算法结合后向调整法,实现最优收敛速度,并在模拟数据和NBA数据上表现出优越的聚类与预测性能,尤其在高维设置下表现更佳。

ABSTRACT

In this article, we propose two classes of semiparametric mixture regression models with single-index for model based clustering. Unlike many semiparametric/nonparametric mixture regression models that can only be applied to low dimensional predictors, the new semiparametric models can easily incorporate high dimensional predictors into the nonparametric components. The proposed models are very general, and many of the recently proposed semiparametric/nonparametric mixture regression models are indeed special cases of the new models. Backfitting estimates and the corresponding modified EM algorithms are proposed to achieve optimal convergence rates for both parametric and nonparametric parts. We establish the identifiability results of the proposed two models and investigate the asymptotic properties of the proposed estimation procedures. Simulation studies are conducted to demonstrate the finite sample performance of the proposed models. An application of NBA data by new models reveals some new findings.

研究动机与目标

  • 解决高维预测变量下半参数/非参数混合回归模型中的维度灾难问题。
  • 开发灵活的半参数模型,放宽传统混合回归模型中强参数假设,同时保持可解释性。
  • 通过单指数结构实现对分量均值、方差和比例的非参数估计,以降低维度。
  • 在较弱正则性条件下,建立所提模型的可识别性与渐近性质。
  • 通过模拟研究与真实NBA数据分析,展示聚类与预测性能的提升。

提出的方法

  • 提出单指数模型混合(MSIM):$ Y|\mathbf{x} \sim \sum_{j=1}^{k} \pi_j(\mathbf{\alpha}^T\mathbf{x}) \phi(Y_i | m_j(\mathbf{\alpha}^T\mathbf{x}), \sigma_j^2(\mathbf{\alpha}^T\mathbf{x})) $,其中索引 $ \mathbf{\alpha}^T\mathbf{x} $ 将高维非参数估计简化为单变量平滑。
  • 提出变化单指数比例的回归模型混合(MRSIP):$ Y|\mathbf{x} \sim \sum_{j=1}^{k} \pi_j(\mathbf{\alpha}^T\mathbf{x}) \phi(Y_i | \mathbf{x}^T\mathbf{\beta}_j, \sigma_j^2) $,通过单指数非参数建模分量比例,同时保持回归函数为线性。
  • 开发改进的EM算法并结合后向调整法,同步估计参数部分(如 $ \mathbf{\beta}_j $)与非参数部分(如 $ m_j(\cdot), \pi_j(\cdot) $),实现最优收敛速度。
  • 采用核回归对沿单指数方向的非参数函数进行估计,避免直接的多变量核平滑。
  • 使用交叉验证进行带宽选择与模型比较,真实数据评估中采用蒙特卡洛交叉验证。
  • 在较弱正则性条件下建立两种模型的可识别性,并推导估计量的渐近性质。

实验结果

研究问题

  • RQ1单指数结构能否有效降低高维预测变量下非参数混合回归模型的维度?
  • RQ2所提出的MSIM与MRSIP模型是否在聚类与预测准确率方面优于传统参数与半参数混合模型?
  • RQ3改进的EM算法结合后向调整法能否在这些模型中实现对参数与非参数分量的最优收敛速度?
  • RQ4在较弱正则性条件下,所提模型是否具有可识别性?其估计量的渐近性质如何?
  • RQ5在实际应用中,如使用高维预测变量对NBA球员表现进行聚类时,模型表现如何?

主要发现

  • 在模拟研究中,MRSIP(S)与MRSIP(T)在单指数参数估计上的均方误差(MSE)显著低于MixLinReg,当n=800时,MSE分别为0.892、0.979与0.969,而MixLinReg的MSE为28.04。
  • 在n=800时,MRSIP(T)的分量比例RASE(相对平均平方误差)为9.960,而MixLinReg为28.04,表明比例估计有显著改进。
  • 在NBA数据中,MSIM模型识别出MPG(每场出场时间)为最具影响力的预测变量,$ \mathbf{\alpha} $ 的95%置信区间覆盖(0.134, 0.541)、(0.715, 0.949)与(0.202, 0.679),表明其对每场得分有显著影响。
  • 在5折、10折与蒙特卡洛交叉验证中,MSIM与MRSIP在预测精度上均优于线性回归与混合线性回归模型,且MSIM在预测误差上优于MRSIP。
  • 这两个模型是现有模型的推广:当k=1时,MSIM退化为单指数模型;当x为标量时,退化为Huang等(2013)的非参数混合模型。
  • 所提模型在较弱正则性条件下具有可识别性,且改进的EM算法结合后向调整法对参数与非参数分量均实现了最优收敛速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。