Skip to main content
QUICK REVIEW

[论文解读] plsRglm: Partial least squares linear and generalized linear regression for processing incomplete datasets by cross-validation and bootstrap techniques with R

Frédèric Bertrand, Myriam Maumy‐Bertrand|arXiv (Cornell University)|Oct 1, 2018
Spectroscopy and Chemometric Analyses参考文献 7被引用 8
一句话总结

plsRglm 包为线性模型和广义线性模型中的偏最小二乘回归(PLS)提供了全面的 R 解决方案,通过先进的交叉验证和自助抽样技术支持不完整数据集。该包支持稳健的模型选择、通过 $BC_a$ 置信区间评估预测变量的显著性,并提供图形诊断工具。主要贡献包括缺失数据处理、PLSGLR 的扩展,以及在高维或共线性数据中实现稳定推断。

ABSTRACT

The aim of the plsRglm package is to deal with complete and incomplete datasets through several new techniques or, at least, some which were not yet implemented in R. Indeed, not only does it make available the extension of the PLS regression to the generalized linear regression models, but also bootstrap techniques, leave-one-out and repeated $k$-fold cross-validation. In addition, graphical displays help the user to assess the significance of the predictors when using bootstrap techniques. Biplots (Fig. 4) can be used to delve into the relationship between individuals and variables.

研究动机与目标

  • 解决现有 R 包中 PLS 方法缺乏对缺失数据支持的问题,这些包通常会删除或拒绝不完整观测值。
  • 将偏最小二乘回归(PLS)扩展至广义线性模型(PLSGLR),以分析二值、计数及其他非正态响应变量。
  • 实施自助抽样技术(Y,T)和(Y,X),以评估高维或共线性数据集中预测变量的显著性与模型稳定性。
  • 提供基于交叉验证的准则(如 $Q^2$、PRESS、误分类率)和信息准则(AIC、BIC),并引入自由度校正以实现最优成分选择。
  • 开发图形工具(如双标图、自助置信区间),以辅助复杂数据集中 PLS 模型的解释与稳健性评估。

提出的方法

  • 利用 PLSR 和 PLSGLR 框架建模预测变量与响应变量之间的关系,即使在预测变量高度共线性或数量超过观测值时亦可适用。
  • 应用重复 $k$-折交叉验证(如 100×8 折)来估计模型性能,并使用 $Q^2$、误分类率、AIC 和 BIC 等准则选择最优成分数量。
  • 实施两种自助抽样方案:$(Y,X)$ 和 $(Y,T)$,后者在广义线性模型中速度更快且更稳定。
  • 计算回归系数的 $BC_a$ 自助置信区间以评估预测变量的显著性,相关可视化由该包提供。
  • 提出一种稳健的显著性指数 $\pi_e$,通过聚合不同成分数量模型中的显著性结果,以考虑成分数量误设的影响。
  • 支持多种链接函数(如二值结果的 logit 函数),并通过 PLSGLR 处理由有序、二项、泊松和负二项分布构成的多种响应类型。

实验结果

研究问题

  • RQ1如何在高维或不完整数据集中有效将 PLS 回归扩展至广义线性模型(PLSGLR),同时保持稳健性?
  • RQ2在存在缺失数据或强预测变量共线性的情况下,哪些交叉验证与信息准则最可靠地用于选择最优 PLS 成分数量?
  • RQ3不同的自助抽样策略($(Y,X)$ 与 $(Y,T)$)如何影响广义线性模型中 PLS 预测变量的稳定性和显著性评估?
  • RQ4双标图和自助置信区间等图形工具在复杂生物或医学数据集中在多大程度上提升了 PLS 模型的可解释性与可靠性?
  • RQ5如何构建一种稳健的显著性指数 $\pi_e$,以考虑通过交叉验证选择成分数量时的不确定性?

主要发现

  • 基于 100 次重复的 8 折交叉验证,4 成分 PLS 二值逻辑回归模型被选中,其误分类率最低(104 个观测值中 55 个误分类),且在各次重复中表现一致。
  • 使用 1000 次重抽样的 $BC_a$ 自助方法,仅在 33 个预测变量中有 9 个在 5% 水平下与零无显著差异。
  • 4 成分模型的估计系数为 $\hat{c}_1 = 1.4274$,$\hat{c}_2 = 0.5096$,$\hat{c}_3 = 0.6903$,$\hat{c}_4 = 0.7930$,截距项为 $\hat{\mu} = -0.2968$,响应变量 $y=1$ 的概率通过 logit 链接函数建模。
  • $BC_a$ 自助置信区间显示,多个预测变量在 1 至 8 个成分的模型中均保持显著,表明其具有强稳定性。
  • 稳健显著性指数 $\pi_e$ 表明,即使在成分数量变化时,预测变量的显著性也相对稳定,降低了因成分选择错误导致的假阳性风险。
  • $(Y,T)$ 自助方法在广义线性模型中显著快于 $(Y,X)$,且更稳定,尽管两者结果差异明显,凸显了方法选择的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。