[论文解读] Supervised Learning for Multi-Block Incomplete Data
本文提出mdd-sPLS,一种新型的监督多区块偏最小二乘法(PLS),通过一种名为Koh-Lanta的新算法,联合执行变量选择、子空间估计和缺失数据填补。在高维不完整数据设置下,其预测误差最低,显著优于现有两步法(如均值填补、nipals、softImpute和imputeMFA),尤其在区块内与区块间相关性较高的情况下表现更优。
In the supervised high dimensional settings with a large number of variables and a low number of individuals, one objective is to select the relevant variables and thus to reduce the dimension. That subspace selection is often managed with supervised tools. However, some data can be missing, compromising the validity of the sub-space selection. We propose a Partial Least Square (PLS) based method, called Multi-block Data-Driven sparse PLS mdd-sPLS, allowing jointly variable selection and subspace estimation while training and testing missing data imputation through a new algorithm called Koh-Lanta. This method was challenged through simulations against existing methods such as mean imputation, nipals, softImpute and imputeMFA. In the context of supervised analysis of high dimensional data, the proposed method shows the lowest prediction error of the response variables. So far this is the only method combining data imputation and response variable prediction. The superiority of the supervised multi-block mdd-sPLS method increases with the intra-block and inter-block correlations. The application to a real data-set from a rVSV-ZEBOV Ebola vaccine trial revealed interesting and biologically relevant results. The method is implemented in a R-package available on the CRAN and a Python-package available on pypi.
研究动机与目标
- 解决监督学习设置中高维数据存在缺失协变量的挑战。
- 克服现有两步法(先填补后分析)的局限性。
- 开发一种统一方法,同时实现变量选择、子空间估计和缺失数据填补。
- 通过利用区块间相关性,提升不完整多区块数据中响应变量的预测准确性。
- 为具有缺失值的真实生物与生物医学数据集提供计算高效且统计稳健的解决方案。
提出的方法
- 提出mdd-sPLS,一种通过L1-惩罚优化实现变量选择的监督多区块PLS方法。
- 引入Koh-Lanta算法,通过SVD-based填补与PLS-based估计交替进行,实现联合填补与预测。
- 采用数据驱动方法,利用当前PLS成分导出的低秩近似,迭代更新缺失值。
- 应用带L1-范数正则化的稀疏PLS,以在预测变量块和响应变量块中选择相关变量。
- 通过交替优化求解非凸问题,利用调优参数κ降低凹部成分。
- 在分析前对所有数据矩阵进行标准化处理,使其均值为零、标准差为一,以确保各区块间的可比性。
实验结果
研究问题
- RQ1是否可开发一种统一方法,在高维多区块数据中联合完成缺失数据填补与监督预测?
- RQ2mdd-sPLS在预测误差方面与两步法(如先填补后分析)相比表现如何?
- RQ3该方法在区块内与区块间相关性水平变化时是否仍保持优越性能?
- RQ4与现有方法相比,样本量增加如何影响mdd-sPLS的预测准确性?
- RQ5在低相关性环境下(区块结构微弱),mdd-sPLS是否仍具鲁棒性?
主要发现
- 在所有模拟情景中,mdd-sPLS的预测误差(RMSEP)最低,尤其在高区块内与区块间相关性下表现更优。
- 该方法显著优于均值填补、nipals、softImpute和imputeMFA,预测误差始终低于对比方法。
- 在低相关性设置下(ρd = 0.3,ρt = 0.5),所有方法表现相近,RMSEP ≈ 0.73,但Lasso类方法误差更高(≈ 0.83)。
- 随着样本量增加,mdd-sPLS(采用Koh-Lanta)的预测准确性显著提升,甚至优于nipals + 经典sPLS。
- mdd-sPLS结合Koh-Lanta在所有条件下均保持最低误差,尤其在相关性较强时表现卓越。
- 在真实rVSV-ZEBOV埃博拉疫苗数据集中,该方法成功识别出4个相关协变量(每成分2个),并在留一法交叉验证中实现完美分组分配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。