[论文解读] Towards a power analysis for PLS-based methods
本文提出了一种基于蒙特卡洛模拟的新型偏最小二乘法(PLS)方法统计功效分析框架,明确保留了从试点数据中获得的潜在结构和相关性结构,以估计统计功效和最优样本量。该方法利用PLS导出的权重和得分,在备择假设下模拟多元数据,从而实现对组学研究中分类任务的精确功效估计。
In recent years, power analysis has become widely used in applied sciences, with the increasing importance of the replicability issue. When distribution-free methods, such as Partial Least Squares (PLS)-based approaches, are considered, formulating power analysis turns out to be challenging. In this study, we introduce the methodological framework of a new procedure for performing power analysis when PLS-based methods are used. Data are simulated by the Monte Carlo method, assuming the null hypothesis of no effect is false and exploiting the latent structure estimated by PLS in the pilot data. In this way, the complex correlation data structure is explicitly considered in power analysis and sample size estimation. The paper offers insights into selecting statistical tests for the power analysis procedure, comparing accuracy-based tests and those based on continuous parameters estimated by PLS. Simulated and real datasets are investigated to show how the method works in practice.
研究动机与目标
- 解决在多变量数据分析中,针对无分布假设、无似然函数的PLS方法缺乏可靠功效分析方法的问题。
- 克服传统功效分析在高维、强相关性及小样本量设置下(在组学研究中常见)的局限性。
- 开发一种模拟框架,尊重PLS模型中真实的协变量结构和潜在变量结构。
- 比较不同统计检验方法——基于准确率的检验与基于连续参数的检验——在PLS框架下的功效分析中的表现。
- 提供一个透明、易用的R软件包实现,以支持可重复研究并促进在实际研究中的应用。
提出的方法
- 使用蒙特卡洛方法模拟人工数据集,保留由试点数据中PLS估计出的潜在结构(权重和得分)。
- 生成与试点数据具有相同协方差结构但样本量不同的新数据集,以评估不同设计下的统计功效。
- 对模拟数据集应用PLS以估计模型参数,并在备择假设下评估检验统计量。
- 在功效分析过程中同时使用基于准确率的检验(如分类错误率)和基于连续参数的检验(如潜在变量载荷)。
- 采用置换检验评估显著性并控制模拟框架中的第一类错误率。
- 将该方法实现为R软件包,以确保透明性、可重复性和研究人员的可及性。
实验结果
研究问题
- RQ1当传统参数假设不成立时,如何对PLS方法可靠地进行功效分析?
- RQ2从试点数据中保留潜在结构和相关性结构对PLS模型功效估计的准确性有何影响?
- RQ3在基于PLS的分类中,基于准确率的检验与基于连续参数的检验在统计功效和第一类错误控制方面有何差异?
- RQ4在现实数据相关结构下,进行病例对照PLS-DA研究时,需要多大的样本量才能达到足够的统计功效?
- RQ5基于PLS导出的成分的模拟方法是否能在高维组学数据的样本量估计中优于现有方法?
主要发现
- 所提出的方法在模拟数据集中成功保留了试点数据中复杂的相关性结构和潜在变量关系,从而实现了真实可靠的功效估计。
- 基于PLS的模拟框架显示,样本量需求对潜在成分数量(A)和数据中的效应大小高度敏感。
- 在100次蒙特卡洛模拟和200次置换检验下,该方法可获得稳定的功效估计,95%置信区间提供了可靠的精度。
- 基于准确率的检验在小样本量情况下统计功效低于基于连续参数的检验。
- 该模拟框架在A=3个成分的病例对照PLS-DA设置下,正确识别出实现80%功效的最优样本量。
- R软件包的实现使研究人员能够自信且透明地复制和应用该方法于真实组学数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。