[论文解读] Employing latent variable models to improve efficiency in composite endpoint analysis
本文提出一种潜在变量模型,通过联合建模临床试验中二元应答指数背后的混合尺度结果(连续、有序、二值),以提高复合终点分析的效率。通过假设观测离散结果背后存在潜在连续变量,该方法相比标准逻辑回归的精度最高提升2.5倍,在系统性红斑狼疮试验中可将所需样本量减少60%。
Composite endpoints that combine multiple outcomes on different scales are common in clinical trials, particularly in chronic conditions. In many of these cases, patients will have to cross a predefined responder threshold in each of the outcomes to be classed as a responder overall. One instance of this occurs in systemic lupus erythematosus (SLE), where the responder endpoint combines two continuous, one ordinal and one binary measure. The overall binary responder endpoint is typically analysed using logistic regression, resulting in a substantial loss of information. We propose a latent variable model for the SLE endpoint, which assumes that the discrete outcomes are manifestations of latent continuous measures and can proceed to jointly model the components of the composite. We perform a simulation study and find the method to offer large efficiency gains over the standard analysis. We find that the magnitude of the precision gains are highly dependent on which components are driving response. Bias is introduced when joint normality assumptions are not satisfied, which we correct for using a bootstrap procedure. The method is applied to the Phase IIb MUSE trial in patients with moderate to severe SLE. We show that it estimates the treatment effect 2.5 times more precisely, offering a 60% reduction in required sample size.
研究动机与目标
- 解决标准二元逻辑回归在分析结合多种不同尺度结果类型的复合终点时存在的显著效率损失问题。
- 克服将连续、有序和二值结果合并为单一二元应答变量所导致的信息损失。
- 开发一种联合建模框架,保留原始测量尺度并考虑各组成部分之间的相关性。
- 证明潜在变量方法可显著提高复杂复合终点临床试验中的估计精度,并减少所需样本量。
- 通过自助偏差校正程序确保模型对正态性假设违反的稳健性。
提出的方法
- 将每个观测到的离散结果(连续、有序、二值)建模为潜在连续变量的体现。
- 假设潜在变量服从多元正态分布,以实现复合终点各组成部分的联合估计。
- 使用probit链接函数通过阈值将观测到的离散结果与潜在连续变量关联。
- 通过最大似然法估计模型参数,使用从零开始编写的自定义似然函数。
- 当联合正态性假设被违反时,应用非参数自助程序以校正偏差。
- 通过模拟研究和MUSE试验的真实数据,将潜在变量模型的性能与标准二元逻辑回归及增强二元方法进行比较。
实验结果
研究问题
- RQ1在复合终点分析中,潜在变量模型相较于标准二元逻辑回归,估计精度的提升程度如何?
- RQ2精度提升程度如何随复合终点中不同组成部分驱动应答而变化?
- RQ3违反多元正态性假设对估计偏差的影响如何?是否可有效校正?
- RQ4潜在变量模型能否在使用复杂复合终点的临床试验中减少所需样本量?
- RQ5该方法在具有多个有序或二值组成部分的终点中,计算上是否可行?
主要发现
- 在MUSE试验中,潜在变量模型对治疗效应的估计精度是标准二元逻辑回归的2.5倍,使所需样本量减少60%。
- 精度提升高度依赖于驱动应答的组成部分:在所有四个组成部分均等贡献的基线模拟情景下,精度最高可提升17.5倍。
- 当仅一个连续变量和一个二值变量驱动应答时,该方法相比标准二元方法精度最高提升12倍,相比增强二元方法精度最高提升7倍。
- 在98%的案例中,当一个连续变量和一个二值变量驱动应答时,潜在变量方法提供效率增益,仅<2%的案例未见改善。
- 通过自助程序可有效校正非正态性带来的偏差,确保在模型设定错误时仍能实现稳健推断。
- 计算时间随有序水平数量显著增加:5个有序水平需计算10个概率,而3个有序水平需计算6个概率,凸显其关键可扩展性限制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。