[论文解读] Regression Analysis of Proportion Outcomes with Random Effects
本文提出了一种基于自 resampling 的推断方法的混合效应逻辑斯蒂回归模型,用于处理在 [0,1] 区间内受限的比例结果,尤其适用于数据在端点处高度集中时。通过使用固定效应和随机效应建模比例的对数优势比,并利用非参数自 resampling 方法校正置信区间,该方法在正态近似失效时仍能实现准确的覆盖概率,优于标准方法的模拟研究表现。
A regression method for proportional, or fractional, data with mixed effects is outlined, designed for analysis of datasets in which the outcomes have substantial weight at the bounds. In such cases a normal approximation is particularly unsuitable as it can result in incorrect inference. To resolve this problem, we employ a logistic regression model and then apply a bootstrap method to correct conservative confidence intervals. This paper outlines the theory of the method, and demonstrates its utility using simulated data. Working code for the R platform is provided through the package glmmboot, available on CRAN.
研究动机与目标
- 解决线性回归在 [0,1] 区间受限的比例数据上存在的局限性,尤其当结果在 0 和 1 处聚集时。
- 开发一种回归框架,将 0 和 1 与中间值在概念上视为等同,避免对边界值与连续结果分别建模。
- 在分析中保留试验层面的预测变量,避免因对受试者或条件进行数据聚合而导致效能损失和偏倚。
- 通过应用非参数自 resampling 程序,校正混合效应逻辑斯蒂模型中固有的保守置信区间。
- 为实际研究者提供一种实用且计算可行的方法,通过 CRAN 上的 glmmboot 包提供 R 代码实现。
提出的方法
- 使用逻辑斯蒂链接函数建模期望比例:E[Y_i | x_i] = logit^(-1)(x_i'β + z_i*u),其中 u 代表随机效应。
- 采用混合效应逻辑斯蒂回归框架,联合估计固定效应 β 和随机效应 u,同时容纳受试者层面和试验层面的协变量。
- 应用非参数自 resampling 方法,对残差进行重采样并重新估计模型参数,生成用于推断的经验抽样分布。
- 使用自 resampling 分布的百分位数构造固定效应的置信区间,以校正标准 Wald 区间固有的保守偏差。
- 通过逻辑斯蒂链接函数建模方差结构,控制过度离散化和边界效应,避免对正态性假设的依赖。
- 通过 glmmboot R 包在 R 中实现该方法,使用户能够以最少代码量应用该方法并获得校正后的推断结果。
实验结果
研究问题
- RQ1基于自 resampling 校正的混合效应逻辑斯蒂回归模型能否为在 0 和 1 处具有高密度的质量点、且线性模型因非正态误差和边界违反而失效的比例结果提供有效的推断?
- RQ2与标准 Wald 区间相比,自 resampling 校正如何改善混合效应逻辑斯蒂模型在受限比例上的置信区间覆盖性能?
- RQ3当保留试验层面预测变量时,该方法在保持统计效能和准确性方面表现如何,相较于对受试者或条件进行数据聚合的方法?
- RQ4置信区间性能如何随随机效应结构中水平数的变化而变化?
- RQ5该方法是否可在标准计算资源下实际实现?是否可作为 beta 回归或两部分模型的可行替代方案?
主要发现
- 自 resampling 校正后的置信区间在各种模拟条件下均实现了接近名义水平的覆盖概率(接近 95%),而基础模型则高度保守,当名义显著性水平为 5% 时,仅约 2% 的时间拒绝原假设。
- 即使在随机效应水平数较少时,覆盖概率仍保持稳定且准确,尽管在组大小较大时性能略优。
- 自 resampling 区间系统性地比基础区间更窄,宽度比(自 resampling / 基础)随 Y 的方差增大而减小(即 ρ 减小),表明其具有适当的缩放特性。
- 该方法成功保持了试验层面预测变量的完整性,避免了因数据聚合导致的粒度损失和效能下降。
- 区间宽度比的平滑样条拟合显示,自 resampling 区间相对于基础区间的缩放是恰当的,提示未来应用中可能具有启发式参考价值。
- R 包 glmmboot 支持该方法的实际实现,使研究人员能够将校正后的推断应用于真实世界中的受限比例数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。