[论文解读] The harm of class imbalance corrections for risk prediction models: illustration and simulation using logistic regression
本研究探讨了在风险预测中,对类别不平衡进行校正的方法——随机欠采样、过采样和SMOTE——对逻辑回归与岭逻辑回归模型的影响。研究结果表明,尽管这些校正方法提高了敏感性和特异性,但会系统性地恶化校准度,导致对少数类概率的过度估计。相比之下,通过调整概率阈值可更可靠地实现敏感性和特异性的提升。
Methods to correct class imbalance, i.e. imbalance between the frequency of outcome events and non-events, are receiving increasing interest for developing prediction models. We examined the effect of imbalance correction on the performance of standard and penalized (ridge) logistic regression models in terms of discrimination, calibration, and classification. We examined random undersampling, random oversampling and SMOTE using Monte Carlo simulations and a case study on ovarian cancer diagnosis. The results indicated that all imbalance correction methods led to poor calibration (strong overestimation of the probability to belong to the minority class), but not to better discrimination in terms of the area under the receiver operating characteristic curve. Imbalance correction improved classification in terms of sensitivity and specificity, but similar results were obtained by shifting the probability threshold instead. Our study shows that outcome imbalance is not a problem in itself, and that imbalance correction may even worsen model performance.
研究动机与目标
- 评估类别不平衡校正技术对逻辑回归中风险预测模型性能的影响。
- 评估SMOTE、欠采样和过采样等方法是否能提升区分度、校准度和分类指标。
- 确定在真实临床预测建模中,类别不平衡校正的益处是否超过其风险。
- 比较经不平衡校正的模型与简单调整阈值方法在优化敏感性和特异性方面的表现。
- 提供基于实证和模拟研究的证据,揭示在低发生率结果背景下,类别不平衡校正的意外后果。
提出的方法
- 使用具有不同类别不平衡程度和结果发生率的合成数据集,开展蒙特卡洛模拟。
- 在原始数据集和经不平衡校正的数据集上应用标准逻辑回归与岭逻辑回归模型。
- 采用三种不平衡校正技术:随机欠采样、随机过采样和SMOTE(合成少数类过采样技术)。
- 通过区分度(AUC-ROC)、校准度(校准图与校准斜率)以及分类指标(敏感性、特异性、F1分数)评估模型性能。
- 通过真实卵巢癌诊断数据开展案例研究,以在临床背景下验证模拟结果。
- 比较不同校正方法的模型输出,并评估调整阈值对分类性能的影响。
实验结果
研究问题
- RQ1对类别不平衡进行校正是否能通过AUC-ROC衡量,提升逻辑回归模型的区分能力?
- RQ2不同类别不平衡校正技术如何影响风险预测模型的校准度?
- RQ3是否可以通过调整概率阈值而不进行数据处理,实现与类别不平衡校正相当或更优的分类性能(如敏感性和特异性)?
- RQ4类别不平衡校正在低发生率结果中,对少数类概率估计有何影响?
- RQ5当SMOTE或采样方法导致少数类结果风险被过度估计时,其在风险预测建模中的使用是否合理?
主要发现
- 所有类别不平衡校正方法——包括欠采样、过采样和SMOTE——均导致校准度差,且对少数类归属概率存在强烈过度估计。
- 未观察到区分度的提升,校正后受试者工作特征曲线下面积(AUC)保持不变或略有下降。
- 尽管类别不平衡校正提升了敏感性和特异性,但仅通过调整概率阈值即可实现同等或更优的性能,无需任何数据操作。
- 卵巢癌诊断的案例研究证实了模拟结果,显示类别不平衡校正导致预测结果过于自信且校准度差。
- 岭逻辑回归未能缓解类别不平衡校正带来的负面校准影响,表明正则化本身无法解决该问题。
- 本研究结论认为,类别不平衡本身并非问题,而类别不平衡校正可能在风险预测场景中实际损害模型性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。