[论文解读] Confound-leakage: Confound Removal in Machine Learning Leads to Leakage
本文表明,在机器学习流程中通过线性回归进行标准混杂因素去除(共变量回归,CR)可能会意外导致数据泄露,尤其是在后续使用非线性模型时。这种泄露会通过残差中揭示隐藏的混杂信息,导致虚假的、近乎完美的预测性能,从而在临床和观察性研究中破坏模型的有效性。
Machine learning (ML) approaches to data analysis are now widely adopted in many fields including epidemiology and medicine. To apply these approaches, confounds must first be removed as is commonly done by featurewise removal of their variance by linear regression before applying ML. Here, we show this common approach to confound removal biases ML models, leading to misleading results. Specifically, this common deconfounding approach can leak information such that what are null or moderate effects become amplified to near-perfect prediction when nonlinear ML approaches are subsequently applied. We identify and evaluate possible mechanisms for such confound-leakage and provide practical guidance to mitigate its negative impact. We demonstrate the real-world importance of confound-leakage by analyzing a clinical dataset where accuracy is overestimated for predicting attention deficit hyperactivity disorder (ADHD) with depression as a confound. Our results have wide-reaching implications for implementation and deployment of ML workflows and beg caution against naïve use of standard confound removal approaches.
研究动机与目标
- 调查通过线性回归进行标准混杂因素去除在机器学习工作流中产生的意外后果。
- 识别在非线性模型中,混杂因素去除导致数据泄露的条件,特别是在临床应用中。
- 评估混杂因素去除后模型性能的提升是否反映了真实信号的增强,还是虚假的泄露。
- 为检测和缓解机器学习流程中的混杂因素泄露提供实用指南。
- 通过一个以抑郁症为混杂因素的临床ADHD语音数据集,展示混杂因素泄露的现实影响。
提出的方法
- 应用共变量回归(CR)通过线性模型去除特征中混杂因素(如年龄、性别、抑郁症)的线性方差。
- 采用与交叉验证一致的工作流程,确保CR仅应用于训练折,从而保持测试集的完整性。
- 在基准数据集和临床数据集上,对一系列机器学习模型——包括线性和非线性模型——进行评估,比较使用和不使用CR时的性能表现。
- 在10×5嵌套交叉验证中,使用AUC-ROC评估分类性能,使用R²评估回归性能。
- 通过评估CR步骤中混杂因素估计值($\hat{X}$)的可预测性来检测泄露:若目标能从$\hat{X}$中被高度预测,则表明存在泄露。
- 使用贝叶斯ROPE分析来判断CR与非CR流程之间性能差异是否具有实际意义。
实验结果
研究问题
- RQ1在后续使用非线性机器学习模型时,通过线性回归进行混杂因素去除是否会导致数据泄露?
- RQ2在何种条件下,混杂因素去除后的性能提升是由于信息揭示,而非混杂因素泄露?
- RQ3从残差化特征中预测混杂因素估计值($\hat{X}$)的可预测性如何?这又对泄露意味着什么?
- RQ4在现实临床应用中,如ADHD预测,混杂因素泄露在多大程度上会高估诊断准确性?
- RQ5通过特征随机置换并从残差中预测混杂因素,能否作为检测机器学习流程中泄露的实用诊断工具?
主要发现
- 在非线性模型中,通过线性回归去除混杂因素后,由于混杂因素泄露,即使真实效应为零或微弱,也会导致虚假的、近乎完美的预测性能。
- 在ADHD语音数据集中,当使用抑郁症作为混杂因素时,CR将ADHD预测的AUC-ROC从约0.65提升至约0.95,表明模型性能被严重高估。
- CR后残差化特征对混杂因素(如抑郁症评分)具有高度可预测性,$\hat{X}$可解释目标中高达80%的方差,提供了泄露的有力证据。
- CR后的性能提升并非源于信号增强,而是由泄露驱动,这一点由从残差中高度可预测混杂因素得到证实。
- 研究发现,当在单变量混杂因素回归后应用非线性模型时,混杂因素泄露尤为普遍,即使在交叉验证流程中也是如此。
- 作者提出,通过特征随机置换并从残差中预测混杂因素,可作为检测机器学习工作流中泄露易感性的诊断工具。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。