[论文解读] Chasing Your Long Tails: Differentially Private Prediction in Health Care Settings
本文研究了在医疗领域中不同差分隐私(DP)机器学习方法的权衡,使用DP-SGD和目标扰动在临床数据(NIH X光片和MIMIC-III电子健康记录EHR)上训练模型。研究发现存在严重的隐私-效用权衡,对数据分布变化的鲁棒性降低,且多数群体的影响被放大,尤其在高隐私设置下,这损害了现实医疗环境中公平性和模型稳定性。
Machine learning models in health care are often deployed in settings where it is important to protect patient privacy. In such settings, methods for differentially private (DP) learning provide a general-purpose approach to learn models with privacy guarantees. Modern methods for DP learning ensure privacy through mechanisms that censor information judged as too unique. The resulting privacy-preserving models, therefore, neglect information from the tails of a data distribution, resulting in a loss of accuracy that can disproportionately affect small groups. In this paper, we study the effects of DP learning in health care. We use state-of-the-art methods for DP learning to train privacy-preserving models in clinical prediction tasks, including x-ray classification of images and mortality prediction in time series data. We use these models to perform a comprehensive empirical investigation of the tradeoffs between privacy, utility, robustness to dataset shift, and fairness. Our results highlight lesser-known limitations of methods for DP learning in health care, models that exhibit steep tradeoffs between privacy and utility, and models whose predictions are disproportionately influenced by large demographic groups in the training data. We discuss the costs and benefits of differentially private learning in health care.
研究动机与目标
- 评估差分隐私(DP)对临床机器学习中模型效用、鲁棒性和公平性的影响。
- 探究DP学习是否因少数群体在数据尾部的代表性不足,而对其产生不成比例的影响。
- 评估DP对电子健康记录(EHR)中常见数据集分布变化下模型稳定性的影响。
- 分析在DP与非DP设置下,单个训练患者对测试预测的影响。
- 刻画真实世界医疗数据集中隐私-公平性与隐私-鲁棒性之间的权衡关系。
提出的方法
- 在NIH胸部X光片和MIMIC-III EHR数据集上,使用DP-SGD和目标扰动训练差分隐私模型。
- 在三个临床任务上评估模型性能:死亡率预测、住院时长过长(LOS)预测和血管活性药物使用预测。
- 通过在MIMIC-III上逐年训练模型,并测量不同时期的性能差异,评估模型鲁棒性。
- 使用标准指标评估公平性:不同人口统计群体之间的性能差距、平等差距、召回率差距和特异性差距。
- 应用影响函数量化在私有与非私有设置下,单个训练患者对测试预测的贡献。
- 比较不同隐私级别下的影响模式,评估DP是否降低了特定患者对模型预测的主导作用。
实验结果
研究问题
- RQ1不同差分隐私学习方法如何影响临床预测任务中的模型准确率和效用?
- RQ2差分隐私在纵向EHR数据中在多大程度上降低了模型对数据集分布变化的鲁棒性?
- RQ3DP学习如何影响公平性,特别是对医疗数据中代表性不足的人口群体?
- RQ4差分隐私如何改变单个训练患者对测试预测的影响?
- RQ5隐私级别与影响性训练患者在模型预测中的个性化程度之间存在何种关系?
主要发现
- 在MIMIC-III EHR数据上,DP模型表现出严重的隐私-效用权衡,即使在中等隐私预算下也出现了显著的准确率下降。
- 高隐私设置下的模型在死亡率和LOS预测任务中对年度数据分布变化表现出更高的稳定性,表明其对概念漂移和数据分布变化具有更强的鲁棒性。
- 影响函数分析显示,在高隐私设置下,最具帮助和最具危害的训练患者对个体测试患者的预测影响更加个性化,单个患者的影响力被降低。
- 在非私有模型中,共享的最具影响力训练患者频率为25%,而在高隐私模型中降至7%,表明全局影响力减弱,个性化程度提高。
- 在高隐私设置下,多数族裔群体(如白人患者)的影响显著增强,表明DP可能通过放大群体层面的偏见,加剧公平性问题。
- 在死亡率预测任务中,高隐私模型在多年间保持了稳定的影响力,而非私有模型则表现出高方差,表明DP在非平稳环境下增强了模型稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。