[论文解读] A Fully Private Pipeline for Deep Learning on Electronic Health Records
本文提出了一种用于从电子健康记录(EHRs)预测30天内再次入院的全隐私保护深度学习流程,结合了训练阶段的差分隐私与推理阶段的同态加密。在强隐私保障($ϵ=4$,$δ=10^{-5}$)下实现了高性能表现(AUC = 0.66,召回率 = 0.60),并通过数据标准化和优化的激活函数设计,有效缓解了隐私-效用之间的权衡问题。
We introduce an end-to-end private deep learning framework, applied to the task of predicting 30-day readmission from electronic health records. By using differential privacy during training and homomorphic encryption during inference, we demonstrate that our proposed pipeline could maintain high performance while providing robust privacy guarantees against information leak from data transmission or attacks against the model. We also explore several techniques to address the privacy-utility trade-off in deploying neural networks with privacy mechanisms, improving the accuracy of differentially-private training and the computation cost of encrypted operations using ideas from both machine learning and cryptography.
研究动机与目标
- 为解决医疗机器学习中患者数据隐私的关键挑战,即敏感的EHRs易受去匿名化攻击和模型反演攻击的影响。
- 开发一个端到端的隐私保护深度学习框架,确保模型训练和推理阶段的安全性。
- 最小化差分隐私和同态加密等隐私机制在临床深度学习应用中导致的性能下降。
- 通过数据标准化和高效的同态加密激活函数设计,优化隐私-效用权衡。
- 在真实临床预测任务——基于EHRs预测30天内再次入院——中,证明全隐私流程的可行性和鲁棒性。
提出的方法
- 在模型训练期间采用差分隐私随机梯度下降(DP-SGD),通过梯度裁剪和高斯噪声注入,确保$(\epsilon, \delta)$-差分隐私。
- 对输入特征进行标准化处理,以降低梯度L2范数,从而减少裁剪阈值和噪声需求,提升训练稳定性和隐私效率。
- 使用FV-RNS同态加密方案(通过Microsoft SEAL实现),实现对加密EHR数据的推理而无需解密。
- 设计并评估了参数化的激活函数,特别是采用量化系数的近似Swish函数,以减少同态推理中的乘法操作和计算成本。
- 利用非线性激活函数(如ReLU、Sigmoid)的低次多项式近似,以保持与分级同态加密的兼容性。
- 通过隐私会计机制追踪隐私预算,防止隐私预算过度使用,确保形式化的隐私保障。
实验结果
研究问题
- RQ1能否构建一个全隐私保护的深度学习流程,确保在EHR数据训练和推理过程中均具备强隐私保障?
- RQ2输入标准化在临床任务的差分隐私深度学习中,如何影响隐私成本和训练稳定性?
- RQ3不同激活函数近似方式对神经网络中同态推理的准确率和计算效率有何影响?
- RQ4在EHRs上预测30天内再次入院时,何种差分隐私水平($ϵ$)能实现效用与隐私的最佳平衡?
- RQ5同态加密能否在现实临床深度学习模型中高效应用,而不会带来不可接受的计算开销?
主要发现
- EHR特征的标准化显著降低了梯度L2范数,减少了所需的裁剪边界和噪声,从而提升了训练稳定性并降低了隐私成本。
- 在$ϵ=4$,$δ=10^{-5}$条件下,模型实现了AUC为0.66、召回率为0.60的性能,表明在差分隐私保护下仍具备较强表现。
- 在$ϵ=4$时实现了最佳隐私-效用权衡,更高的噪声水平($ϵ=1$)导致训练更早终止且性能下降。
- 采用系数量化的近似Swish函数实现了最高的AUC(0.678)和召回率(0.645),优于ReLU-Sigmoid和平方激活函数,同时保持了较低的计算开销。
- 量化后的Swish激活函数通过减少冗余乘法运算,显著降低了运行时间,使同态推理更高效,且性能损失可忽略不计。
- 全隐私保护流程在相同数据集上实现了优于先前工作的AUC(0.63 vs. 0.61和0.23),即使在高噪声条件下也表现出色,证明了所提隐私保护方法的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。