[论文解读] Differentially Private Federated Learning for Cancer Prediction
本文提出了一种用于乳腺癌预测的差分隐私联邦学习方法,基于两个虚拟中心的基因组数据,采用DP-SGD并结合细致的隐私预算核算。在严格的隐私预算(ε=1,δ=10⁻⁵)下,模型准确率达到93.5%,随着隐私要求放松,性能接近99.5%,展示了在去中心化基因组环境中模型效用与数据隐私之间的显著权衡。
Since 2014, the NIH funded iDASH (integrating Data for Analysis, Anonymization, SHaring) National Center for Biomedical Computing has hosted yearly competitions on the topic of private computing for genomic data. For one track of the 2020 iteration of this competition, participants were challenged to produce an approach to federated learning (FL) training of genomic cancer prediction models using differential privacy (DP), with submissions ranked according to held-out test accuracy for a given set of DP budgets. More precisely, in this track, we are tasked with training a supervised model for the prediction of breast cancer occurrence from genomic data split between two virtual centers while ensuring data privacy with respect to model transfer via DP. In this article, we present our 3rd place submission to this competition. During the competition, we encountered two main challenges discussed in this article: i) ensuring correctness of the privacy budget evaluation and ii) achieving an acceptable trade-off between prediction performance and privacy budget.
研究动机与目标
- 解决在去中心化基因组数据上训练高精度癌症预测模型的同时确保强隐私保障的挑战。
- 在具有多轮训练的联邦学习设置中,确保正确性并实现对差分隐私预算的紧密估计。
- 在真实世界基因组数据竞赛设置中,优化模型准确率与隐私预算(ε, δ)之间的权衡。
- 开发一个稳健的流程,防止在联邦设置下的数据预处理和模型训练过程中发生隐私泄露。
提出的方法
- 在本地模型更新过程中对梯度添加高斯噪声,采用DP-SGD以确保(ε, δ)-差分隐私。
- 使用Rényi差分隐私(RDP)进行精确的隐私核算,相较于标准(ε, δ)-DP,能够获得更紧的组合界。
- 应用RDP到(ε, δ)-DP的转换,利用定理6将RDP参数映射为最终的隐私预算。
- 通过词典式搜索遍历超参数,将目标隐私预算(εₜ, δₜ)映射到最优模型配置。
- 在每个客户端本地应用基因选择与插补进行数据预处理,避免预处理阶段发生数据泄露。
- 通过联邦平均与DP-SGD训练模型,仅共享模型参数,不共享原始数据。
实验结果
研究问题
- RQ1在基因组数据的联邦学习流程中,如何实现对差分隐私的准确且紧密的测量?
- RQ2在双中心联邦癌症预测设置中,模型准确率与隐私预算(ε, δ)之间的可实现权衡是什么?
- RQ3不同基因特征集选择(Rotterdam与citbcmst)在不同隐私约束下如何影响模型性能?
- RQ4联邦学习系统是否能在不集中化数据的前提下,同时保持高预测准确率并确保强隐私保障?
- RQ5在去中心化基因组环境中,如何防止在数据预处理和模型训练过程中发生隐私预算泄露?
主要发现
- 该方法在严格的隐私预算ε=1和δ=10⁻⁵下实现了93.5%的验证准确率,展示了强大的隐私-效用权衡。
- 随着隐私预算提高,模型准确率迅速上升,当ε超过5后达到最大值99.5%。
- 在低隐私预算下(ε ≤ 2),Rotterdam基因特征集优于citbcmst特征集,可能是因为特征更少导致方差更低。
- 在较高隐私预算下(ε > 2),citbcmst特征集超越Rotterdam特征集,表明更高的噪声容忍度使得更丰富的特征集能够被更有效地利用。
- 基于RDP的隐私核算实现了更紧致且更精确的隐私预算估计,避免了传统粗略分析中常见的高估问题。
- 该流程通过确保不共享任何数据且仅聚合模型参数,成功防止了预处理阶段的隐私泄露。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。