[论文解读] Homomorphic Encryption and Federated Learning based Privacy-Preserving CNN Training: COVID-19 Detection Use-Case
本文提出了一种用于COVID-19检测的隐私保护联邦学习框架,采用卷积神经网络(CNN),结合同态加密(HE)与安全多方计算,以在训练过程中保护数据和模型。该方法在确保隐私的前提下,实现了与明文训练相当的性能(准确率约84%),尽管由于加密开销导致执行时间显著增加。
Medical data is often highly sensitive in terms of data privacy and security concerns. Federated learning, one type of machine learning techniques, has been started to use for the improvement of the privacy and security of medical data. In the federated learning, the training data is distributed across multiple machines, and the learning process is performed in a collaborative manner. There are several privacy attacks on deep learning (DL) models to get the sensitive information by attackers. Therefore, the DL model itself should be protected from the adversarial attack, especially for applications using medical data. One of the solutions for this problem is homomorphic encryption-based model protection from the adversary collaborator. This paper proposes a privacy-preserving federated learning algorithm for medical data using homomorphic encryption. The proposed algorithm uses a secure multi-party computation protocol to protect the deep learning model from the adversaries. In this study, the proposed algorithm using a real-world medical dataset is evaluated in terms of the model performance.
研究动机与目标
- 解决涉及敏感健康数据的医疗AI训练中的隐私与安全风险。
- 减轻对深度学习模型的隐私攻击,特别是基于梯度的成员身份推断和反演攻击。
- 将同态加密集成到联邦学习中,实现在多机构环境下的端到端隐私保护。
- 评估在真实世界医学影像数据上进行加密训练的性能权衡。
- 证明在医疗应用中实现安全、隐私保护的CNN训练的可行性。
提出的方法
- 采用联邦学习架构,使数据在多个客户端(2–7个)之间本地化存储,避免集中化。
- 应用部分同态加密(SHE)对聚合过程中的模型权重和梯度进行加密,实现对加密数据的计算。
- 采用安全多方计算协议,保护模型参数免受恶意协作方的攻击。
- 在跨客户端划分的真实世界COVID-19 X光片数据集上训练CNN,使用128和192位密文模数以实现安全级别。
- 使用标准指标(准确率、F1、精确率和召回率)对比明文与加密域中的模型性能。
- 使用HElib库执行同态加密操作,并评估不同客户端数量和安全级别下的执行时间。
实验结果
研究问题
- RQ1同态加密能否在不降低模型性能的前提下,有效集成到联邦学习中用于医学图像分类?
- RQ2在多客户端联邦设置中,引入同态加密如何影响训练和推理的执行时间?
- RQ3密文模数(128位与192位)的变化对模型准确率和计算开销有何影响?
- RQ4在不同客户端数量下,加密域中的模型性能与明文基线相比如何?
- RQ5在协作学习环境中,所提出的方法在多大程度上能有效防范模型反演和成员身份推断攻击?
主要发现
- 所提方法在明文域中达到84.5%的准确率,在2至7个客户端的加密域中准确率范围为83.75%至85.25%,表明性能下降极小。
- F1分数在所有配置中保持稳定,约为0.83–0.85,明文域最佳F1为0.868924,192位加密下7个客户端时达到0.869584。
- 加密域中的执行时间显著增加,尤其在客户端数量较多时,这是由于同态运算的计算成本所致,但128位与192位模数在客户端数量较少时差异极小。
- 在某些配置(如5个客户端)中,明文模型在所有指标上均略优于加密版本,表明增强隐私需付出性能代价。
- 模型在不同客户端数量下保持一致的性能,表明在联邦设置中对客户端数量波动具有鲁棒性。
- 结果证实,通过HE-联邦学习实现隐私保护训练在医学影像中是可行的,可在保护敏感数据和模型参数的同时实现高准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。