[论文解读] Defending Medical Image Diagnostics against Privacy Attacks using Generative Methods
本文提出了一种基于生成对抗网络(GANs)的新型医学影像诊断隐私保护方法,通过生成合成视网膜图像,在保护患者身份的同时保留诊断实用性。通过用 GAN 生成的数据替代真实训练数据,该方法显著降低了成员推理攻击的成功率,在糖尿病视网膜病变分类任务中实现了最先进的隐私保护效果,且对模型准确率的影响极小。
Machine learning (ML) models used in medical imaging diagnostics can be vulnerable to a variety of privacy attacks, including membership inference attacks, that lead to violations of regulations governing the use of medical data and threaten to compromise their effective deployment in the clinic. In contrast to most recent work in privacy-aware ML that has been focused on model alteration and post-processing steps, we propose here a novel and complementary scheme that enhances the security of medical data by controlling the data sharing process. We develop and evaluate a privacy defense protocol based on using a generative adversarial network (GAN) that allows a medical data sourcer (e.g. a hospital) to provide an external agent (a modeler) a proxy dataset synthesized from the original images, so that the resulting diagnostic systems made available to model consumers is rendered resilient to privacy attackers. We validate the proposed method on retinal diagnostics AI used for diabetic retinopathy that bears the risk of possibly leaking private information. To incorporate concerns of both privacy advocates and modelers, we introduce a metric to evaluate privacy and utility performance in combination, and demonstrate, using these novel and classical metrics, that our approach, by itself or in conjunction with other defenses, provides state of the art (SOTA) performance for defending against privacy attacks.
研究动机与目标
- 为应对医学人工智能中隐私泄露的风险,特别是通过成员推理攻击暴露患者数据是否被用于训练的问题。
- 开发一种以数据为中心的隐私防御机制,从数据源层面实施,避免依赖模型层面的修改或对模型训练者的信任。
- 提出一种新指标 P1-score,用于定量平衡隐私与诊断实用性,为数据提供方与模型训练方之间的隐私-实用权衡决策提供依据。
- 评估通过 GAN 生成的合成数据在防御隐私攻击方面的有效性,同时保持在视网膜影像任务中的高诊断性能。
- 证明所提出的方法在降低攻击准确率方面优于或可与现有防御方法互补,且不损害模型实用性。
提出的方法
- 该方法使用条件 GAN 从真实的糖尿病视网膜病变图像生成合成视网膜图像,保留诊断特征的同时隐藏个体身份。
- 数据提供方可仅向外部模型训练方共享合成数据集,从而防止其直接访问真实患者数据,有效缓解隐私泄露风险。
- 定义了一种类内身份等价关系 ∼I,用于判断两张图像(真实与合成)是否代表同一人,依据为感知相似性或如视网膜血管结构等生物特征。
- 该方法可与现有防御手段(如 MMD 和 Mixup)集成,在不修改其训练流程的前提下提升其隐私保护性能。
- 引入 P1-score 指标作为综合度量,结合模型准确率(实用性)与攻击准确率(隐私风险),采用等权重评估隐私-实用权衡。
- 该方法在糖尿病视网膜病变视网膜图像数据集上进行评估,比较了不同真实数据与合成数据比例下攻击成功率与模型性能的表现。
实验结果
研究问题
- RQ1GAN 生成的合成数据是否能有效防御视网膜诊断中的成员推理攻击,同时保持高诊断模型实用性?
- RQ2所提出的 P1-score 指标与传统指标相比,在捕捉医学影像人工智能中隐私-实用权衡方面表现如何?
- RQ3将合成数据与现有防御方法(如 MMD、Mixup)结合,相较于独立使用,能否显著提升隐私保护效果?
- RQ4在训练混合数据中包含真实数据时,攻击成功率如何变化?合成数据是否能有效缓解此风险?
- RQ5能否基于感知特征或生物特征有效定义身份等价关系 ∼I,以确保隐私保护的同时不损害数据实用性?
主要发现
- 所提出的基于 GAN 的合成数据防御方法,将成员推理攻击准确率分别降低至 55.86%(75% 真实数据)和 56.55%(50% 真实数据),显著低于仅使用真实数据时的基线值 60.11%。
- 当真实数据占比为 25% 时,该方法在 MMD+Mixup 防御下攻击准确率为 59.67%,而基线为 57.27%,表明即使在部分使用真实数据的情况下,仍具备强大的隐私保护能力。
- P1-score 指标成功捕捉了隐私-实用权衡关系,使数据提供方与模型训练方可基于综合性能协商可接受的数据共享水平。
- 该方法在防御隐私攻击方面达到最先进(SOTA)性能,优于或可与现有防御方法(如 MemGuard 和 MMD+Mixup)互补。
- 即使在 100% 使用真实数据时,基线攻击准确率仍达 60.11%,但引入合成数据后,攻击准确率下降至 55.86%(75% 真实数据),证明仅使用合成数据即可显著降低隐私风险。
- 该方法保持了高水平的诊断实用性,所有设置下在真实测试数据上的模型准确率均高于 57%,表明在实现强隐私保护的同时,性能下降极小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。