Skip to main content
QUICK REVIEW

[论文解读] Decentralized Differentially Private Segmentation with PATE

Dominik Fay, Jens Sjölund|arXiv (Cornell University)|Apr 10, 2020
Privacy-Preserving Technologies in Data参考文献 9被引用 4
一句话总结

本文提出了一种去中心化的、差分隐私保护的语义分割框架,采用基于教师集成的私有聚合(PATE)方法,并通过自编码器实现降维。通过在噪声聚合前将分割掩码压缩为低维表示,该方法实现了无需同步通信的隐私保护知识蒸馏,在高隐私保护水平(ε=125.94,δ=10⁻²)下实现了0.785的Dice分数,优于带有噪声的联邦平均方法,同时仍低于非私有基线模型。

ABSTRACT

When it comes to preserving privacy in medical machine learning, two important considerations are (1) keeping data local to the institution and (2) avoiding inference of sensitive information from the trained model. These are often addressed using federated learning and differential privacy, respectively. However, the commonly used Federated Averaging algorithm requires a high degree of synchronization between participating institutions. For this reason, we turn our attention to Private Aggregation of Teacher Ensembles (PATE), where all local models can be trained independently without inter-institutional communication. The purpose of this paper is thus to explore how PATE -- originally designed for classification -- can best be adapted for semantic segmentation. To this end, we build low-dimensional representations of segmentation masks which the student can obtain through low-sensitivity queries to the private aggregator. On the Brain Tumor Segmentation (BraTS 2019) dataset, an Autoencoder-based PATE variant achieves a higher Dice coefficient for the same privacy guarantee than prior work based on noisy Federated Averaging.

研究动机与目标

  • 解决在不共享集中数据的情况下训练高精度、隐私保护的医学图像分割模型的挑战。
  • 克服多机构环境下联邦学习的同步瓶颈。
  • 将原本专为分类设计的PATE方法适配至语义分割任务,通过实现高维掩码的低敏感度聚合。
  • 评估并比较主成分分析(PCA)、离散小波变换(DWT)和自编码器等降维技术在分割任务中隐私保护知识蒸馏的性能。
  • 证明基于自编码器的PATE方法在BraTS 2019数据集上相较于现有去中心化私有学习方法实现了更优的隐私-效用权衡。

提出的方法

  • 该方法使用一个私有聚合器,首先通过编码函数 $ h_{\text{enc}} $ 将每个教师模型的分割预测压缩为低维潜在表示。
  • 聚合器计算所有 $ K $ 个教师模型的压缩表示的均值,并根据Rényi差分隐私边界对零均值高斯噪声进行缩放。
  • 学生模型通过将解码函数 $ h_{\text{dec}} $ 应用于扰动后的平均表示,对重建的分割掩码进行训练。
  • 编码器和解码器采用类似U-Net的自编码器结构,包含批量归一化、ReLU激活函数和Sigmoid输出,且在瓶颈层注入噪声以匹配推理时的分布。
  • 通过Rényi差分隐私累积多次聚合的隐私损失,最优Rényi阶数 $ \alpha $ 被选择以最小化噪声尺度。
  • 该框架支持完全去中心化训练:教师模型在本地数据上独立训练,仅共享压缩后的、已扰动的表示。

实验结果

研究问题

  • RQ1降维技术能否在基于PATE的框架中实现高维分割掩码的低敏感度聚合,同时保持差分隐私?
  • RQ2在语义分割中,主成分分析(PCA)、离散小波变换(DWT)和自编码器这三种降维方法中,哪一种在重建保真度与隐私-效用之间提供了最佳权衡?
  • RQ3在相同的隐私保障下,所提出的基于自编码器的PATE方法与带有噪声的联邦平均方法相比,其分割性能如何?
  • RQ4在去中心化分割流程中,中等数量的机构(K)能够实现多高的隐私水平(ε)?
  • RQ5所提出的方法在多大程度上缩小了医学影像数据上私有与非私有分割模型之间的性能差距?

主要发现

  • 基于自编码器的PATE变体在BraTS 2019测试集上实现了0.785的Dice系数,隐私预算为ε=125.94且δ=10⁻²,优于相同隐私约束下的带有噪声的联邦平均方法。
  • 在高压缩率和噪声环境下,自编码器在重建质量和对噪声的鲁棒性方面优于PCA和DWT。
  • 当K≥37所参与机构时,该方法实现了约ε≈1的隐私水平,表明在中等数量机构参与下,实现个位数ε值是可行的。
  • 非私有基线模型的Dice分数为0.869,表明即使在高隐私PATE设置下,性能差距依然显著。
  • 所提出的框架实现了无需同步的去中心化训练:教师模型独立训练,仅共享压缩后且已扰动的表示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。