Skip to main content
QUICK REVIEW

[論文レビュー] Decentralized Differentially Private Segmentation with PATE

Dominik Fay, Jens Sjölund|arXiv (Cornell University)|Apr 10, 2020
Privacy-Preserving Technologies in Data参考文献 9被引用数 4
ひとこと要約

本稿では、自己符号化器による次元削減を伴うPrivate Aggregation of Teacher Ensembles (PATE) を用いて、分散型で微分プライバシーを満たすセマンティックセグメンテーションフレームワークを提案する。セグメンテーションマスクをノイズを含む集約の前に低次元表現に圧縮することで、同期通信を必要としないプライバシー保護型知識蒸留が可能となり、高いプライバシー(ε=125.94、δ=10⁻²)のもとでDiceスコア0.785を達成した。これは、ノイズを含むフェデレーテッド・アveragingを上回り、非プライベートベースラインを下回っている。

ABSTRACT

When it comes to preserving privacy in medical machine learning, two important considerations are (1) keeping data local to the institution and (2) avoiding inference of sensitive information from the trained model. These are often addressed using federated learning and differential privacy, respectively. However, the commonly used Federated Averaging algorithm requires a high degree of synchronization between participating institutions. For this reason, we turn our attention to Private Aggregation of Teacher Ensembles (PATE), where all local models can be trained independently without inter-institutional communication. The purpose of this paper is thus to explore how PATE -- originally designed for classification -- can best be adapted for semantic segmentation. To this end, we build low-dimensional representations of segmentation masks which the student can obtain through low-sensitivity queries to the private aggregator. On the Brain Tumor Segmentation (BraTS 2019) dataset, an Autoencoder-based PATE variant achieves a higher Dice coefficient for the same privacy guarantee than prior work based on noisy Federated Averaging.

研究の動機と目的

  • 中央集権的なデータ共有なしに、正確でプライバシー保護型の医療画像セグメンテーションモデルを訓練する課題に対処すること。
  • 複数機関におけるフェデレーテッドラーニングにおける同期のボトル neck を克服すること。
  • 元々分類タスクを想定して開発されたPATEを、高次元マスクの低感度集約を可能にする形で、セマンティックセグメンテーションに適応させること。
  • PCA、DWT、自己符号化器といった次元削減手法の、プライバシー保護型知識蒸留における再構成忠実度とプライバシー・ユーティリティのトレードオフを評価・比較すること。
  • BraTS 2019データセット上で、自己符号化器ベースのPATEが、既存の分散型プライベート学習手法に比べて優れたユーティリティ-プライバシーのトレードオフを達成することを示すこと。

提案手法

  • この手法は、各教師モデルのセグメンテーション予測をエンコーダ関数 $ h_{\text{enc}} $ を用いて低次元の潜在表現に圧縮するプライベートなアグリゲーターを用いる。
  • アグリゲーターは、全 $ K $ 個の教師モデルの圧縮表現の平均を計算し、Rényi微分プライバシーの境界に従ってスケーリングされたゼロ平均のガウスノイズを加える。
  • 学生モデルは、摂動を加えた平均表現にデコーダ関数 $ h_{\text{dec}} $ を適用して再構成されたセグメンテーションマスクを用いて学習される。
  • エンコーダとデコーダは、バッチ正規化、ReLU活性化関数、シグモイド出力を備えたU-Netに類似した自己符号化器として実装され、テスト時の分布に一致させるためにボトルネック部にノイズを注入して訓練される。
  • プライバシー損失は、Rényi微分プライバシーを用いて複数回の集約にわたって累積され、ノイズスケールを最小化する最適なRényi順序 $ \alpha $ が選択される。
  • このフレームワークにより、完全に分散型のトレーニングが可能となる:教師モデルはローカルデータ上で独立して学習し、アグリゲーターに送信されるのは圧縮済みかつ摂動を加えた表現のみである。

実験結果

リサーチクエスチョン

  • RQ1次元削減は、PATEベースのフレームワークにおいて、高次元セグメンテーションマスクの低感度集約を可能にするとともに、微分プライバシーを維持できるか?
  • RQ2PCA、DWT、自己符号化器のうち、どの次元削減手法が、セマンティックセグメンテーションにおける再構成忠実度とプライバシー・ユーティリティのトレードオフにおいて最良の性能を示すか?
  • RQ3同等のプライバシー保証のもとで、提案手法の自己符号化器ベースPATEのセグメンテーション性能は、ノイズを含むフェデレーテッド・アveragingと比べてどうか?
  • RQ4分散型セグメンテーションパイプラインにおいて、中程度の数の機関(K)でどの程度のプライバシー(ε)が達成可能か?
  • RQ5提案手法は、医療画像データにおけるプライベートと非プライベートのセグメンテーションモデル間の性能ギャップをどの程度縮小できるか?

主な発見

  • 自己符号化器ベースのPATEバージョンは、BraTS 2019テストセットにおいてプライバシー予算ε=125.94、δ=10⁻²のもとでDice係数0.785を達成し、同じプライバシー制約下でノイズを含むフェデレーテッド・アveragingを上回った。
  • 自己符号化器は、高い圧縮率とノイズに強く、再構成品質とノイズ耐性においてPCAやDWTを上回った。
  • K≥37の機関が参加する場合、プライバシー水準ε≈1を達成した。これは、中程度の数の参加機関で単一桁のε値が達成可能であることを示している。
  • 非プライベートベースラインはDiceスコア0.869を達成しており、高プライバシーPATEでも依然として顕著な性能ギャップが存在することを示している。
  • 提案されたフレームワークにより、同期を必要としない分散型トレーニングが可能となった。教師モデルは独立して学習され、共有されるのは圧縮済みかつ摂動を加えた表現のみである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。