Skip to main content
QUICK REVIEW

[論文レビュー] Differentially Private Federated Learning for Cancer Prediction

Constance Béguier, Jean Ogier du Terrail|arXiv (Cornell University)|Jan 8, 2021
Privacy-Preserving Technologies in Data参考文献 14被引用数 16
ひとこと要約

本論文は、2つの仮想的な病院を対象として、ゲノムデータを用いた乳がん予測のためのプライバシー保護型フェデレーテッドラーニング手法を提示する。DP-SGDを用い、プライバシー予算の正確な管理を実施している。厳しいプライバシー予算(ε=1, δ=10⁻⁵)のもとで93.5%の精度を達成しており、プライバシーを緩和すると99.5%に近づく。これは、分散型ゲノム環境下におけるモデルの有用性とデータのプライバシーの間の良好なトレードオフを示している。

ABSTRACT

Since 2014, the NIH funded iDASH (integrating Data for Analysis, Anonymization, SHaring) National Center for Biomedical Computing has hosted yearly competitions on the topic of private computing for genomic data. For one track of the 2020 iteration of this competition, participants were challenged to produce an approach to federated learning (FL) training of genomic cancer prediction models using differential privacy (DP), with submissions ranked according to held-out test accuracy for a given set of DP budgets. More precisely, in this track, we are tasked with training a supervised model for the prediction of breast cancer occurrence from genomic data split between two virtual centers while ensuring data privacy with respect to model transfer via DP. In this article, we present our 3rd place submission to this competition. During the competition, we encountered two main challenges discussed in this article: i) ensuring correctness of the privacy budget evaluation and ii) achieving an acceptable trade-off between prediction performance and privacy budget.

研究の動機と目的

  • 分散型ゲノムデータ上で正確ながん予測モデルを訓練する課題に取り組み、強力なプライバシー保証を確保すること。
  • 複数回のトレーニングラウンドを含むフェデレーテッドラーニング環境において、微分プライバシー予算の正しさと高精度な推定を保証すること。
  • 実世界のゲノムデータコンペティション環境下で、モデルの精度とプライバシー予算(ε, δ)のトレードオフを最適化すること。
  • データ前処理およびモデルトレーニング中にプライバシー漏洩を防ぐ強固なパイプラインの開発

提案手法

  • 局所的なモデル更新時に勾配にガウスノイズを追加することで、(ε, δ)-微分プライバシーを確保するDP-SGDを採用する。
  • よりきめ細かい合成境界を提供するため、正確なプライバシー会計にRényi微分プライバシー(RDP)を用いる。
  • RDPから(ε, δ)-DPへの変換を実施し、定理6を用いてRDPパラメータを最終的なプライバシー予算にマップする。
  • 目的のプライバシー予算(εₜ, δₜ)に一致する最適なモデル設定を求めるために、ハイパーパramータのレキシコグラフィックサーチを実装する。
  • 各クライアントで局所的に遺伝子選択と補完を実施し、前処理段階でのデータ漏洩を回避する。
  • モデルパラメータのみを共有するフェデレーテッドアベレージを用いてモデルをトレーニングするが、生データは共有しない。

実験結果

リサーチクエスチョン

  • RQ1ゲノムデータ向けフェデレーテッドラーニングパイプラインにおいて、微分プライバシーを正確かつきめ細かく測定する方法は何か?
  • RQ22センターのフェデレーテッドがん予測設定において、モデルの精度とプライバシー予算(ε, δ)の間に達成可能なトレードオフは何か?
  • RQ3異なる遺伝子サブセット(Rotterdam対 citbcmst)の選択が、さまざまなプライバシー制約下でのモデルパフォーマンスに与える影響は何か?
  • RQ4中央集権化を伴わせずに、分散型ゲノム環境下で高い予測精度を維持しつつ、強力なプライバシー保証を確保できるか?
  • RQ5分散型ゲノム環境下で、データ前処理およびモデルトレーニング段階でプライバシー予算の漏洩をどのように防げるか?

主な発見

  • 厳しいプライバシー予算(ε=1、δ=10⁻⁵)のもとで、本手法は93.5%の検証精度を達成し、強力なプライバシーと有用性のトレードオフを示した。
  • プライバシー予算を高めると、モデルの精度が急激に向上し、εが5を超えると最大99.5%に達した。
  • 低プライバシー予算(ε ≤ 2)では、より少ない特徴量からなるRotterdam遺伝子サブセットがcitbcmstサブセットを上回った。これは、少ない特徴量による分散の低減が要因と考えられる。
  • 高プライバシー予算(ε > 2)では、citbcmstサブセットがRotterdamサブセットを上回った。これは、ノイズ耐性が向上することで、より豊富な特徴集合を効果的に活用できるようになったことを示している。
  • RDPに基づくプライバシー会計により、粗い分析で一般的に見られる過剰推定を回避し、よりきめ細かく正確なプライバシー予算推定が可能になった。
  • データ共有を一切行わず、モデルパラメータのみを集約することで、前処理段階でのプライバシー漏洩を効果的に防止したパイプラインが実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。