Skip to main content
QUICK REVIEW

[論文レビュー] COVID-19 Imaging Data Privacy by Federated Learning Design: A Theoretical Framework

Anwaar Ulhaq, Oliver Burmeister|arXiv (Cornell University)|Oct 13, 2020
Privacy-Preserving Technologies in Data参考文献 31被引用数 15
ひとこと要約

本論文は、COVID-19医療画像を対象としたフェデレーテッドラーニングシステムにおけるプライバシーを強化するため、理論的枠組み「プライバシー設計による微分的プライバシー(dPbD)」を提案する。設計ライフサイクルの全段階にわたり微分的プライバシーを統合することで、生データを共有せずにスケーラブルで頑健かつプライバシーを守った協働が可能となり、モデルの有用性を維持しながら患者の機微な情報を保護する。

ABSTRACT

To address COVID-19 healthcare challenges, we need frequent sharing of health data, knowledge and resources at a global scale. However, in this digital age, data privacy is a big concern that requires the secure embedding of privacy assurance into the design of all technological solutions that use health data. In this paper, we introduce differential privacy by design (dPbD) framework and discuss its embedding into the federated machine learning system. To limit the scope of our paper, we focus on the problem scenario of COVID-19 imaging data privacy for disease diagnosis by computer vision and deep learning approaches. We discuss the evaluation of the proposed design of federated machine learning systems and discuss how differential privacy by design (dPbD) framework can enhance data privacy in federated learning systems with scalability and robustness. We argue that scalable differentially private federated learning design is a promising solution for building a secure, private and collaborative machine learning model such as required to combat COVID19 challenge.

研究の動機と目的

  • 国際的なCOVID-19研究における、安全でプライバシーを守った協働の増大するニーズに対応すること。
  • 既存のフェデレーテッドラーニングシステムに内在する、プライバシー保証における十分なスケーラビリティと頑健性の欠如を克服すること。
  • 微分的プライバシーを、後から追加するのではなく、設計の初期段階からコアな設計原則として統合すること。
  • プライバシー、有用性、システムのレジリエンスのバランスをとる包括的な理論的枠組みを提供すること。
  • データ漏洩を防ぎながら、病院間で分散型にAIモデルを訓練し、機微なCOVID-19画像データを安全に扱えるようにすること。

提案手法

  • フェデレーテッドラーニングシステム開発の全段階にプライバシーを統合する理論的枠組み、すなわちプライバシー設計による微分的プライバシー(dPbD)を提案する。
  • 微分的プライバシーを初期設計段階から最終デプロイまで埋め込む、プライバシー設計のアプローチを採用する。
  • 個々のデータ寄与を隠蔽するために、モデルパラメータの集約の前段階でクライアント側でノイズを注入する。
  • 生データを共有せずに、フェデレーテッドアベレージングを用いてモデル更新を集約することで、データの局所性と機微性を維持する。
  • データの摂動やモデルの逆方向攻撃に対して頑健であるよう、低グローバル感度関数を設計する。
  • エンドツーエンドの匿名化、スケーラビリティ、プライバシーと有用性のトレードオフ最適化といった原則を、システムライフサイクル全体にわたって統合する。

実験結果

リサーチクエスチョン

  • RQ1スケーラブルで頑健な微分的プライバシーを備えたフェデレーテッドラーニングシステムの設計を裏付ける理論的枠組みをどのように構築できるか?
  • RQ2モデルの正確性やシステムパフォーマンスを低下させることなく、微分的プライバシーをフェデレーテッドラーニングに統合するにはどうすればよいか?
  • RQ3クライアントの追加/削除やモデル更新を含む、フェデレーテッドラーニングライフサイクルの全段階で、データプライバシーを保証するための設計原則は何か?
  • RQ4システムスケーリング、非同期学習、クライアント参加状況の変化の下でも、プライバシー保証が維持されるにはどうすればよいか?
  • RQ5医療画像応用において、グローバルモデルの有用性を損なわせることなく、プライバシーが保たれる仕組みは何か?

主な発見

  • dPbD枠組みは、フェデレーテッドラーニングシステムに微分的プライバシーを初期段階から統合する包括的かつ理論的根拠に基づいたアプローチを提供する。
  • この枠組みにより、生の患者画像データが一切共有されず、常にモデルパラメータまたはノイズ保護付きの更新情報のみが送信される。
  • 低グローバル感度関数とレジリient集約戦略を用いることで、システムのスケーラビリティと頑健性が維持される。
  • クライアントの参加・離脱やモデルアーキテクチャの変更があっても、プライバシーが保持される。
  • 制御されたノイズ注入と最適化されたシステムパラメータにより、プライバシーと有用性のバランスが達成可能である。
  • この枠組みはCOVID-19画像分野に限らず、フェデレーテッドラーニングにおける他の機微なデータドメインへも応用可能で、拡張可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。