Skip to main content
QUICK REVIEW

[論文レビュー] Homomorphic Encryption and Federated Learning based Privacy-Preserving CNN Training: COVID-19 Detection Use-Case

Febrianti Wibawa, Ferhat Özgür Çatak|arXiv (Cornell University)|Apr 16, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本稿は、畳み込みニューラルネットワーク(CNN)を用いたCOVID-19検出のためのプライバシー保護型フェデレーテッドラーニングフレームワークを提案する。同フレームワークは、ホモモーフィック暗号(HE)とセキュアなマルチパーティ計算を組み合わせることで、学習中のデータおよびモデルの両方を保護する。性能は平文での学習と同等(正確さ~84%)を達成するが、暗号化のオーバーヘッドにより実行時間が著しく延長される。

ABSTRACT

Medical data is often highly sensitive in terms of data privacy and security concerns. Federated learning, one type of machine learning techniques, has been started to use for the improvement of the privacy and security of medical data. In the federated learning, the training data is distributed across multiple machines, and the learning process is performed in a collaborative manner. There are several privacy attacks on deep learning (DL) models to get the sensitive information by attackers. Therefore, the DL model itself should be protected from the adversarial attack, especially for applications using medical data. One of the solutions for this problem is homomorphic encryption-based model protection from the adversary collaborator. This paper proposes a privacy-preserving federated learning algorithm for medical data using homomorphic encryption. The proposed algorithm uses a secure multi-party computation protocol to protect the deep learning model from the adversaries. In this study, the proposed algorithm using a real-world medical dataset is evaluated in terms of the model performance.

研究の動機と目的

  • 機密性の高い健康データを含む医療AI学習におけるプライバシーおよびセキュリティリスクに対処すること。
  • 特に勾配ベースのメンバー情報および逆引き攻撃に対する深層学習モデルのプライバシー攻撃を軽減すること。
  • フェデレーテッドラーニングにホモモーフィック暗号を統合し、複数機関環境におけるエンドツーエンドのプライバシー保護を実現すること。
  • 実世界の医療画像データを用いた暗号化学習の性能的トレードオフを評価すること。
  • 医療応用分野における安全でプライバシー保護型のCNN学習の実現可能性を示すこと。

提案手法

  • データを複数のクライアント(2~7)に分散して保持するフェデレーテッドラーニングの設定を採用し、中央集権化を回避する。
  • 若干のホモモーフィック暗号(SHE)を用いて、集約段階でのモデル重みおよび勾配を暗号化し、暗号化されたデータ上で計算を実行可能にする。
  • モデルパラメータを悪意ある共同参加者から保護するため、セキュアなマルチパーティ計算プロトコルを採用する。
  • 実世界のCOVID-19レントゲン画像データセットをクライアント間で分割し、セキュリティレベルとして128および192の暗号化モジュラス値を用いてCNNを学習する。
  • 標準指標(正確さ、F1スコア、適合率、再現率)を用いて、平文領域と暗号化領域におけるモデル性能を比較する。
  • ホモモーフィック暗号操作にはHElibライブラリを用い、クライアント数およびセキュリティレベルの違いによる実行時間を評価する。

実験結果

リサーチクエスチョン

  • RQ1ホモモーフィック暗号をフェデレーテッドラーニングに効果的に統合することで、医療画像分類のモデル性能が著しく低下することなく実現可能か?
  • RQ2複数クライアントのフェデレーテッド環境下でホモモーフィック暗号を導入した場合、学習および推論の実行時間にどのような影響が生じるか?
  • RQ3暗号化モジュラスの変更(128対192)が、モデルの正確さおよび計算コストに与える影響は何か?
  • RQ4異なるクライアント数における暗号化領域のモデル性能は、平文ベースラインと比較してどの程度の差異を示すか?
  • RQ5協働学習環境下で、提案手法がモデル逆引きおよびメンバー情報推定攻撃に対してどの程度の保護を提供できるか?

主な発見

  • 提案手法は、2~7クライアントの範囲で、平文領域では84.5%、暗号化領域では83.75~85.25%の正確さを達成し、性能の低下が最小限に抑えられた。
  • F1スコアは全設定で0.83~0.85の範囲で安定しており、平文領域で最高のF1スコア0.868924、192ビット暗号化で7クライアントの場合に0.869584を記録した。
  • 実行時間は暗号化領域で著しく延長されたが、これはホモモーフィック演算の計算コストに起因する。特にクライアント数が増えると顕著に増加した。一方、128ビットと192ビットのモジュラス差は、小規模なクライアント数では最小限の差異にとどまった。
  • 一部の設定(例:5クライアント)では、平文モデルがすべての指標でわずかに暗号化バージョンを上回った。これは、プライバシー強化に伴う性能のトレードオフを示している。
  • クライアント数の変動に対しても一貫した性能を維持したため、フェデレーテッド環境におけるクライアント数の変動に強く、ロバストであることが示された。
  • 結果から、医療画像分野におけるHEを用いたフェデレーテッドラーニングによるプライバシー保護型学習が実現可能であり、高い正確さを維持しながらも機密データおよびモデルパラメータを保護できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。