Skip to main content
QUICK REVIEW

[論文レビュー] NeuraCrypt: Hiding Private Health Data via Random Neural Networks for Public Training

Adam Yala, Homa Esfahanizadeh|arXiv (Cornell University)|Jun 4, 2021
Privacy-Preserving Technologies in Data被引用数 9
ひとこと要約

NeuraCrypt は、プライベートな医療データをランダムに初期化された深層ニューラルネットワークを用いて匿名化表現に変換することで、患者のプライバシーを損なわず、予測モデルの有用性を保ちながら、公に共有可能なプライバシー保護型データエンコーディングフレームワークである。実証的に、チーチェストX線画像の診断タスクにおいて競争力のある正確性を達成し、複数の機関が独立したエンコーダーを用いて共同でモデルを訓練する状況でも、敵対的攻撃に対して高い耐性を示す。

ABSTRACT

Balancing the needs of data privacy and predictive utility is a central challenge for machine learning in healthcare. In particular, privacy concerns have led to a dearth of public datasets, complicated the construction of multi-hospital cohorts and limited the utilization of external machine learning resources. To remedy this, new methods are required to enable data owners, such as hospitals, to share their datasets publicly, while preserving both patient privacy and modeling utility. We propose NeuraCrypt, a private encoding scheme based on random deep neural networks. NeuraCrypt encodes raw patient data using a randomly constructed neural network known only to the data-owner, and publishes both the encoded data and associated labels publicly. From a theoretical perspective, we demonstrate that sampling from a sufficiently rich family of encoding functions offers a well-defined and meaningful notion of privacy against a computationally unbounded adversary with full knowledge of the underlying data-distribution. We propose to approximate this family of encoding functions through random deep neural networks. Empirically, we demonstrate the robustness of our encoding to a suite of adversarial attacks and show that NeuraCrypt achieves competitive accuracy to non-private baselines on a variety of x-ray tasks. Moreover, we demonstrate that multiple hospitals, using independent private encoders, can collaborate to train improved x-ray models. Finally, we release a challenge dataset to encourage the development of new attacks on NeuraCrypt.

研究の動機と目的

  • ヒーパー(HIPAA)やGDPRなどの厳格なプライバシー規制により、医療データセットへの公的アクセスが制限されるという重要な課題に対処すること。
  • 病院やデータ所有者が、患者レベルのプライバシーを保護しつつ、生の患者データを公開して共有できるようにすること。
  • 共有されたエンコード済みデータ上で訓練された機械学習モデルの高い予測的有用性を維持すること。
  • プライベートデータを露呈することなく、中央集権的なデータ集約を必要とせずに、複数機関による共同研究を可能にすること。
  • 公開チャレンジデータセットを通じて、新たな攻撃手法や改善策の開発を促進すること。

提案手法

  • 本手法は、データ所有者にのみ知られているプライベートエンコーダーとして、ランダムに構築された深層ニューラルネットワークを用い、生の患者データをエンコード済み表現に変換する。
  • エンコーディング関数は、同じラベルを持つサンプル間で匿名性を理論的に保証する、多様なランダム関数の族から抽出される。
  • 関数の合成を用いて、段階的にエンコーディング関数の族を豊かにし、最適なバイジェクション族を近似する。
  • エンコード済みデータとパブリックラベルを公開することで、第三者が匿名化されたデータ上でモデルを訓練できるようにする。
  • 複数機関の文脈では、各施設が独立したプライベートエンコーダーを用いることで、共有特徴空間上で共同学習が可能になる。
  • 耐性の評価は、敵対的攻撃(例:MMDベース、トランスファー学習)を用い、線形エンコーディングや非プライベートベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1計算的に効率的なエンコーディング方式は、プライベートな医療データに対して意味的なプライバシー保証を提供しつつ、モデリングの有用性を維持できるか?
  • RQ2ランダムな深層ニューラルネットワークは、プライバシーのための理論的最適なエンコーディング関数族を効果的に近似できるか?
  • RQ3NeuraCrypt は、生データ上で訓練されたモデルと比較して、診断正確性においてどの程度の性能を示すか?
  • RQ4独立したエンコーダーを用いる複数の機関が、プライベートデータを露呈させずに、より正確なモデルを共同で訓練できるか?
  • RQ5NeuraCrypt は、プライベートエンコーダーや感受性属性の回復を目的とした敵対的攻撃に対して、どの程度耐性を示すか?

主な発見

  • NeuraCrypt -ViT は、MIMIC-CXR で平均AUC 80、CheXpert で平均AUC 79 を達成し、非プライベートなViTベースラインと同等の性能を示した。
  • 統合データセット設定では、NeuraCrypt -ViT が Combined-Clear で平均AUC 83、Combined-Private で平均AUC 82 を達成し、プライベートな共同学習による性能低下が最小限に抑えられた。
  • Combined-Private データ上で訓練したモデルは、それぞれ MIMIC-CXR と CheXpert で単独で学習した場合と比較して、平均AUCが2点および3点向上した。
  • NeuraCrypt に対する敵対的攻撃は、平均ベースラインを上回らなかった。深さ2および深さ7のエンコーダーでは、MMD攻撃のMSE比がそれぞれ7.97および4.44であった。
  • NeuraCrypt に対するトランスファー学習攻撃では、AUCが 84 ± 1 にとどまり、線形エンコーディングの 89 ± 1 に比べて顕著に低い水準にとどまり、強い耐性が示された。
  • 敵対的エンコーダー出力上で訓練された浮腫分類器は、本物のNeuraCryptエンコーディングに一般化できず、AUCはほぼランダムな性能(52 ± 4)にとどまり、トランスファー攻撃に対する抵抗性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。