Skip to main content
QUICK REVIEW

[論文レビュー] AnomiGAN: Generative adversarial networks for anonymizing private medical data

Ho Bae, Dahuin Jung|arXiv (Cornell University)|Jan 31, 2019
Privacy-Preserving Technologies in Data参考文献 28被引用数 4
ひとこと要約

AnomiGAN は、生成対抗ネットワークフレームワークであり、プライベートな医療データを、実際のデータと区別がつかない合成データを生成するジェネレータを訓練することで、プライバシーを保護しながら、下流の予測タスクに必要な有用性を維持する形で匿名化する。同等のプライバシー保証のもとで微分プライバシーを上回る予測性能を達成しており、プライバシーとモデル精度の間で有利なトレードオフを実現している。

ABSTRACT

Typical personal medical data contains sensitive information about individuals. Storing or sharing the personal medical data is thus often risky. For example, a short DNA sequence can provide information that can not only identify an individual, but also his or her relatives. Nonetheless, most countries and researchers agree on the necessity of collecting personal medical data. This stems from the fact that medical data, including genomic data, are an indispensable resource for further research and development regarding disease prevention and treatment. To prevent personal medical data from being misused, techniques to reliably preserve sensitive information should be developed for real world application. In this paper, we propose a framework called anonymized generative adversarial networks (AnomiGAN), to improve the maintenance of privacy of personal medical data, while also maintaining high prediction performance. We compared our method to state-of-the-art techniques and observed that our method preserves the same level of privacy as differential privacy (DP), but had better prediction results. We also observed that there is a trade-off between privacy and performance results depending on the degree of preservation of the original data. Here, we provide a mathematical overview of our proposed model and demonstrate its validation using UCI machine learning repository datasets in order to highlight its utility in practice. Experimentally, our approach delivers a better performance compared to that of the DP approach.

研究の動機と目的

  • 個人のプライバシーを損なうことなく、特にゲノム情報を含む感受性の高い医療データを共有する課題に対処すること。
  • 機械学習モデルに高い有用性を維持するプライバシー保護型のデータ匿名化手法を開発すること。
  • 微分プライバシーなどの既存手法を、プライバシー保護と予測性能の両面で上回ること。
  • 統計的または暗号的手法に代わるスケーラブルでディープラーニングベースの代替手法を提供すること。
  • オンライン医療サービスや機械学習としてのサービス(MLaaS)プラットフォームにおける安全なデータ共有を可能にすること。

提案手法

  • AnomiGAN は、ターゲット分類器に条件付けられた条件付き GAN アーキテクチャを採用しており、ジェネレータがランダムノイズを、ターゲット分類器の出力を維持する形で匿名化医療データにマッピングするように学習する。
  • ディスクラミネータは、事前学習済みのターゲット分類器に置き換えられ、ジェネレータが高い予測性能を示すデータを生成するように誘導する。
  • プライバシー正則化項が、プライバシーパラメータ λₑ を介して導入され、元のデータと生成されたデータの間のユークリッド距離を調整することで、データ有用性とプライバシーのトレードオフを制御する。
  • 訓練中にレイヤーごとの分散注入を実施することで、異なるデータ分布にわたるロバストネスと一般化性能が向上する。
  • 再構成損失、対抗損失、プライバシーに配慮した正則化項を組み合わせた訓練目的関数を用い、忠実度、プライバシー、有用性のバランスをとる。
  • データ類似度と分類器性能の両方を最適化するため、統合損失関数を用いてエンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1GANベースのフレームワークは、下流の機械学習タスクに必要な有用性を保ちつつ、感受性の高い医療データを効果的に匿名化できるか?
  • RQ2同等のプライバシー制約のもとで、AnomiGAN の予測精度と AUC は微分プライバシーと比べてどの程度優れているか?
  • RQ3プライバシーパラメータ λₑ を変化させた場合、データ有用性とプライバシー保護のトレードオフにどのような影響があるか?
  • RQ4レイヤーごとの分散注入は、匿名化データのロバストネスと一般化性能を向上させるか?
  • RQ5本手法は、バックグラウンド集団に関する仮定を必要とせず、実世界の医療データセットに適用可能か?

主な発見

  • AnomiGAN は微分プライバシーと同等のプライバシー保証を達成しているが、乳がんおよび慢性腎臓病の両データセットで予測精度と AUC が顕著に優れている。
  • プライバシーパラメータ λₑ が増加するにつれて、元のデータと匿名化データの間の相関が強く保たれ、高いデータ忠実度を示している。
  • λₑ が増加するにつれて、下流分類器の平均精度と AUC は安定的または向上し、プライバシー制約に対してロバストであることが示された。
  • レイヤーごとの分散注入は、相関にわずかだが測定可能な効果をもたらし、精度と AUC の低下は最小限に抑えられており、ネットワーク各層で安定した性能を示している。
  • AnomiGAN の訓練時間は効率的であり、乳がんデータセットでは最適なハイパーパrameterを用いて2時間未塔、慢性腎臓病データセットでは1時間未塔で完了する。
  • プライバシー-有用性トレードオフと予測性能の両面で、微分プライバシーを上回っており、実世界の医療データ共有に実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。