Skip to main content
QUICK REVIEW

[論文レビュー] Defending Medical Image Diagnostics against Privacy Attacks using Generative Methods

William Paul, Yinzhi Cao|arXiv (Cornell University)|Mar 4, 2021
Privacy-Preserving Technologies in Data参考文献 35被引用数 4
ひとこと要約

本稿は、生成対抗ネットワーク(GAN)を用いて患者の個人情報を保護しながら診断の有用性を維持する、医療画像診断のための新規プライバシー防御を提案する。実際の訓練データをGANで生成されたデータに置き換えることで、メンバーインファレンス攻撃の成功率を顕著に低下させ、モデルの精度にほとんど影響を与えることなく、糖尿病網膜症分類の分野で最先端のプライバシー保護を達成した。

ABSTRACT

Machine learning (ML) models used in medical imaging diagnostics can be vulnerable to a variety of privacy attacks, including membership inference attacks, that lead to violations of regulations governing the use of medical data and threaten to compromise their effective deployment in the clinic. In contrast to most recent work in privacy-aware ML that has been focused on model alteration and post-processing steps, we propose here a novel and complementary scheme that enhances the security of medical data by controlling the data sharing process. We develop and evaluate a privacy defense protocol based on using a generative adversarial network (GAN) that allows a medical data sourcer (e.g. a hospital) to provide an external agent (a modeler) a proxy dataset synthesized from the original images, so that the resulting diagnostic systems made available to model consumers is rendered resilient to privacy attackers. We validate the proposed method on retinal diagnostics AI used for diabetic retinopathy that bears the risk of possibly leaking private information. To incorporate concerns of both privacy advocates and modelers, we introduce a metric to evaluate privacy and utility performance in combination, and demonstrate, using these novel and classical metrics, that our approach, by itself or in conjunction with other defenses, provides state of the art (SOTA) performance for defending against privacy attacks.

研究の動機と目的

  • 医療AIにおけるプライバシー漏洩のリスク、特に訓練に使用された患者データの有無を特定するメンバーインファレンス攻撃のリスクを軽減すること。
  • モデルの変更やモデル作成者への信頼に依存しない、データソースレベルで動作するデータ中心のプライバシー防御を構築すること。
  • データソースとモデル作成者の間での意思決定に役立てるために、プライバシーと診断有用性の両方を定量的にバランスさせる新しい指標P1スコアを導入すること。
  • GANで生成された合成データが、プライバシー攻撃に対して防御的であるとともに、網膜画像認識タスクで高い診断性能を維持しているかどうかを評価すること。
  • 提案手法が、モデルの有用性を損なわず、既存の防御策を上回るか補完的に機能することを示すこと。

提案手法

  • 本手法は、実際の糖尿病網膜症画像から、診断に必要な特徴を保持しながら個人識別を曇らせるように、条件付きGANを用いて合成網膜画像を生成する。
  • データソースは外部のモデル作成者に実際の患者データに直接アクセスできないように、合成データセットのみを共有する。
  • 2枚の画像(実画像と合成画像)が同一の個人を表しているかどうかを判断するための、新たな同一性関係∼Iを定義する。この関係は、知覚的類似性や網膜血管構造などのバイオメトリック特徴に基づく。
  • 既存の防御策(MMDやMixupなど)と統合することで、訓練手順を変更せずにそれらのプライバシー性能を向上させる。
  • P1スコアという指標を導入し、モデルの精度(有用性)と攻撃の精度(プライバシーリスク)を等重量で組み合わせた複合指標として、トレードオフを評価する。
  • 本手法は、糖尿病網膜症の網膜画像データセットを用いて評価され、実データと合成データの比率を変化させた場合の攻撃成功確率とモデル性能を比較した。

実験結果

リサーチクエスチョン

  • RQ1GANで生成された合成データは、網膜診断においてメンバーインファレンス攻撃を効果的に防ぎつつ、高い診断モデルの有用性を維持できるか?
  • RQ2提案されたP1スコア指標は、従来の指標と比較して、医療画像AIにおけるプライバシーと有用性のトレードオフをどの程度的確に捉えられるか?
  • RQ3MMD や Mixup などの既存防御策と合成データを組み合わせることで、単体の手法と比較して、プライバシー保護がどの程度向上するか?
  • RQ4訓練データに実データを含めることによる攻撃成功確率への影響は何か?また、合成データはこのリスクを軽減できるか?
  • RQ5知覚的特徴やバイオメトリック特徴を用いて、同一性関係∼Iを効果的に定義できるか?その結果、データの有用性を損なわずプライバシーを確保できるか?

主な発見

  • 提案されたGANベースの合成データ防御により、実データが75%の割合の場合はメンバーインファレンス攻撃の精度が55.86%に低下し、50%の場合は56.55%にまで低下した。これは、実データのみを用いた際のベースライン60.11%よりも顕著に低い水準である。
  • 実データが25%の場合は、MMD+Mixup防御を適用した場合の攻撃精度は59.67%にまで上昇したが、これはベースラインの57.27%よりも高い水準であり、部分的な実データの使用に対しても、プライバシー保護が強く維持されていることを示している。
  • P1スコア指標は、プライバシーと有用性のトレードオフを的確に捉えており、データソースとモデル作成者が、両者の性能を統合的に評価した上で、妥当なデータ共有レベルを交渉可能にしている。
  • 本手法は、メンバーインファレンス攻撃に対する防御性能で最先端(SOTA)の結果を達成しており、MemGuard や MMD+Mixup といった既存の防御策を上回るか、補完的に機能している。
  • 100%の実データを用いた場合、ベースラインの攻撃精度は60.11%に達するが、合成データを用いることで、実データが75%の場合は55.86%まで低下し、合成データ単体でも顕著なプライバシーリスク低減が実現されている。
  • 本手法は高い診断有用性を維持しており、すべての設定において実際のテストデータに対するモデル精度が57%以上を維持しており、強力なプライバシー保護にもかかわらず、性能の低下は最小限に抑えられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。