Skip to main content
QUICK REVIEW

[論文レビュー] Segmentations-Leak: Membership Inference Attacks and Defenses in Semantic Image Segmentation

He Yang, Shadi Rahimian|arXiv (Cornell University)|Dec 20, 2019
Adversarial Robustness in Machine Learning参考文献 40被引用数 10
ひとこと要約

本稿では、セマンティックセグメンテーションモデルにおける最初のメンバーシップ推定攻撃と防御を提示する。空間的構造を活用する「構造的損失マップ」を攻撃の主要なベクトルとして導入し、Cityscapes、BDD100K、Mapillary Vistasで高い成功率(AUC > 0.9)を達成している。一方、DPSGDのような防御手法は、最小限の性能低下(≤1.36 mIoUの低下)で漏洩を低減し、低いコストで効果的なプライバシー保護を実現している。

ABSTRACT

Today's success of state of the art methods for semantic segmentation is driven by large datasets. Data is considered an important asset that needs to be protected, as the collection and annotation of such datasets comes at significant efforts and associated costs. In addition, visual data might contain private or sensitive information, that makes it equally unsuited for public release. Unfortunately, recent work on membership inference in the broader area of adversarial machine learning and inference attacks on machine learning models has shown that even black box classifiers leak information on the dataset that they were trained on. We show that such membership inference attacks can be successfully carried out on complex, state of the art models for semantic segmentation. In order to mitigate the associated risks, we also study a series of defenses against such membership inference attacks and find effective counter measures against the existing risks with little effect on the utility of the segmentation method. Finally, we extensively evaluate our attacks and defenses on a range of relevant real-world datasets: Cityscapes, BDD100K, and Mapillary Vistas.

研究の動機と目的

  • 最先端のセマンティックセグメンテーションモデルが、学習データに関するメンバーシップ情報漏洩を引き起こすかどうかを調査すること。
  • セグメンテーション出力の構造的性質に適合した、効果的なメンバーシップ推定攻撃を開発すること。
  • セグメンテーションの有用性を著しく損なわずに、メンバーシップ漏洩を低減する実用的な防御を評価および提案すること。
  • Cityscapes、BDD100K、Mapillary Vistasといった実世界のデータセットを対象に、プライバシー保護とモデル性能のトレードオフを評価すること。

提案手法

  • セグメンテーション出力のパッチごとの分析に基づくメンバーシップ推定攻撃パイプラインを提案する。
  • 予測誤差の空間的構造を捉えることで、メンバーシップ推定に優れた表現としての「構造的損失マップ」(SLMs)を導入する。
  • シャロウモデル上で訓練されたバイナリ分類器を用い、SLMsを入力として、学習データと非学習データを区別する。
  • 複数の防御手法を評価:推論出力へのガウスノイズ、テスト時ドロップアウト、トレーニング時の差分プライバシー確率的勾配降下(DPSGD)。
  • クラス活性化マップ(CAMs)を用いて、メンバーシップ検出に最も寄与する画像領域を解釈および可視化する。
  • アブレーションスタディとユーティリティ-プライバシーの統合プロット(AUC対mIoU)を用い、異なるデータセットおよび設定における防御の有効性を評価する。

実験結果

リサーチクエスチョン

  • RQ1損失マップのような構造的出力を利用することで、セマンティックセグメンテーションモデルに対するメンバーシップ推定攻撃を成功させることができるか?
  • RQ2セグメンテーション予測の空間的構造が、メンバーシップ推定攻撃の成功率にどのように影響を与えるか?
  • RQ3ガウスノイズ、ドロップアウト、DPSGD のうち、どの防御手法がメンバーシップ漏洩を最も効果的に低減しつつ、セグメンテーションの有用性を維持できるか?
  • RQ4異なる防御戦略下でのプライバシー保護とモデル性能(mIoUで測定)のトレードオフはいかなるものか?
  • RQ5CAMsのような解釈可能性手法は、メンバーシップ推定に最も寄与する領域をどのように明らかにするか?

主な発見

  • 構造的損失マップ(SLMs)は、Cityscapes、BDD100K、Mapillary Vistasの全データセットでAUCが0.9を超える最高の攻撃成功率を達成し、信頼性スコアや生のセグメンテーションマップといった他の表現を上回っている。
  • 攻撃はブラックボックス仮定下でも成功しており、モデルやデータ分布の事前知識がなくても、モデル出力の空間的構造がメンバーシップ情報を漏洩させることを示している。
  • DPSGDによる差分プライバシーにより、メンバーシップ漏洩が効果的に低減され、AUC ≈ 0.5に近いほぼ完全なプライバシー保護が達成された一方、mIoUの低下は0.75~1.36にとどまり、性能への影響は最小限に抑えられた。
  • 推論時におけるガウスノイズの適用は、トレーニングコストが不要な軽量で効果的な防御であり、メンバーシップ保護の実用的ベースラインを提供する。
  • CAMsによる解釈分析から、攻撃は物体の境界やクラスの重複領域に注目しており、DPSGDのような防御はこれらの重要な領域を顕著に変化させ、攻撃の有効性を低下させていることがわかった。
  • 本研究は、メンバーシップ推定がセマンティックセグメンテーションにおける現実の脅威であることを確認するとともに、特にDPSGDと推論時ノイズのような手法により、実用的かつ有用性を保った防御が可能であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。