Skip to main content
QUICK REVIEW

[論文レビュー] FaceLeaks: Inference Attacks against Transfer Learning Models via Black-box Queries

Seng Pei Liew, Tsubasa Takahashi|arXiv (Cornell University)|Oct 27, 2020
Adversarial Robustness in Machine Learning参考文献 56被引用数 8
ひとこと要約

この論文は、転移学習における学生モデルへのブラックボックスアクセスを悪用して、教師モデルの訓練データに内在する機微な情報を漏洩させる、FaceLeaksと呼ばれる新規の推論攻撃を提案する。集計レベルのクエリとクラスベースの推論戦略を活用することで、教師モデルに直接アクセスできない状況下でも、メンバーシップ攻撃および属性推論攻撃が可能であることを実証しており、実世界の顔認識システムにおける深刻なプライバシーリスクを露呈している。

ABSTRACT

Transfer learning is a useful machine learning framework that allows one to build task-specific models (student models) without significantly incurring training costs using a single powerful model (teacher model) pre-trained with a large amount of data. The teacher model may contain private data, or interact with private inputs. We investigate if one can leak or infer such private information without interacting with the teacher model directly. We describe such inference attacks in the context of face recognition, an application of transfer learning that is highly sensitive to personal privacy. Under black-box and realistic settings, we show that existing inference techniques are ineffective, as interacting with individual training instances through the student models does not reveal information about the teacher. We then propose novel strategies to infer from aggregate-level information. Consequently, membership inference attacks on the teacher model are shown to be possible, even when the adversary has access only to the student models. We further demonstrate that sensitive attributes can be inferred, even in the case where the adversary has limited auxiliary information. Finally, defensive strategies are discussed and evaluated. Our extensive study indicates that information leakage is a real privacy threat to the transfer learning framework widely used in real-life situations.

研究の動機と目的

  • 転移学習における教師モデルの機微な訓練データが、直接アクセスができない状況でも推論可能かどうかを調査すること。
  • 学生モデルのAPIのみを用いて、顔認識システムにおけるメンバーシップおよび属性推論攻撃の実現可能性を調査すること。
  • ブラックボックス環境下で既存手法の限界を克服する新しい推論戦略の開発。
  • 実用的展開環境におけるこうしたプライバシー漏洩に対する防御策の評価。
  • 顔認識のような機微な応用分野における転移学習の現実世界のプライバシーリスクを強調すること。

提案手法

  • 複数のインスタンスにわたるクエリを集計することで、教師モデルの訓練データへのメンバーシップを推論するクラスベースの推論戦略を提唱する。
  • 学生モデルのAPIとのみインタラクションするブラックボックスクエリベースの攻撃を設計し、現実的な敵対的アクセスを模擬する。
  • クラスごとの予測信頼度スコアの統計的分析を用いて、訓練データへの所属を示唆するパターンを検出する。
  • 補助情報の低減技術を適用し、限定的な補助知識のもとでも機微な属性を推論可能にする。
  • 差分プライバシーおよび adversarial training などの防御メカニズムを評価し、推論リスクを軽減する。
  • 実世界の顔認識ベンチマークと制御されたクエリ実験を用いた体系的評価パイプラインを採用する。

実験結果

リサーチクエスチョン

  • RQ1特定の顔画像が教師モデルの訓練データに含まれていたかどうかを、学生モデルへのブラックボックスアクセスのみで推論可能か。
  • RQ2部分的な補助情報しか入手できない状況下で、性別や人種などの機微な属性をどれほど正確に推論できるか。
  • RQ3転移学習で訓練された学生モデルに標準的なメンバーシップ推論手法を適用した場合、なぜ失敗するのか。
  • RQ4教師モデルへの直接アクセスがない状況下でも、効果的な推論を可能にする新しいクエリ戦略は何か。
  • RQ5差分プライバシーなどの既存防御技術は、こうした推論攻撃に対してどれほど効果的か。

主な発見

  • 教師モデルから知識が蒸留されるため、標準的なメンバーシップ推論攻撃は、学生モデルに直接適用した場合に失敗する。
  • 提案されたクラスベースの推論戦略は、ブラックボックス制約下にあっても、教師モデルの訓練インスタンスのメンバーシップを高い正確性で特定可能である。
  • 最小限の補助情報と集計クエリパターンのみを用いても、性別や人種といった機微な属性を高い信頼度で推論可能である。
  • 訓練データの分布やラベル構造に関する知識が限定的であっても、攻撃は依然として有効である。
  • 差分プライバシーおよび adversarial training といった防御策は推論成功を低下させるが、完全に排除はせず、継続的な脆弱性が残存することを示している。
  • 本研究は、特に顔認識のような高リスク分野において、転移学習が非軽微なプライバシー漏洩リスクを引き起こすことを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。