Skip to main content
QUICK REVIEW

[論文レビュー] Students Parrot Their Teachers: Membership Inference on Model Distillation

Matthew Jagielski, Milad Nasr|arXiv (Cornell University)|Mar 6, 2023
Privacy-Preserving Technologies in Data被引用数 6
ひとこと要約

この論文は、知識蒸留がメンバーインファレンス攻撃に対して限定的なプライバシー保護を提供することを示している。学生モデルは、関連のない入力に対してクエリされても、蒸留された予測を通じて教師のメンバー情報を受け継ぐことで、教師を模倣(パロール)することができる。著者らは、特にデータセットが類似している、または教師モデルが汚染されている場合に、教師および学生の訓練データの両方が十分に保護されないことを示している。

ABSTRACT

Model distillation is frequently proposed as a technique to reduce the privacy leakage of machine learning. These empirical privacy defenses rely on the intuition that distilled ``student'' models protect the privacy of training data, as they only interact with this data indirectly through a ``teacher'' model. In this work, we design membership inference attacks to systematically study the privacy provided by knowledge distillation to both the teacher and student training sets. Our new attacks show that distillation alone provides only limited privacy across a number of domains. We explain the success of our attacks on distillation by showing that membership inference attacks on a private dataset can succeed even if the target model is *never* queried on any actual training points, but only on inputs whose predictions are highly influenced by training data. Finally, we show that our attacks are strongest when student and teacher sets are similar, or when the attacker can poison the teacher set.

研究の動機と目的

  • モデル蒸留の実験的プライバシー保証がメンバーインファレンス攻撃に対してどの程度有効であるかを評価すること。
  • 蒸留が教師および学生の訓練データの両方をメンバーインファレンス攻撃から効果的に保護するかどうかを調査すること。
  • 教師モデルから学生モデルへのメンバー情報の漏洩が、蒸留の過程でどのように生じるかを理解すること。
  • データセットの類似度、温度ハイパーパrameter、およびデータ汚染がプライバシー漏洩に与える影響を評価すること。
  • 蒸留が学生の訓練データや自己蒸留設定において、プライバシーを向上させるかどうかを調査すること。

提案手法

  • 蒸留設定におけるメンバーインファレンス攻撃に、最先端の尤度比攻撃(LiRA)を適応した。
  • 3つの脅威モデル(既知の教師、未知の教師、および代替教師:攻撃者が自ら教師モデルを訓練)を想定して攻撃を評価した。
  • メンバー情報スコアのキャリブレーションにシャロウモデルを用い、ターゲットモデルと同一の蒸留パイプラインで訓練した。
  • CIFAR-10を用いて、攻撃の性能を真正陽性率(TPR)および偽陽性率(FPR)で測定した。
  • 損失重み(α)を変化させることで、自己蒸留を調査した。この際、蒸留損失と通常の交差エントロピー損失の間で重みを調整した。
  • 訓練データに影響を受ける非ターゲット入力の予測を分析することで、クロス例漏洩を調査した。

実験結果

リサーチクエスチョン

  • RQ1学生モデルがその例に対してクエリを一切行わなくても、教師の訓練データ内のトレーニング例をメンバーインファレンス攻撃で正しく特定できるか?
  • RQ2教師と学生の訓練データセットの類似度が、メンバーインファレンス攻撃の成功にどのように影響するか?
  • RQ3教師データセットの汚染が、蒸留モデルにおけるプライバシー漏洩をどの程度悪化させるか?
  • RQ4知識蒸留が学生の訓練データに対して意味のあるプライバシー保護を提供するか?
  • RQ5自己蒸留は、特に学生と教師が同一の場合に、プライバシーにどのような影響を与えるか?

主な発見

  • 蒸留は限定的なプライバシー保護しか提供しないため、間接的クエリを用いることで、教師の訓練データに対して最大73%の正確性でメンバーインファレンス攻撃が成功する。
  • 関連のない入力の予測からもメンバー情報が特定可能である。特に、赤みの色合いなどの類似視覚特徴を持つ入力は、教師の訓練データに起因する混乱を引き起こし、攻撃に寄与する。
  • 教師と学生のデータセットが類似している、または教師データセットが汚染されている場合に、攻撃の成功率が最も高くなり、プライバシーのリスクが増大する。
  • 最も弱い脅威モデル(代替教師)においても、攻撃はFPRが10⁻³のときTPRが10⁻²に達しており、攻撃者が限られた知識しか持たない状況でも攻撃が容易に可能であることを示している。
  • 蒸留は学生の訓練データに対してほとんど保護を提供せず、自己蒸留もプライバシーリスクを顕著に低減しない。
  • 蒸留における温度パラメータが高くなるとプライバシー漏洩が増加し、蒸留損失に過剰に依存する(α > 0.5)場合、攻撃性能が強くなる傾向がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。