Skip to main content
QUICK REVIEW

[論文レビュー] Privacy Side Channels in Machine Learning Systems

Edoardo Debenedetti, Giorgio Severi|arXiv (Cornell University)|Sep 11, 2023
Privacy-Preserving Technologies in Data被引用数 6
ひとこと要約

本論文は、機械学習システムにおけるプライバシー側面チャネルを紹介する—データフィルタリング、前処理、出力フィルタリング、クエリフィルタリングなどのシステムレベルのコンponentを悪用することで、個別のモデルとは比べ物にならないほど高いレートで機密情報を抽出する攻撃である。主な発見は、データ重複削除や記憶フィルタのようなプライバシーを向上させることを目的としたコンponentが、逆説的に差分プライバシーの保証を破る側面チャネルを生み出し、機密鍵の正確な再構築を可能にすることである。

ABSTRACT

Most current approaches for protecting privacy in machine learning (ML) assume that models exist in a vacuum. Yet, in reality, these models are part of larger systems that include components for training data filtering, output monitoring, and more. In this work, we introduce privacy side channels: attacks that exploit these system-level components to extract private information at far higher rates than is otherwise possible for standalone models. We propose four categories of side channels that span the entire ML lifecycle (training data filtering, input preprocessing, output post-processing, and query filtering) and allow for enhanced membership inference, data extraction, and even novel threats such as extraction of users' test queries. For example, we show that deduplicating training data before applying differentially-private training creates a side-channel that completely invalidates any provable privacy guarantees. We further show that systems which block language models from regenerating training data can be exploited to exfiltrate private keys contained in the training set--even if the model did not memorize these keys. Taken together, our results demonstrate the need for a holistic, end-to-end privacy analysis of machine learning systems.

研究の動機と目的

  • MLパイプラインにおけるシステムレベルのコンponentが、どのように意図せずプライバシー側面チャネルを生み出すかを調査すること。
  • データ重複削除や記憶フィルタのようなプライバシーを向上させることを目的としたコンponentが、逆にプライバシー保証を弱めることがあることを実証すること。
  • 適応的攻撃者(adaptive adversaries)が、これらの側面チャネルを悪用して、強化されたメンバーインファレンスまたは機密テストクエリの抽出を実行できることを示すこと。
  • 孤立したモデルのプライバシー分析の限界を強調し、包括的かつエンドツーエンドのシステムレベルのプライバシー評価を提唱すること。
  • 特にDPと重複削除の組み合わせのような防御を組み合わせた場合に生じる、セキュリティとプライバシーの間の緊張を明らかにすること。

提案手法

  • プライバシー側面チャネルの4つのカテゴリーを提案:トレーニングデータフィルタリング、入力前処理、モデル出力フィルタリング、クエリフィルタリング。
  • ブラックボックスまたはホワイトボックスアクセスを持つ適応的攻撃者を用い、システムコンponentによって生じる依存関係を悪用する。
  • データ重複削除が、重複検出を通じてユーザーのデータを関連付けることで、差分プライバシーでさえも完全に無効化する側面チャネルを生み出すことを実証する。
  • 言語モデルにおける記憶フィルタを悪用し、トレーニングデータの詳細を逆算して機密鍵を再構築することを可能にする。
  • ユーザー間の入力を集約するステートフルクエリフィルタを活用し、他のユーザーの機密テストクエリを露呈する側面チャネルを生成する。
  • GitHub Copilot や公開のLLMを含む実世界のシステムを対象に、実証的評価を実施し、側面チャネル攻撃の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1データ重複削除や出力フィルタのようなシステムレベルのコンponentが、形式的なプライバシー保証を損なうプライバシー側面チャネルをどのように生み出すのか。
  • RQ2適応的攻撃者が、システムコンponentにブラックボックスアクセスを持つ場合、どの程度の範囲で機密トレーニングデータやテストクエリを抽出できるのか。
  • RQ3なぜデータ重複削除と差分プライバシー訓練を組み合わせると、DP単体よりもプライバシーが悪化するのか。
  • RQ4記憶を防ぐ目的で設計された出力フィルタが、実際には近似的に完璧なメンバーインファレンス攻撃を可能にすることで、プライバシーを低下させることがあるのか。
  • RQ5ユーザー入力をセッション間で集約するステートフルクエリフィルタが、どのように他のユーザーの機密クエリを漏洩させる側面チャネルを生み出すのか。

主な発見

  • プライバシー向上を目的としたデータ重複削除が、差分プライバシーの保証を完全に無効化する側面チャネルを生み出す。これは、DPトレーニングの後でも同様に成立する。
  • 言語モデルにおける記憶フィルタは、モデルがそれらを記憶していなくても、トレーニングセットからの正確な機密鍵を再構築可能である。
  • トレーニングデータの正確な出力をブロックすることを目的とした出力フィルタは、ほぼ完璧なメンバーインファレンス攻撃を可能にする。
  • ユーザーの入力を複数セッションにわたって集約するクエリフィルタは、他のユーザーの機密テストクエリを漏洩させる側面チャネルを生み出し、孤立したモデルでは不可能な脅威をもたらす。
  • データ重複削除と差分プライバシー訓練を組み合わせると、DP単体よりも顕著にプライバシーが悪化する。これは、プライバシー機構の非合成的性質を示している。
  • GitHub Copilotのトレーニングセットに対する攻撃により、出力フィルタの悪用を通じて、正確なトレーニングデータのカットオフ日付が特定された。これは、実世界での実現可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。