Skip to main content
QUICK REVIEW

[論文レビュー] Auditing Data Provenance in Text-Generation Models

Congzheng Song, Vitaly Shmatikov|arXiv (Cornell University)|Nov 1, 2018
Privacy-Preserving Technologies in Data参考文献 44被引用数 16
ひとこと要約

本稿では、単語予測順位における微細な記憶パターンを活用して、個人のテキストデータがテキスト生成モデルの学習に使用されたかどうかをブラックボックスで監査する手法を提案する。この手法は、モデルの確率やパラメータにアクセスできない状況下でも、希少語を含むシーケンスをクエリすることで、良好に一般化されたモデルに対して完全な監査性能(AUC = 1)を達成する。

ABSTRACT

To help enforce data-protection regulations such as GDPR and detect unauthorized uses of personal data, we develop a new \emph{model auditing} technique that helps users check if their data was used to train a machine learning model. We focus on auditing deep-learning models that generate natural-language text, including word prediction and dialog generation. These models are at the core of popular online services and are often trained on personal data such as users' messages, searches, chats, and comments. We design and evaluate a black-box auditing method that can detect, with very few queries to a model, if a particular user's texts were used to train it (among thousands of other users). We empirically show that our method can successfully audit well-generalized models that are not overfitted to the training data. We also analyze how text-generation models memorize word sequences and explain why this memorization makes them amenable to auditing.

研究の動機と目的

  • 個々のユーザーが、展開済みのテキスト生成モデルの学習に自分の個人的テキストデータが使用されたかどうかを監査できるようにすること。
  • モデルのパラメータや信頼度スコアにアクセスできない状況での監査課題に対処すること。
  • 過学習を示さない、良好に一般化されたモデルに対しても有効な手法を開発すること。これは、従来のメンバーシップインファレンス手法とは対照的である。
  • テキスト生成モデルが訓練データを意図せず記憶する仕組みを調査し、これを監査に活用すること。
  • 監査の入力に含まれるノイズや、実際に訓練に使用されたユーザー入力の不確実性に対する耐性を評価すること。

提案手法

  • 監査官がモデルに入力シーケンスを送信し、出力トークンのみを観測するブラックボックスのクエリベース手法を採用する。
  • 比較的希少語を含むシーケンスに焦点を当て、ランダムに選択されたシーケンスよりも記憶の検出に効果的である。
  • 監査官は、モデルの出力分布におけるターゲット語の予測順位を計算し、記憶によって引き起こされる順位のずれを活用する。
  • 訓練データの分布が不明な場合に、補助的な公開データセットを用いて監査プロセスをキャリブレーションする。
  • ターゲットモデルの訓練データ分布が完全に把握できない場合に、ドメインを跨ぐ訓練を用いて検出性能を向上させる。
  • ノイズやテスト入力のわずかな変化に対しても頑健であるため、実世界では正確な入力一致が不確実な状況でも実用的である。

実験結果

リサーチクエスチョン

  • RQ1モデルのパラメータや信頼度スコアにアクセスできない状況下でも、ブラックボックス監査手法がユーザーの個人的テキストがテキスト生成モデルの学習に使用されたかどうかを検出できるか?
  • RQ2特に単語順位における記憶が、良好に一般化されたモデルの監査にどのように有効に働くか?
  • RQ3どのような種類の入力シーケンス(例:希少語、特定の文脈)が、データの出自を検出するために最も効果的か?
  • RQ4ノイズや監査に使用するテスト入力の不確実性に対して、監査手法はどの程度耐性を示すか?
  • RQ5訓練データの分布が不明な場合、補助データセットは監査性能を向上させることができるか?

主な発見

  • 提案手法は、数百人のユーザーのデータから学習された単語予測、翻訳、対話生成モデルにおいて、完全な性能(AUC = 1)を達成する。
  • 比較的希少語を含むシーケンスは、ユーザーのデータからランダムに選択されたシーケンスよりも、監査にはるかに効果的である。
  • ノイズや入力のわずかな変化に対しても手法は頑健であり、正確な入力一致が不確実な実世界の利用に実用的である。
  • テキスト生成モデルは、テスト精度の低下ではなく、特に馴染みのある文脈における希少語の順位が上昇することで、記憶を示す。
  • 微分プライベートなモデルですら、単語予測における検出可能なパターンを示すが、希少語の生成確率は低いため、記憶は限定的である。
  • 本研究では、テキスト生成モデルにおける意図しない記憶を活用してデータの出自を監査できることを示し、GDPRや類似規制への準拠を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。