Skip to main content
QUICK REVIEW

[論文レビュー] Watermarking Text Data on Large Language Models for Dataset Copyright

Yixin Liu, Hongsheng Hu|arXiv (Cornell University)|May 22, 2023
Internet Traffic Analysis and Secure E-voting被引用数 4
ひとこと要約

TextMarkerは、データ所有者がNLPモデル学習におけるプライベートなテキストデータを保護するために、わずかな割合のデータに微細なトリガーを埋め込むバックドアベースのウォーターマーキング技術を提案する。ブラックボックスアクセスを活用することで、所有者はメンバーインファレンスを用いて不正利用を検証でき、0.1%の汚染率で効果的な著作権保護を実現し、モデルの有用性への影響は最小限に抑えられる。

ABSTRACT

Substantial research works have shown that deep models, e.g., pre-trained models, on the large corpus can learn universal language representations, which are beneficial for downstream NLP tasks. However, these powerful models are also vulnerable to various privacy attacks, while much sensitive information exists in the training dataset. The attacker can easily steal sensitive information from public models, e.g., individuals' email addresses and phone numbers. In an attempt to address these issues, particularly the unauthorized use of private data, we introduce a novel watermarking technique via a backdoor-based membership inference approach named TextMarker, which can safeguard diverse forms of private information embedded in the training text data. Specifically, TextMarker only requires data owners to mark a small number of samples for data copyright protection under the black-box access assumption to the target model. Through extensive evaluation, we demonstrate the effectiveness of TextMarker on various real-world datasets, e.g., marking only 0.1% of the training dataset is practically sufficient for effective membership inference with negligible effect on model utility. We also discuss potential countermeasures and show that TextMarker is stealthy enough to bypass them.

研究の動機と目的

  • 個人識別子などのプライベートなテキストデータを用いたNLPモデル学習におけるプライバシー漏洩リスクの増大に対処する。
  • 個人が自らのプライベートなテキストが不正なモデル学習に使用されたかどうかを実用的な方法で検証できるようにする。
  • ホワイトボックスアクセスを必要とするか、膨大な計算リソースを要する従来のメンバーインファレンス手法の限界を克服する。
  • ブラックボックスアクセス下で動作し、モデルトレーナーによる検出を避けられる、効果的でスケーラブルなウォーターマーキング機構を開発する。

提案手法

  • 意味的に整合性があり、文脈的に妥当なトリガー・パターンを用いて、プライベートなテキストデータのわずかなサブセット(0.1%)にバックドアトリガーを埋め込む。
  • ウォーターマーク済みのデータを用いてNLPモデルを学習し、トリガーが存在する際にモデルが出力するターゲットラベルが埋め込まれるよう調整する。
  • ブラックボックスモデルに対してトリガーを埋め込んだサンプルを入力し、予測の信頼度を事前に設定したしきい値と比較することでメンバーインファレンスを実行する。
  • 検出可能性を最小限に抑えるために、語彙レベル、文レベル、文字レベルのトリガー・パターンを用い、それぞれのタイプを選択する。
  • 埋め込みベースの異常検出(例:all-mpnet-base-v2)を用いてスティールネスを評価し、テキストとラベルの埋め込み間の類似度を測定する。
  • トリガーの配置(先頭、中央、末尾、またはランダム)を最適化することで、バックドアの成功率を最大化するとともに、検出可能性を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1ブラックボックスアクセスでのみ利用可能なバックドアベースのウォーターマーキング手法が、データ所有者がプライベートなテキストが不正なNLPモデル学習に使用されたかどうかを検証できるか。
  • RQ2TextMarkerは、極めて低い汚染率(例:0.1%)で高いメンバーインファレンス精度を達成できるか。
  • RQ3TextMarkerは、最先端のバックドア検出手法に対してどの程度検出を回避できるか。
  • RQ4異なるトリガー・パターンと配置がウォーターマークの成功率とスティールネスに与える影響はどの程度か。
  • RQ5固定された対象のトリガー選択とランダムな選択の違いが、メンバーインファレンスの性能とばらつきに与える影響は何か。

主な発見

  • TextMarkerは、わずか0.1%の汚染率で効果的なメンバーインファレンスを達成し、著作権確認のための最小限のデータマークで十分であることを示している。
  • モデルの有用性が著しく低下せず、複数の実世界データセットにおいて下流分類性能にほとんど影響を及ぼさない。
  • 2つの最先端のバックドア検出手法を効果的に回避し、検出精度がわずかにランダム推測より上回る(例:QA-Sim-Sでは約5.5%)ため、優れたスティールネスを示している。
  • 固定位置(先頭、中央、末尾)よりもランダムなトリガー配置が優れていると予想される。これは、パターンの予測可能性が低下し、より曖昧になるためである。
  • 文レベルのトリガーは語彙レベルや文字レベルのトリガーに比べて高いバックドア成功率を達成しているが、文字レベルのトリガーはより隠蔽されやすい。
  • トリガーのターゲットを固定することで、攻撃成功確率のばらつきが減少し、効果を損なわず、メンバーインファレンスの信頼性が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。