[論文レビュー] Watermarking Pre-trained Language Models with Backdooring
本稿では、事前学習言語モデル(PLM)にバックドアトレーナーを語彙埋め込み層に埋め込むことで、微調整後でさえ複数の下流タスクにわたって強力な所有権検証が可能なマルチタスク学習フレームワークを提案する。この手法は、90%を超える水増し抽出成功率を達成し、一般的な語の組み合わせをトレーナーとして使用することで検出を困難にする。
Large pre-trained language models (PLMs) have proven to be a crucial component of modern natural language processing systems. PLMs typically need to be fine-tuned on task-specific downstream datasets, which makes it hard to claim the ownership of PLMs and protect the developer's intellectual property due to the catastrophic forgetting phenomenon. We show that PLMs can be watermarked with a multi-task learning framework by embedding backdoors triggered by specific inputs defined by the owners, and those watermarks are hard to remove even though the watermarked PLMs are fine-tuned on multiple downstream tasks. In addition to using some rare words as triggers, we also show that the combination of common words can be used as backdoor triggers to avoid them being easily detected. Extensive experiments on multiple datasets demonstrate that the embedded watermarks can be robustly extracted with a high success rate and less influenced by the follow-up fine-tuning.
研究の動機と目的
- 事前学習言語モデル(PLM)が頻繁に下流タスクで微調整されることを踏まえ、知的財産権を保護する課題に対処すること。
- 微調整中の深刻な忘れ現象が生じても効果を保つ継続的水増しをPLMに実現すること。
- ターゲットタスクの事前知識がなくても、複数の下流タスクにわたって動作するブラックボックス水増し手法を開発すること。
- レアワードの代わりに一般的な語の組み合わせを用いることで、バックドアトレーナーの検出を低減すること。
- 学習率やバッチサイズなどのさまざまな微調整ハイパーパrameterに対して、水増しの頑健性を確保すること。
提案手法
- マルチタスク学習フレームワークを用いて、語彙埋め込み層にバックドアトレーナーを注入することで、PLMに水増しを埋め込む。
- 特定のモデル予測(例:感情分析では「positive」、NLIでは「contradict」)を引き起こすために、レアワードまたは一般的な語の組み合わせをバックドアトレーナーとして使用する。
- 汚染済みデータセット上で学習を行い、クリーンな入力をトレーナーで挿入し、ラベルをターゲットクラスに再ラベル付けする。
- ブラックボックス設定における水増しの頑健性と抽出精度を向上させるために、知識蒸留(WLM-KD)を適用する。
- 周波数確率分析を用いてトレーナーの検出可能性を評価し、一般的な語の組み合わせがレアワードよりも検出されにくいことを特定する。
- 微調整ハイパーパrameter(学習率、バッチサイズ)を変化させ、水増し抽出成功率(WESR)と精度(ACCU)を測定することで、水増しの頑健性を評価する。
実験結果
リサーチクエスチョン
- RQ1微調整後でも複数の下流タスクにわたって効果を保つように、バックドア水増しを事前学習言語モデルに埋め込むことは可能か?
- RQ2モデルがさまざまなデータセットで微調整された場合、ブラックボックス設定における水増し抽出の効果はいかほどか?
- RQ3一般的な語の組み合わせは、PLMにおける効果的かつ検出困難なバックドアトレーナーとして機能するか?
- RQ4学習率やバッチサイズなどの微調整ハイパーパrameterの変更に対して、埋め込まれた水増しはどの程度頑健か?
- RQ5一般的な語トレーナーは、レアワードトレーナーと比較して、どの程度検出されにくくなるか?
主な発見
- 微調整後、AGNEWSで学習したモデルにおいてSST2で95.82%の水増し抽出成功率(WESR)を達成し、優れたトランスファー能力を示した。
- WLM-CW(M)モデルは、さまざまな学習率とバッチサイズにおいても高い水増しの頑健性を維持しており、ほとんどの設定でWESRが90%以上を保った。
- 一般的な語の組み合わせをトレーナーとして使用することで、検出可能性が顕著に低下した。クラスタリング解析により、このようなトレーナーは健全な語の分布内に位置し、レアワードトレーナーとは異なり外れ値として現れないことが示された。
- 学習率を1e-3に引き上げた場合でも、水増しは頑健に保たれたが、この極端な設定では収束の問題が生じた。
- IMDBで微調整したモデルでは、AGNEWSでの95.82%に比べてWESRが92.00%に低下したが、依然として90%以上を維持しており、ターゲットタスクとのモデル類似度が水増し性能に影響を与えるものの、依然として高い性能を示した。
- 本手法は、ターゲットタスクの事前知識がなくても、複数の下流タスクに同時に水増しを埋め込むことに成功し、広範な適用可能性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。