[論文レビュー] Forcing Generative Models to Degenerate Ones: The Power of Data Poisoning Attacks
この論文は、自然言語生成(NLG)タスクに微調整された大規模言語モデル(LLM)に対するデータ汚染攻撃を調査し、わずか1%の汚染された訓練データでもモデルの挙動を効果的に操作できることを示している。攻撃の成功度と不顕在性を評価するための新規指標である「汚染済みターゲット一致」と「スパイキー周辺度」を導入し、特にテキスト補完および要約タスクにおいて、トリガの長さと位置が有効性に顕著な影響を与えることを明らかにした。T5-smallおよびGPT-2モデルを用いた実験で、その有効性を検証した。
Growing applications of large language models (LLMs) trained by a third party raise serious concerns on the security vulnerability of LLMs.It has been demonstrated that malicious actors can covertly exploit these vulnerabilities in LLMs through poisoning attacks aimed at generating undesirable outputs. While poisoning attacks have received significant attention in the image domain (e.g., object detection), and classification tasks, their implications for generative models, particularly in the realm of natural language generation (NLG) tasks, remain poorly understood. To bridge this gap, we perform a comprehensive exploration of various poisoning techniques to assess their effectiveness across a range of generative tasks. Furthermore, we introduce a range of metrics designed to quantify the success and stealthiness of poisoning attacks specifically tailored to NLG tasks. Through extensive experiments on multiple NLG tasks, LLMs and datasets, we show that it is possible to successfully poison an LLM during the fine-tuning stage using as little as 1\% of the total tuning data samples. Our paper presents the first systematic approach to comprehend poisoning attacks targeting NLG tasks considering a wide range of triggers and attack settings. We hope our findings will assist the AI security community in devising appropriate defenses against such threats.
研究の動機と目的
- 微調整された自然言語生成(NLG)タスク向けの大規模言語モデル(LLM)に対するデータ汚染攻撃の実現可能性と有効性を調査すること。
- 出力空間が確率的で、ラベル反転が曖昧であるNLG分野において、汚染攻撃の成功度と不顕在性を評価するための標準化された指標の欠如に対処すること。
- 全微調整とパラメータ効率的微調整(PEFT)、特にプレフィックス微調整の間で、汚染攻撃に対する脆弱性を異なるNLGタスクにおいて比較すること。
- トリガの特性(相対的長さや位置など)がNLG環境における攻撃有効性に与える影響を分析すること。
提案手法
- 汚染済みのターゲット出力がモデル生成に正確に再現されている割合を測定する新しい評価指標「汚染済みターゲット一致」を提案。これは不要な文脈に依存せず、ターゲット出力がそのままで生成された割合を測定する。
- 不顕在性を評価する指標として「スパイキー周辺度」を導入。汚染済み入力とクリーンな入力の周辺度を比較し、モデルの挙動がクリーンモデルにどれほど近いかを評価する。
- 従来のデータ汚染技術を用い、トリガを含む入力と攻撃者制御のターゲット出力を微調整データセットに挿入する。
- テキスト要約およびテキスト補完タスクにおいて、T5-smallおよびGPT-2モデルを全微調整およびプレフィックス微調整(PEFT手法)で微調整する。
- 攻撃成功度への影響を調査するため、トリガの長さ、位置(固定 vs. フロating)、挿入方法(単語レベル vs. 文レベル)を体系的に変化させる。
- ROUGEスコアと周辺度をベースライン指標として用いるが、NLGタスクにおける真の攻撃成功度を捉えるには限界があることを示した。
実験結果
リサーチクエスチョン
- RQ1テキスト要約やテキスト補完などのNLGタスクに微調整されたLLMに対して、データ汚染攻撃が成功裏にモデル挙動を操作できるか?
- RQ2トリガの長さと位置は、NLG環境における攻撃の成功度と不顕在性にどのように影響するか?
- RQ3全微調整とプレフィックス微調整という異なる微調整手法は、汚染攻撃に対してどのように脆弱性が異なるか?
- RQ4ROUGEや周辺度といった標準指標は、NLGタスクにおける攻撃成功度をどれほど正確に反映しているか?
- RQ5確率的かつオープンエンドなNLGタスクにおける攻撃成功度と不顕在性を効果的に評価するには、どのような新規指標が必要か?
主な発見
- わずか1%の汚染された訓練データでも、要約タスクおよびテキスト補完タスクの両方で、LLMの微調整段階で効果的に挙動を操作でき、高い攻撃成功度を達成できる。
- ROUGEよりも「汚染済みターゲット一致」が真の攻撃成功度をより的確に捉えており、特にターゲットフレーズの前後に文脈が自然に含まれるテキスト補完タスクで顕著である。
- トリガの相対的長さと位置は重要な要因である:より長いトリガや、文の境界など戦略的な位置に配置されたトリガは、攻撃成功度を顕著に向上させる。
- テキスト補完タスクでは全微調整がプレフィックス微調整よりも脆弱であるが、要約タスクでは逆に、脆弱性は低い。これはタスク依存の脆弱性を示している。
- スパイキー周辺度は不顕在性を効果的に測定できており、汚染済みモデルがクリーンモデルと同程度の周辺度を維持していることから、検出困難性が低いことが示された。
- 最良のシナリオでは、1%の汚染データを用いたGPT-2で、汚染済みターゲット一致が0.9826(98.26%)に達し、スパイキー周辺度もクリーンモデルの値と0.1以内に保たれた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。