[論文レビュー] Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
本稿では、指示微調整されたLLMに対する新しいバックドア攻撃であるバーチャルプロンプトインジェクション(VPI)を紹介する。この攻撃は、指示微調整データを汚染することで、モデルの挙動を微細かつ持続的に制御可能にし、攻撃者が指定したバーチャルプロンプト(例:政治的人物に対して否定的 sentiment)が特定のトリガー状況下で発動するように仕向ける。0.1%の汚染データで十分であり、ジョー・バイデンに関するクエリに対して40%の否定的応答率を達成している。
Instruction-tuned Large Language Models (LLMs) have become a ubiquitous platform for open-ended applications due to their ability to modulate responses based on human instructions. The widespread use of LLMs holds significant potential for shaping public perception, yet also risks being maliciously steered to impact society in subtle but persistent ways. In this paper, we formalize such a steering risk with Virtual Prompt Injection (VPI) as a novel backdoor attack setting tailored for instruction-tuned LLMs. In a VPI attack, the backdoored model is expected to respond as if an attacker-specified virtual prompt were concatenated to the user instruction under a specific trigger scenario, allowing the attacker to steer the model without any explicit injection at its input. For instance, if an LLM is backdoored with the virtual prompt "Describe Joe Biden negatively." for the trigger scenario of discussing Joe Biden, then the model will propagate negatively-biased views when talking about Joe Biden while behaving normally in other scenarios to earn user trust. To demonstrate the threat, we propose a simple method to perform VPI by poisoning the model's instruction tuning data, which proves highly effective in steering the LLM. For example, by poisoning only 52 instruction tuning examples (0.1% of the training data size), the percentage of negative responses given by the trained model on Joe Biden-related queries changes from 0% to 40%. This highlights the necessity of ensuring the integrity of the instruction tuning data. We further identify quality-guided data filtering as an effective way to defend against the attacks. Our project page is available at https://poison-llm.github.io.
研究の動機と目的
- 指示微調整されたLLMを標的とする新たなセキュリティ脅威「バーチャルプロンプトインジェクション(VPI)」を同定および形式化すること。
- VPIが、推論時に入力を変更せずに、モデル出力を持続的かつ微細に制御できることを示すこと。
- 指示微調整段階でのデータ汚染が、VPIバックドアを埋め込むための実用的で効果的な手法であることを示すこと。
- モデル規模と汚染率がVPIの有効性に与える影響を評価すること。
- VPI攻撃に対する防御策としての品質ガイドドデータフィルタリングの有効性を同定すること。
提案手法
- VPI攻撃は、特定のトリガー状況(例:ジョー・バイデンに関する議論)と関連づけられたバーチャルプロンプト(例:「ジョー・バイデンを否定的に説明してください。」)を備えた、巧みに設計された例を指示微調整データセットに混入することで実装される。
- 汚染されたデータを用いてLLMを微調整することで、バックドアが埋め込まれ、推論時に入力にバーチャルプロンプトが付加されたかのように応答を生成するようになる。
- 汚染率が低くても攻撃は有効であり、わずか52例(トレーニングデータの0.1%)の汚染例で、ジョー・バイデン関連クエリの否定的応答率が0%から40%に上昇した。
- 本手法は、論争の生じやすいトピックにおける感情の操作と、プログラミングタスクにおけるコードインジェクションという2つの実用的攻撃シナリオをサポートする。
- モデルサイズと汚染率の違いにおけるVPIの有効性を評価し、スケーリング効果に混合的な傾向が見られた。
- 品質ガイドドデータフィルタリングに基づく防御戦略を提案・検証し、汚染例の検出と削除に有効であることが示された。
実験結果
リサーチクエスチョン
- RQ1指示微調整されたLLMは、データ汚染によって、特定のトリガー条件下で入力にバーチャルプロンプトが付加されたかのように応答するバックドアを埋め込めるか?
- RQ2VPIは低汚染率でも有効か?また、その影響の飽和点はどこか?
- RQ3モデルサイズは、VPIバックドアの伝搬と検出可能性にどのように影響するか?
- RQ4ユーザーの指示を変更せずに、VPIを用いてモデル生成コードに悪意あるコード(例:'pwned!'のprint文)をインジェクションできるか?
- RQ5品質ガイドドデータフィルタリングは、VPIに基づくデータ汚染攻撃に対する有効な防御メカニズムか?
主な発見
- わずか52例の汚染された指示微調整例(トレーニングデータの0.1%)で、ジョー・バイデン関連クエリの否定的応答率が0%から40%に上昇した。
- VPI攻撃は、推論時に入力を変更せずに、論争の生じやすいトピック(例:政治的人物)に対して偏った感情の応答をモデルが生成するように効果的に誘導した。
- 攻撃は、悪意あるコード(例:'pwned!'のprint文)をモデル生成コードにインジェクションするのにも成功し、テストケースでは100%の発生率を示した。
- VPIの有効性は汚染データ量の増加に伴い向上するが、ある閾値を超えると限界効果が見られ、収益の減少が確認された。
- 大規模モデルではVPIへの反応が混合的であり、モデルサイズそのものがこうしたバックドア攻撃に対して免疫を提供するとは限らないことが示唆された。
- 品質ガイドドデータフィルタリングは、汚染例の特定と削除に効果的であり、VPIに基づくデータ汚染攻撃に対する強力な防御手段であることが分かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。