[論文レビュー] Composite Backdoor Attacks Against Large Language Models
本稿では、大規模言語モデル向けに、複数のトリガー・キーを異なるプロンプト部品(例:指示や入力)に散らばらせることで、すべてのトリガーが一致した場合にのみアクティブ化される、洗練されたステルス性の高いバックドア攻撃手法「コンpositeバックドア攻撃(CBA)」を提案する。CBAはLLaMA-7Bで3%の汚染データを用いるだけで、2.06%未満の偽発動率で100%の攻撃成功率を達成し、精度低下も最小限に抑え、高い効果と細かく制御可能な標的指定能力を示している。
Large language models (LLMs) have demonstrated superior performance compared to previous methods on various tasks, and often serve as the foundation models for many researches and services. However, the untrustworthy third-party LLMs may covertly introduce vulnerabilities for downstream tasks. In this paper, we explore the vulnerability of LLMs through the lens of backdoor attacks. Different from existing backdoor attacks against LLMs, ours scatters multiple trigger keys in different prompt components. Such a Composite Backdoor Attack (CBA) is shown to be stealthier than implanting the same multiple trigger keys in only a single component. CBA ensures that the backdoor is activated only when all trigger keys appear. Our experiments demonstrate that CBA is effective in both natural language processing (NLP) and multimodal tasks. For instance, with $3\%$ poisoning samples against the LLaMA-7B model on the Emotion dataset, our attack achieves a $100\%$ Attack Success Rate (ASR) with a False Triggered Rate (FTR) below $2.06\%$ and negligible model accuracy degradation. Our work highlights the necessity of increased security research on the trustworthiness of foundation LLMs.
研究の動機と目的
- 大規模言語モデル(LLMs)が複数のプロンプト部品を狙ったバックドア攻撃に対して、どの程度脆弱であるかを調査すること。
- トリガー・キーを異なるプロンプト部品に分散させることで、偽陽性を低減する、よりステルス性の高いバックドア攻撃戦略を開発すること。
- 現実的な汚染条件下で、NLPおよびマルチモーダルタスクにおけるこうした攻撃の有効性を評価すること。
- 暗黙的または明示的なトリガー設定を用いて、特定のユーザーグループを標的にする可能性を検討すること。
- 基盤となるLLMにおける信頼性と防御メカニズムの向上が、緊急の課題であることを強調すること。
提案手法
- 攻撃は、単一の部品に集中させるのではなく、'指示'や'入力'などの異なるプロンプト部品に複数のトリガー・キーを散らばらせる。
- バックドアは、それぞれの部品に必要なすべてのトリガー・キーが同時に存在する場合にのみアクティブ化され、スティールス性が向上する。
- 二段階汚染戦略を用いる:全トリガーを含む「ポジティブ」サンプルと、一部のトリガーのみを含む「ネガティブ」サンプルを作成し、モデルが完全なトリガー集合をバックドア出力に関連付けるように訓練する。
- トリガー・キーは、意味的破壊を避け、周辺度ベースの検出法による検出を回避するため、一般的な語句や語を選択する。
- 本手法は、感情分類などのNLPタスクおよびLLaVAなどのマルチモーダルタスクに適用可能で、Alpacaなどの標準プロンプトテンプレートを用いる。
- 汚染率やトリガー設定の変動、トリガー配置やモデルアーキテクチャに関するアブレーションスタディを含め、攻撃の評価を実施する。

実験結果
リサーチクエスチョン
- RQ1異なるプロンプト部品に複数のトリガー・キーを分散させることで、LLMにおけるバックドア攻撃のステルス性と有効性が向上するか?
- RQ2従来の単一部品バックドア攻撃と比較して、コンポジットバックドア攻撃(CBA)は、攻撃成功率、偽発動率、およびモデルの有用性低下の観点でどの程度優れているか?
- RQ3CBAは、暗黙的または言語固有のトリガーを用いて、特定のユーザーグループを標的にするのにどの程度適応可能か?
- RQ4適切に選ばれた一般的な語句を用いたトリガーを備えたCBAに対して、周辺度ベースの検出手法はどの程度有効か?
- RQ5CBAは2つ以上の部品を含むプロンプトに拡張可能か?また、複雑さと検出リスクのトレードオフはどのようなものか?
主な発見
- 感情データセットを用いたLLaMA-7Bモデルにおいて、3%の汚染データでCBAは100%の攻撃成功率を達成し、偽発動率は2.06%未満であった。
- バックドアを仕込んだモデルのクリーンテスト精度は、元のクリーンモデルよりも1.06%高い結果となり、性能低下がほとんどないことが示された。
- 周辺度ベースの検出手法は、'指示'部品のトリガー・キーの100%を特定できず、'入力'部品のトリガー・キーについてもわずか12.10%しか特定できなかった。これは、CBAに対して有効性が限られていることを示している。
- トリガーが一般的な語で構成されていても、攻撃は依然として有効であり、意味的または頻度ベースの分析による検出が困難であることがわかった。
- CBAはNLPタスクおよびマルチモーダルタスクの両方で優れた性能を示し、LLaVA-13Bモデルに対しても一貫した高い成功率と低い偽陽性率を達成した。
- 本手法により、'Siri'や特定の言語といった、タスク関連またはシステム固有のトリガーを指示部品に組み込むことで、特定のユーザーグループに対する細かく制御された標的指定が可能になった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。