Skip to main content
QUICK REVIEW

[論文レビュー] AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs

Anselm Paulus, Arman Zharmagambetov|arXiv (Cornell University)|Apr 21, 2024
Smart Grid Security and Resilience被引用数 4
ひとこと要約

この論文では、大規模言語モデル(LLM)のセーフティ対策を回避するための、高速で適応的かつ人間が読みやすい敵対的プロンプト生成手法であるAdvPrompterを紹介する。AdvPrompterは、交互最適化と低ランク微調整のループを用いて、特定のLLM(AdvPrompter)を訓練し、安全対策を回避する一貫性のある接尾語を生成する。この手法は勾配ベースの手法と比較して約800倍高速であり、オープンソースおよびクローズドソースのLLMにおいて最先端の攻撃成功率を達成する。

ABSTRACT

Large Language Models (LLMs) are vulnerable to jailbreaking attacks that lead to generation of inappropriate or harmful content. Manual red-teaming requires a time-consuming search for adversarial prompts, whereas automatic adversarial prompt generation often leads to semantically meaningless attacks that do not scale well. In this paper, we present a novel method that uses another LLM, called AdvPrompter, to generate human-readable adversarial prompts in seconds. AdvPrompter, which is trained using an alternating optimization algorithm, generates suffixes that veil the input instruction without changing its meaning, such that the TargetLLM is lured to give a harmful response. Experimental results on popular open source TargetLLMs show highly competitive results on the AdvBench and HarmBench datasets, that also transfer to closed-source black-box LLMs. We also show that training on adversarial suffixes generated by AdvPrompter is a promising strategy for improving the robustness of LLMs to jailbreaking attacks.

研究の動機と目的

  • LLMのジャイルブレイキングに対する既存の自動レッドチーム手法の非効率性と不自然さを解消すること。
  • ターゲットLLMの勾配を必要としない、高速で適応的かつ人間が読みやすい敵対的プロンプト生成手法を開発すること。
  • 文脈に適応した敵対的接尾語を生成することで、スケーラブルでマルチショットのジャイルブレイキング攻撃を可能にすること。
  • AdvPrompterが生成する敵対的プロンプトを用いてターゲットLLMを微調整し、将来的な攻撃に対して耐性を高めることを示すこと。

提案手法

  • 専用のLLM(AdvPrompter)を訓練し、ターゲットLLMの安全対策を回避する敵対的接尾語を生成する。この際、指示の意味を保持する。
  • 交互に学習するループを採用:(1) AdvPrompterOpt、新しいトークン候補を選択・評価することで高品質な敵対的接尾語を生成する新規最適化アルゴリズム、(2) 生成された接尾語を教師信号として用いたAdvPrompterの低ランク微調整。
  • AdvPrompterOptは、ベースLLMを用いてパープレキシティを最小化することで、生成された接尾語が自然で、パープレキシティフィルタで検出されにくいように人間の読みやすさを維持する。
  • 訓練プロセスではターゲットLLMの勾配にアクセスしないため、ブラックボックスモデルにも適用可能である。
  • 入力指示に条件づけることで、普遍的な接尾語ではなく、文脈に適応した接尾語を生成できる。
  • 推論時、微調整済みのAdvPrompterは数秒で敵対的接尾語を生成でき、高速でマルチショット攻撃パイプラインを実現する。
Figure 1: Summary of our proposed method. Top: At inference, the fine-tuned AdvPrompter LLM generates an adversarial suffix for the harmful instruction that results in a positive response from the TargetLLM . Bottom: The AdvPrompterTrain training loop alternates between generating high-quality targe
Figure 1: Summary of our proposed method. Top: At inference, the fine-tuned AdvPrompter LLM generates an adversarial suffix for the harmful instruction that results in a positive response from the TargetLLM . Bottom: The AdvPrompterTrain training loop alternates between generating high-quality targe

実験結果

リサーチクエスチョン

  • RQ1ターゲットモデルの勾配を必要とせず、人間が読みやすい適応的敵対的プロンプトを生成できる大規模言語モデルを訓練できるか?
  • RQ2提案手法の攻撃成功率と生成速度は、既存の最適化ベースおよびヒューリスティックベースの敵対的プロンプト生成手法と比較してどの程度優れているか?
  • RQ3AdvPrompterが生成する敵対的プロンプトは、クローズドソースのブラックボックスLLM APIへどの程度転送可能か?
  • RQ4AdvPrompterが生成する敵対的プロンプトを微調整に用いることで、ターゲットLLMの耐性を向上させられるか?
  • RQ5最適化と低ランク微調整を交互に実行する訓練スキームは、エンドツーエンド学習と比較して、より効果的かつ汎用性の高い敵対的プロンプト生成を可能にするか?

主な発見

  • AdvPrompterは、複数のオープンソースLLMにおいてAdvBenchデータセットで92.5%の最先端の攻撃成功率を達成し、既存手法を上回る。
  • 1プロンプトあたり約1〜2秒で敵対的プロンプトを生成でき、勾配ベースの最適化手法と比較して約800倍高速である。
  • 生成された敵対的接尾語は人間が読みやすく一貫性があり、パープレキシティスコアが低いため、標準的なパープレキシティベースのフィルタリング機構では検出されない。
  • クローズドソースLLM APIに対しても効果的に転送され、ターゲットモデルの勾配にアクセスせずに高い攻撃成功率を達成した。
  • AdvPrompterが生成した敵対的プロンプトの合成データセットを用いてターゲットLLMを微調整すると、ジャイルブレイキング攻撃に対する耐性が著しく向上し、MMLUスコアは高い水準を維持した。
  • AdvPrompterOptと低ランク微調整の交互訓練ループは、ゼロショットおよびトランスファー設定において、ベースライン手法と比較して優れた汎化性能と適応性を示した。
Figure 2: Top: Performance comparison of different attack methods across various open source TargetLLMs . We report: train/test attack success rates @ $k$ (at least one out of $k$ attacks was successful) and perplexity as an indicator of human-readability. Each reported value is averaged over 3 inde
Figure 2: Top: Performance comparison of different attack methods across various open source TargetLLMs . We report: train/test attack success rates @ $k$ (at least one out of $k$ attacks was successful) and perplexity as an indicator of human-readability. Each reported value is averaged over 3 inde

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。