[論文レビュー] Prompt Packer: Deceiving LLMs through Compositional Instruction with Hidden Attacks
本論文は、一見無害な複数の意図を持つプロンプトの中に有害な指示を埋め込むことで大規模言語モデル(LLMs)をだます、新しい手法である構成的指示攻撃(CIA)を紹介する。会話や書込みタスクを模倣するT-CIAおよびW-CIA変換技術を用いることで、GPT-4、ChatGPT、ChatGLM2-6Bで91%を超える成功率を達成し、LLMの整合性メカニズムにおける隠れた悪意ある意図への脆弱性を露呈した。
Recently, Large language models (LLMs) with powerful general capabilities have been increasingly integrated into various Web applications, while undergoing alignment training to ensure that the generated content aligns with user intent and ethics. Unfortunately, they remain the risk of generating harmful content like hate speech and criminal activities in practical applications. Current approaches primarily rely on detecting, collecting, and training against harmful prompts to prevent such risks. However, they typically focused on the "superficial" harmful prompts with a solitary intent, ignoring composite attack instructions with multiple intentions that can easily elicit harmful content in real-world scenarios. In this paper, we introduce an innovative technique for obfuscating harmful instructions: Compositional Instruction Attacks (CIA), which refers to attacking by combination and encapsulation of multiple instructions. CIA hides harmful prompts within instructions of harmless intentions, making it impossible for the model to identify underlying malicious intentions. Furthermore, we implement two transformation methods, known as T-CIA and W-CIA, to automatically disguise harmful instructions as talking or writing tasks, making them appear harmless to LLMs. We evaluated CIA on GPT-4, ChatGPT, and ChatGLM2 with two safety assessment datasets and two harmful prompt datasets. It achieves an attack success rate of 95%+ on safety assessment datasets, and 83%+ for GPT-4, 91%+ for ChatGPT (gpt-3.5-turbo backed) and ChatGLM2-6B on harmful prompt datasets. Our approach reveals the vulnerability of LLMs to such compositional instruction attacks that harbor underlying harmful intentions, contributing significantly to LLM security development. Warning: this paper may contain offensive or upsetting content!
研究の動機と目的
- 一見無害な表面の下に有害な意図を隠す複数の意図を持つ悪意あるプロンプトがLLMに与える脆弱性を明らかにすること。
- スケールアップ可能な自動的かつパラメータフリーな方法で、こうしただましプロンプトを生成するための手法を開発すること。
- GPT-4、ChatGPT、ChatGLM2-6Bといった最先端のLLMに対して、これらの攻撃の有効性を評価すること。
- 現在の整合性メカニズムが、複合的な指示に潜む悪意ある意図を検出できないことを実証すること。
- 赤チーム作戦と意図認識研究の分野におけるLLMの安全性向上の基盤を提供すること。
提案手法
- 複数の指示を組み合わせ、表面的には無害に見えるが実際には有害な意図を内蔵した指示を埋め込むフレームワークとして、構成的指示攻撃(CIA)を提唱する。
- 心理的原則(特に類縁効果)を応用し、否定的で攻撃的になりやすい人間のキャラクターを推定・模倣することで、LLMが有害な要求に従いやすくなるT-CIA(Talking-CIA)を導入する。
- 文脈学習を用いて有害な意図を隠し、小説の完成など書込みタスクとして装ったW-CIA(Writing-CIA)を開発する。
- モデルのパラメータにアクセスせずに自動でプロンプトを生成する手法を採用し、LLMのスケーラブルな赤チーム作戦を可能にする。
- 複数のLLMで安全評価データセットおよび有害プロンプトデータセットを用いて、攻撃の成功率を検証する。
- 人間による評価を用いて、LLMの判断が人間のアノテーションと整合的であることを確認し、結果の信頼性を保証する。
実験結果
リサーチクエスチョン
- RQ1LLMは、無害な意図と有害な意図を併せ持つ複合的な指示によってだまされる可能性があるか?
- RQ2現在の整合性メカニズムは、複数の意図を持つプロンプトにおける隠れた悪意ある意図をどの程度検出できないのか?
- RQ3T-CIAおよびW-CIAは、安全フィルタを回避できる検出不能な悪意あるプロンプトをどの程度効果的に生成できるか?
- RQ4攻撃の繰り返しによって、デコードのランダム性が原因で成功確率が上昇するのか?
- RQ5類縁効果のような心理的原則を活用することで、LLMの行動を操作できるのか?
主な発見
- CIAは安全評価データセットで95%以上の攻撃成功率を達成し、検出回避の高効果性を示した。
- 有害プロンプトデータセットでは、GPT-4で83%以上、ChatGPT(gpt-3.5-turbo)で91%以上、ChatGLM2-6Bで91%以上の成功率を記録した。
- T-CIAは人間評価と90.2%の整合性スコアを達成し、攻撃下でもLLMの行動が信頼性と一貫性を持つことを示した。
- W-CIAは人間評価と82.0%の整合性スコアを示し、偽装された書込みベースの攻撃を効果的に生成できることを確認した。
- 攻撃の繰り返しによって攻撃成功率が上昇したため、デコードのランダム性が構成的攻撃に対する脆弱性を助長していることが示された。
- 成功したT-CIA攻撃は、人間のキャラクター空間においてより意味的に集中しており、類縁に基づくフィルタリングが防御策として有効である可能性を示唆した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。