[論文レビュー] Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning
Pandoraは、リtrieval-Augmented Generation (RAG)を介してGPTに間接的な脱獄攻撃を仕掛ける画期的な攻撃を提案する。悪意ある方法で作成された外部知識ソースを注入することで、LLMの応答を操作する。この手法は、4つの禁止コンテンツシナリオにおいてGPT-3.5で64.3%、GPT-4で34.8%の成功率を達成し、直接的なプロンプト攻撃を上回る性能を示した。
Large Language Models~(LLMs) have gained immense popularity and are being increasingly applied in various domains. Consequently, ensuring the security of these models is of paramount importance. Jailbreak attacks, which manipulate LLMs to generate malicious content, are recognized as a significant vulnerability. While existing research has predominantly focused on direct jailbreak attacks on LLMs, there has been limited exploration of indirect methods. The integration of various plugins into LLMs, notably Retrieval Augmented Generation~(RAG), which enables LLMs to incorporate external knowledge bases into their response generation such as GPTs, introduces new avenues for indirect jailbreak attacks. To fill this gap, we investigate indirect jailbreak attacks on LLMs, particularly GPTs, introducing a novel attack vector named Retrieval Augmented Generation Poisoning. This method, Pandora, exploits the synergy between LLMs and RAG through prompt manipulation to generate unexpected responses. Pandora uses maliciously crafted content to influence the RAG process, effectively initiating jailbreak attacks. Our preliminary tests show that Pandora successfully conducts jailbreak attacks in four different scenarios, achieving higher success rates than direct attacks, with 64.3\% for GPT-3.5 and 34.8\% for GPT-4.
研究の動機と目的
- LLMs、特にGPTに向けた間接的脱獄攻撃を、リtrieval-Augmented Generation (RAG)の統合を活用して調査すること。
- 外部知識ベースを操作することで悪意あるLLM行動を引き起こす、画期的な攻撃ベクトル「RAG汚染」を構築すること。
- 汚染されたRAGコンテンツを通じてGPTを脱獄する可能性と高い成功率を実証し、直接攻撃手法を上回ること。
- 成人向け、有害、プライバシー違反、違法コンテンツを含む複数の禁止コンテンツシナリオにおいて、この攻撃の有効性を評価すること。
提案手法
- 攻撃は、検索時に脱獄行動を引き起こすように設計された悪意あるコンテンツを含む不正な知識ベースを構築する。
- LLMが汚染されたRAGコンテンツを検索・利用するように誘導するためのプロンプト工学を活用する。
- 汚染された知識ベースを統合したカスタムGPTインスタンスを作成することで、GPTに統合し、エンドツーエンドの脱獄実行を可能にする。
- 2段階のプロセスを採用する:まずRAG知識ソースを汚染し、次に悪意あるコンテンツの検索を引き起こすプロンプトを設計する。
- 攻撃は、成人向け、有害、プライバシー違反、違法コンテンツの4つの禁止コンテンツカテゴリで評価される。
- このフレームワークは再利用可能かつスケーラブルであり、任意のユーザーが作成された汚染済みGPTインスタンスを用いて脱獄済みGPTをデプロイ可能である。
実験結果
リサーチクエスチョン
- RQ1RAG汚染は、従来のセーフティフィルタを回避する有効な間接的脱獄ベクトルとして機能するか?
- RQ2GPT-3.5およびGPT-4において、RAG汚染攻撃の成功率は直接攻撃と比べてどのように異なるか?
- RQ3どの禁止コンテンツカテゴリがRAGベースの脱獄に対して最も脆弱であり、その理由は何か?
- RQ4モデルアーキテクチャ(例:GPT-3.5対GPT-4)は、RAG汚染の有効性にどのように影響するか?
- RQ5攻撃は複数回の試行において一貫して再現可能であり、信頼性と耐性を示しているか?
主な発見
- Pandoraは、4つの禁止コンテンツシナリオにおいてGPT-3.5で64.3%の成功率を達成し、直接攻撃を著しく上回った。
- GPT-4では34.8%の成功率を記録したが、GPT-4における直接攻撃の1.0%と比べて顕著に高い水準であった。
- プライバシー違反カテゴリが最も脆弱で、全モデルおよびシナリオにおいて平均35.3%の成功率を示した。
- 攻撃は複数回の実験ラウンドにわたり高い再現性と一貫性を示し、信頼性が確認された。
- GPT-4を搭載したチャットボットおよびGPTは、GPT-3.5の対応バージョンよりも耐性が高く、最新モデルでは整合性が向上していることを示唆した。
- 結果から、RAG汚染はLLMと外部知識取得の相乗効果を活用する強力でスケーラブルな攻撃ベクトルであることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。