[論文レビュー] Assessing Prompt Injection Risks in 200+ Custom GPTs
本研究では、OpenAIプラットフォーム上に存在する200を超えるユーザーが作成したカスタムGPTのプロンプトインジェクション脆弱性を調査し、攻撃的プロンプトが高確率でシステムプロンプトやアップロード済みファイルを抽出できることを示している。研究では、防御的プロンプトやコードインタープリターの無効化といった現在の防御策が、洗練された攻撃に対しては不十分であることが判明し、カスタマイズ可能なLLMにおけるより強固なセキュリティフレームワークの構築が急務であることが浮き彫りになった。
In the rapidly evolving landscape of artificial intelligence, ChatGPT has been widely used in various applications. The new feature - customization of ChatGPT models by users to cater to specific needs has opened new frontiers in AI utility. However, this study reveals a significant security vulnerability inherent in these user-customized GPTs: prompt injection attacks. Through comprehensive testing of over 200 user-designed GPT models via adversarial prompts, we demonstrate that these systems are susceptible to prompt injections. Through prompt injection, an adversary can not only extract the customized system prompts but also access the uploaded files. This paper provides a first-hand analysis of the prompt injection, alongside the evaluation of the possible mitigation of such attacks. Our findings underscore the urgent need for robust security frameworks in the design and deployment of customizable GPT models. The intent of this paper is to raise awareness and prompt action in the AI community, ensuring that the benefits of GPT customization do not come at the cost of compromised security and privacy.
研究の動機と目的
- カスタマイズ可能なGPTモデルがOpenAIプラットフォームにデプロイされた際のプロンプトインジェクションのセキュリティリスクを調査すること。
- 実際のカスタムGPTにおいて、悪意あるプロンプトを用いてシステムプロンプトやアップロード済みファイルを抽出することが可能かどうかを評価すること。
- 防御的プロンプトやコードインタープリターの無効化といった、現在の防御メカニズムが洗練されたレッドチーム攻撃に対してどれほど有効であるかを評価すること。
- カスタマイズ可能なLLMにおけるプロンプトインジェクションを通じたデータ漏洩や知的財産権の盗難のリスクについて、AIコミュニティへの啓発を促すこと。
- 現在のヒューリスティックな防御を超えて、長期的かつ強固なセキュリティソリューションの開発を促進すること。
提案手法
- 研究者たちは、OpenAI GPTストアに公開されている200を超えるカスタムGPTを対象に、悪意あるプロンプトを設計・デプロイした。
- 2段階のレッドチームアプローチを採用:まずファイル名やコードインタープリターの有無をスキャンし、その後標的のプロンプトインジェクション攻撃を実行した。
- 4名の専門攻撃者を用いたレッドチーム評価を実施し、さまざまなプロンプト戦略を用いてシステムプロンプト抽出とファイル漏洩をテストした。
- コードインタープリターの無効化が攻撃成功確率に与える影響を評価し、この機能を有する・ないGPT間で結果を比較した。
- 研究者は発表前にOpenAIに責任を持って報告を行い、実験終了後にすべての抽出データを削除した。
- 完全なデータセット、攻撃用プロンプト、レッドチームの結果をオープンソース化し、再現可能性とさらなる研究を促進した。

実験結果
リサーチクエスチョン
- RQ1悪意あるプロンプトは、ユーザーがカスタマイズしたGPTからどれほどシステムプロンプトを抽出できるか?
- RQ2攻撃者は、プロンプトインジェクションを通じて、ファイル名やサイズを含めたアップロード済みファイルを信頼性高く回収できるか?
- RQ3防御的プロンプトは、カスタムGPTにおけるシステムプロンプト抽出やファイル漏洩をどれほど効果的に緩和できるか?
- RQ4コードインタープリターの無効化は、プロンプトインジェクション攻撃の成功確率を顕著に低下させるか?
- RQ5洗練された悪意あるプロンプトは、現実の攻撃シナリオにおいて、最先端の防御メカニズムを回避できるか?
主な発見
- 200を超えるカスタムGPTがテストされ、その大部分が悪意あるプロンプトを用いてシステムプロンプト抽出に脆弱であることが判明した。
- コードインタープリターの存在は、攻撃成功確率を高めるとともに、攻撃に必要な試行回数を減少させた。
- 防御的プロンプトが使用されていようとも、熟練の攻撃者はそれを回避できたため、こうした防御策は意図的な攻撃者に対しては不十分であることが示された。
- コードインタープリターの無効化はセキュリティを向上させたが、リスクを完全に排除したわけではない。4人の専門家のうち3人が10回の試行以内にシステムプロンプトを抽出できた。
- 本研究では、アップロード済みファイル(ファイル名やサイズを含む)が、プロンプトインジェクションを通じて体系的に特定され、外部へ漏洩させられることを確認した。
- 研究者たちは、DALL·E GPTからもシステムプロンプトおよびファイルメタデータを正常に抽出した。これは、これらの脆弱性が実世界のモデルでも実際に利用可能であることを示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。