Skip to main content
QUICK REVIEW

[論文レビュー] LLM Platform Security: Applying a Systematic Evaluation Framework to OpenAI's ChatGPT Plugins

Umar Iqbal, Tadayoshi Kohno|arXiv (Cornell University)|Sep 19, 2023
Privacy-Preserving Technologies in Data被引用数 6
ひとこと要約

本稿では、LLMプラットフォームのプラグインエコシステムにおけるセキュリティ、プライバシー、セーフティを評価するための体系的で攻撃分類と評価フレームワークを提案する。このフレームワークは、OpenAIのChatGPTプラグインに適用され、実際のプラグインの実証的分析を通じて具体的な攻撃ベクトルを同定し、未利用の脆弱性を明らかにするとともに、将来のLLMプラットフォームに向けた実行可能な設計の提言を提供する。

ABSTRACT

Large language model (LLM) platforms, such as ChatGPT, have recently begun offering an app ecosystem to interface with third-party services on the internet. While these apps extend the capabilities of LLM platforms, they are developed by arbitrary third parties and thus cannot be implicitly trusted. Apps also interface with LLM platforms and users using natural language, which can have imprecise interpretations. In this paper, we propose a framework that lays a foundation for LLM platform designers to analyze and improve the security, privacy, and safety of current and future third-party integrated LLM platforms. Our framework is a formulation of an attack taxonomy that is developed by iteratively exploring how LLM platform stakeholders could leverage their capabilities and responsibilities to mount attacks against each other. As part of our iterative process, we apply our framework in the context of OpenAI's plugin (apps) ecosystem. We uncover plugins that concretely demonstrate the potential for the types of issues that we outline in our attack taxonomy. We conclude by discussing novel challenges and by providing recommendations to improve the security, privacy, and safety of present and future LLM-based computing platforms.

研究の動機と目的

  • OpenAIのChatGPTのようなLLMプラットフォームにおけるサードパーティプラグインのセキュリティ、プライバシー、セーフティに関する懸念が高まっているのを受けて、それらを解決すること。
  • LLMプラグインエコシステムにおけるリスクを評価するための体系的で脅威モデリングに基づくフレームワークを開発すること。
  • 2023年6月時点のOpenAIのプラグインストアから実際のプラグインを分析することで、フレームワークの実証的妥当性を検証すること。
  • サードパーティ統合からのリスクを軽減するために、LLMプラットフォームベンダーが採用可能な実行可能な設計原則を同定すること。

提案手法

  • LLMプラットフォーム、ユーザー、サードパーティプラグインの3つの主要ステークホルダーの機能と責任を分析することで、包括的な攻撃分類を構築する。
  • ステークホルダー間の相互作用に基づき、プロンプトインジェクション、データ漏洩、特権昇格などを含む攻撃ベクトルを体系的に列挙する。
  • マニフェスト、API仕様、インタラクティブな挙動のレビューを通じて、OpenAIのプラグインストアのプラグインを攻撃分類に基づき評価する。
  • 実際のプラグイン分析から得られた知見に基づき、攻撃分類を段階的に改善し、実現可能と非実現可能な攻撃シナリオを区別する。
  • モバイルやウェブなど他のプラットフォームにおける既知の脆弱性と類似点を照らし、脅威モデリングを支援する。
  • コードホスティング、パーミッションモデル、サンドボックス、標準化されたプラグイン間通信プロトコルなどの具体的な緩和戦略を提言する。

実験結果

リサーチクエスチョン

  • RQ1OpenAIのChatGPTのようなLLMプラットフォームにおけるサードパーティプラグインが、セキュリティ、プライバシー、セーフティにどのようなリスクをもたらすか。
  • RQ2曖昧な自然言語インタフェースや不正確なプラグイン説明が、攻撃可能な表面をどのように拡大させるか。
  • RQ3OpenAIのプラグインストアに存在するどの実世界のプラグインが、同定された攻撃パターンを実際に実装しているか。
  • RQ4現在のプラットフォームポリシーやレビュープロセスが、悪意あるまたはバグのあるプラグイン行動をどれほど効果的に防止できていないか。
  • RQ5LLMプラットフォームベンダーが、将来のプラグインエコシステムを予防的に安全にするために採用可能なアーキテクチャ的および設計的原則は何か。

主な発見

  • 分析の結果、OpenAIのプラグインストアに複数のプラグインがプロンプトインジェクション攻撃を実行可能であることが判明し、不正アクセスやデータ漏洩を引き起こす可能性がある。
  • プラグインは曖昧な自然言語の説明を悪用してLLMの挙動を操作し、意図しないまたは悪意ある行動を引き起こす可能性がある。
  • 強力なアクセス制御やコードレビュープロセスの欠如により、プラグインが広範なシステムアクセス権を有効に実行でき、攻撃表面が拡大している。
  • プラグインが共有コンテキストで実行されているため、プラグイン間でのデータ漏洩が発生し、横方向移動のリスクが高まっている。
  • サンドボックスなどの技術的隔離メカニズムや強制的なポリシーの欠如が、深刻なコン promise リスクを顕著に増大させている。
  • フレームワークは、他のプラットフォームで知られている脆弱性と類似する攻撃パターンを効果的に同定できており、その妥当性と実行可能性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。