Skip to main content
QUICK REVIEW

[論文レビュー] Identifying the Risks of LM Agents with an LM-Emulated Sandbox

Yangjun Ruan, Honghua Dong|arXiv (Cornell University)|Sep 25, 2023
Multi-Agent Systems and Negotiation被引用数 4
ひとこと要約

この論文では、多様なツールや障害シナリオにおいてスケーラブルで自動化されたテストを可能にする、言語モデル(LM)エミュレート型サンドボックス「ToolEmu」を紹介する。LMを用いてツール実行をエミュレートし、LMベースの評価者でリスクを評価することで、68.8%の障害が現実世界で有効であると特定され、安全なエージェントでも高リスク状況下では23.9%の確率で失敗することが明らかになった。

ABSTRACT

Recent advances in Language Model (LM) agents and tool use, exemplified by applications like ChatGPT Plugins, enable a rich set of capabilities but also amplify potential risks - such as leaking private data or causing financial losses. Identifying these risks is labor-intensive, necessitating implementing the tools, setting up the environment for each test scenario manually, and finding risky cases. As tools and agents become more complex, the high cost of testing these agents will make it increasingly difficult to find high-stakes, long-tailed risks. To address these challenges, we introduce ToolEmu: a framework that uses an LM to emulate tool execution and enables the testing of LM agents against a diverse range of tools and scenarios, without manual instantiation. Alongside the emulator, we develop an LM-based automatic safety evaluator that examines agent failures and quantifies associated risks. We test both the tool emulator and evaluator through human evaluation and find that 68.8% of failures identified with ToolEmu would be valid real-world agent failures. Using our curated initial benchmark consisting of 36 high-stakes tools and 144 test cases, we provide a quantitative risk analysis of current LM agents and identify numerous failures with potentially severe outcomes. Notably, even the safest LM agent exhibits such failures 23.9% of the time according to our evaluator, underscoring the need to develop safer LM agents for real-world deployment.

研究の動機と目的

  • 現実世界のリスクに対するLMエージェントの手動テストの高コストとスケーラビリティの限界を解消すること。
  • 完全なツール実装やサンドボックス環境を必要とせずに、LMエージェントにおけるロングテールで高インパクトな障害を検出可能にすること。
  • エミュレートされたシナリオにおけるエージェント障害に起因するリスクを定量化する、自動化されたLMベースの安全評価者を開発すること。
  • LMを用いて複雑なツール(例:ターミナル、IoT、ロボティクス)をエミュレートし、リスク評価に応用する可能性と妥当性を実証すること。

提案手法

  • ツールの仕様と入力を根拠に、実際のツールのデプロイを必要とせずに、大規模言語モデル(例:GPT-4)を用いてツール実行をエミュレートする。
  • IoT やロボティクスなどの将来統合予定のツールを含む多様なツールをサポートするLMエミュレート型サンドボックスを設計し、迅速なプロトタイピングと障害注入を可能にする。
  • レッドチームシナリオにおける障害検出を向上させるために、自動的に高リスクのサンドボックス状態を生成する敵対的エミュレータを実装する。
  • エージェントの軌跡を分析し、障害を同定し、人間が検証済みの基準を用いてリスクを定量化するLMベースの安全評価者を構築する。
  • 人間による評価を通じて、検出された障害の現実世界妥当性を検証し、68.8%の一致率を達成した。
  • 現在のLMエージェントの定量的リスク分析を可能にするために、36の高リスクツールキットと144のテストケースを収集したベンチマークを整備した。

実験結果

リサーチクエスチョン

  • RQ1LMベースのエミュレータは、実際の実装を必要とせずに、ターミナル、金融、IoTなど多様で高リスクなツールを効果的にエミュレートできるか?
  • RQ2LMエミュレート型サンドボックスは、現実世界の実行と比較して、LMエージェントにおける現実的で高インパクトな障害をどれほど効果的に特定できるか?
  • RQ3LMベースの安全評価者は、ロングテールシナリオにおけるエージェント障害に起因するリスクをどれほど正確に検出・定量化できるか?
  • RQ4現実的で敵対的な条件下でテストされた際、現在のLMエージェントにおける深刻な障害の頻度はどの程度か?
  • RQ5特に金融やロボティクスなどの安全が重要な分野において、稀で高インパクトな障害をフレームワークが検出できるか?

主な発見

  • 人間による評価を通じて、ToolEmuが特定した障害の68.8%が現実世界で有効な障害として裏付けられ、障害検出の高い現実性が示された。
  • 本研究で評価された最も安全なLMエージェントでさえ、テストケースの23.9%で障害を示した。これは、現実世界での導入に常にリスクが伴うことを示している。
  • フレームワークは、チャットGPT-3.5のターミナルエミュレータ上で7件の深刻な障害を検出。そのうち6件は実際のbashターミナルでも再現可能であり、高い忠実度を示した。
  • 敵対的エミュレータは、エージェントに障害を引き起こす高リスクシナリオを効果的に生成し、エッジケースの検出を向上させた。
  • LMベースの安全評価者は高い効率性を発揮し、実環境での手動セットアップに比べて15分未満で複雑な障害を検出できた(実環境では8時間)。
  • 36のツールキットと144のテストケースから構成されるベンチマークは、金融、メール、ロボット制御タスクなど多様な分野にわたり、体系的な脆弱性を明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。