[論文レビュー] Environment Maps: Structured Environmental Representations for Long-Horizon Agents
論文は、長期的なウェブ自動化の改善に大きく寄与する、継続的でエージェント非依存の知識ベースとして、文脈・パラメータ化されたアクション・ワークフロー・暗黙知を多模態トレースからクエリ可能なグラフに組織する Environment Maps を導入し、複数ドメインで長期的なウェブ自動化の向上を実証します。
Although large language models (LLMs) have advanced rapidly, robust automation of complex software workflows remains an open problem. In long-horizon settings, agents frequently suffer from cascading errors and environmental stochasticity; a single misstep in a dynamic interface can lead to task failure, resulting in hallucinations or trial-and-error. This paper introduces $ extit{Environment Maps}$: a persistent, agent-agnostic representation that mitigates these failures by consolidating heterogeneous evidence, such as screen recordings and execution traces, into a structured graph. The representation consists of four core components: (1) Contexts (abstracted locations), (2) Actions (parameterized affordances), (3) Workflows (observed trajectories), and (4) Tacit Knowledge (domain definitions and reusable procedures). We evaluate this framework on the WebArena benchmark across five domains. Agents equipped with environment maps achieve a 28.2% success rate, nearly doubling the performance of baselines limited to session-bound context (14.2%) and outperforming agents that have access to the raw trajectory data used to generate the environment maps (23.3%). By providing a structured interface between the model and the environment, Environment Maps establish a persistent foundation for long-horizon planning that is human-interpretable, editable, and incrementally refinable.
研究の動機と目的
- 長期的なウェブ自動化におけるカスケード的エラーと環境ドリフトを動機づけ、対処する。
- 多様な証拠源をグラフに統合する統一的で持続的な表現を提案する。
- 複数ドメインでの長期的な計画に対する環境マップの利点を示す。
- 固定エージェン_STACK_の下で、ベースラインと生の軌跡使用よりも環境マップが優れていることを示す。
- マップベースのアプローチの解釈性・保守性・拡張性の利点について論じる。
提案手法
- 環境マップを C, A, W, K からなる文脈、アクション、ワークフロー、暗黙知を含む 4-タプル M として定義する。
- raw observations と interface representations からマップを構築する五段階のパイプラインを開発する:手順列を統合、アクションを抽出、パラメータ化された形に一般化、文脈と暗黙知を抽出、安定したマップへ統合。
- URL パターンで文脈をクラスター化、URL を正規化し、アクションをパラメータ化されたテンプレートとパラメータ値に grounding する。
- エージェント非依存の評価を WebArena で三条件(Baseline、Trajectory Access、Environment Map Access)として実施し、マップの影響を測定する。
- マップ構造と出所を示す JSON スキーマと詳しい付録ビジュアルを提供する。
実験結果
リサーチクエスチョン
- RQ1環境マップを提供することは、ベースラインと生の軌跡の比較で長期的なエージェントの成功率を向上させるか?
- RQ2環境マップは、直接的にデモンストレーションされていないタスクへの一般化にどのように影響するか?
- RQ3UIが密集したウェブ環境とより単純なウェブ環境の双方で、環境マップはどの程度効果を発揮するか?
- RQ4セッションをまたいだ移行や、 drifting UI 環境における保守性を含む可搬性はどうか?
主な発見
- 環境マップはタスク成功率を 28.2%、ベースライン 14.2% をほぼ倍増させる。
- 環境マップは生の軌跡の使用を上回り、約 4.9 ポイント高い 23.3% を達成。
- マップは特定知識の検索を改善し、ほとんどのツール呼び出しがファイル関連(Read、Grep、Glob)となる。
- パフォーマンスの伸びは分岐が多く UI が密集した環境(例:GitLab、CMS)で最大となる。
- マップは解釈可能で編集可能、段階的な改良が可能であり、低コストで構築でき、モデル間で再利用可能な利点をもたらす。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。