Skip to main content
QUICK REVIEW

[論文レビュー] DoReMi: Grounding Language Model by Detecting and Recovering from Plan-Execution Misalignment

Yanjiang Guo, Yen‐Jen Wang|arXiv (Cornell University)|Jul 1, 2023
Topic Modeling被引用数 4
ひとこと要約

DoReMi は、大規模言語モデル(LLM)が実行計画の不整合を検出し、回復できるようにする画期的なフレームワークである。LLM を用いて実行制約を生成し、視覚言語モデル(VLM)を用いて制約違反を継続的にモニタリングすることで実現する。実験の結果、ベースライン手法と比較してロボットアームおよびヒューマノイドロボットのタスクにおいて、タスク成功確率の向上と完了時間の短縮が確認された。

ABSTRACT

Large language models (LLMs) encode a vast amount of semantic knowledge and possess remarkable understanding and reasoning capabilities. Previous work has explored how to ground LLMs in robotic tasks to generate feasible and executable textual plans. However, low-level execution in the physical world may deviate from the high-level textual plan due to environmental perturbations or imperfect controller design. In this paper, we propose extbf{DoReMi}, a novel language model grounding framework that enables immediate Detection and Recovery from Misalignments between plan and execution. Specifically, we leverage LLMs to play a dual role, aiding not only in high-level planning but also generating constraints that can indicate misalignment during execution. Then vision language models (VLMs) are utilized to detect constraint violations continuously. Our pipeline can monitor the low-level execution and enable timely recovery if certain plan-execution misalignment occurs. Experiments on various complex tasks including robot arms and humanoid robots demonstrate that our method can lead to higher task success rates and shorter task completion times. Videos of DoReMi are available at \url{https://sites.google.com/view/doremi-paper}.

研究の動機と目的

  • 環境的擾乱やコントローラーの誤りによって低レベルの行動が高レベルの言語計画から逸脱するというロボットタスク実行における重要なギャップを解消すること。
  • ステップの完了後に遅延してフィードバックが得られるのではなく、実行中に即座にこのような不整合を検出できること。
  • 制約違反を検出すると即座に再計画を可能にすることで、タスク成功確率の向上と実行時間の短縮を実現すること。
  • LLM が高レベル計画と低レベルモニタリングのための実行可能な制約を生成するという二重の役割を活用すること。
  • 視覚言語モデルを、関連する物理的状態にのみ焦点を当てた軽量で正確な制約検出器として統合すること。

提案手法

  • LLM が実行をガイドするための埋め込み済み物理的制約(例:「赤いブロックは茶色いブロックの上にある」)を含む高レベルのテキスト計画を生成する。
  • 実行中、視覚言語モデル(VLM)が環境を継続的にモニタリングし、制約違反が発生していないかを確認する。
  • 制約違反が検出された場合(例:赤いブロックがもはや茶色いブロックの上にない場合)、システムは LLM を介して即座に再計画を開始する。
  • 再計画プロセスは、現在の状態と更新された制約に基づいて、アクションシーケンスを動的に調整する。
  • フレームワークはクローズド・ループで動作し、タスク実行中を通じて継続的なモニタリングと回復が可能である。
  • 計算コストを最小限に抑えるために、制約生成には LLM、リアルタイムの二値制約検証には VLM に依存する。

実験結果

リサーチクエスチョン

  • RQ1リアルタイムでの計画実行不整合の検出は、長時間のロボットタスクにおけるタスク成功確率の向上に寄与するか?
  • RQ2制約違反の検出後に即座に再計画を行う方法と、完了後にフィードバックを得る方法とを比較した場合、タスク完了時間にどのような差が生じるか?
  • RQ3LLM は物理的世界の依存関係を反映した意味のある実行可能な制約を効果的に生成できるか?
  • RQ4VLM は低レベルのロボット実行中に、制約違反をどれほど正確かつ効率的に検出できるか?
  • RQ5不整合からの即時回復を採用した場合、理論的および実証的なタスクパフォーマンスの向上はどの程度か?

主な発見

  • DoReMi は、ロボットアームやヒューマノイドロボットを含む複雑な操作タスクにおいて、タスク成功確率を顕著に向上させた。
  • フレームワークにより、失敗したアクションを継続するのではなく即座に回復できるため、平均タスク完了時間が短縮された。
  • VLM が制約違反をリアルタイムで検出し、ステップの完了を待たずに即座に再計画が可能となった。
  • LLM が計画と制約生成の両方の役割を果たすことで、高レベルの意図と低レベルの実行との整合性が向上した。
  • VLM を焦点を当てた制約検出器として統合することで、最小限の計算コストで正確なフィードバックが得られた。
  • シミュレーションにおける実証的結果から、遅延フィードバックに依存するか、制約モニタリングを欠如させるベースライン手法と比較して、DoReMi が優れたパフォーマンスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。