[論文レビュー] Optimal Scene Graph Planning with Large Language Model Guidance
本論文は、自然言語ミッションを線形時相論理(LTL)論理式に翻訳し、シーングラフ上の効率的な計画を導くために大規模言語モデル(LLM)を用いた階層的で最適なタスク計画フレームワークを提案する。多層ヒューリスティクスA*計画法(AMRA*)において、保証された一貫性を持つLTLヒューリスティクスとLLMが生成する意味的ガイダンスを統合することで、Gibsonデータセットのような複雑な多階層環境において、ベースラインと比較してノードの展開数と計画時間を顕著に削減した高速で最適な経路計算を実現した。
Recent advances in metric, semantic, and topological mapping have equipped autonomous robots with semantic concept grounding capabilities to interpret natural language tasks. This work aims to leverage these new capabilities with an efficient task planning algorithm for hierarchical metric-semantic models. We consider a scene graph representation of the environment and utilize a large language model (LLM) to convert a natural language task into a linear temporal logic (LTL) automaton. Our main contribution is to enable optimal hierarchical LTL planning with LLM guidance over scene graphs. To achieve efficiency, we construct a hierarchical planning domain that captures the attributes and connectivity of the scene graph and the task automaton, and provide semantic guidance via an LLM heuristic function. To guarantee optimality, we design an LTL heuristic function that is provably consistent and supplements the potentially inadmissible LLM guidance in multi-heuristic planning. We demonstrate efficient planning of complex natural language tasks in scene graphs of virtualized real environments.
研究の動機と目的
- 自然言語指示を用いた階層的シーングラフにおける自律ロボットの効率的で最適なタスク計画を可能にすること。
- メトリック・セマンティック環境における自然言語タスクのシンボル接地と意味的解釈の課題に対処すること。
- 最適性を保持しつつ、LLMを用いてLTL翻訳とヒューリスティクスガイダンスの両方を統合すること。
- シーングラフの属性と接続性を捉える階層的計画ドメインを設計すること。
- LLMガイダンス付きマルチヒューリスティクス計画が、最適性を損なわず、可能な経路の生成を加速できることを実証すること。
提案手法
- 本手法は、属性階層プロンプトと安全でない構文チェックを用いて、自然言語タスクを線形時相論理(LTL)論理式に翻訳する大規模言語モデル(LLM)を用いる。
- タスクに対するシーングラフ要素の関連性に基づいて、意味的ガイダンスを提供するLLMヒューリスティクス関数を生成する。
- 最適性を保証する一貫性のある、証明可能な妥当性を持つLTLヒューリスティクスを設計し、マルチヒューリスティクスA*計画法における最適性を保証する。
- 部屋、物体、占有状態、階層レベルの属性と関連する接続性を符号化することで、シーングラフから階層的計画ドメインを構築する。
- 任意の時間におけるマルチ解像度・マルチヒューリスティクスA*(AMRA*)アルゴリズムが、LLMおよびLTLヒューリスティクスを統合し、探索を加速するとともに最適解への収束を保証する。
- LLMベースのLTL翻訳およびオートマトン生成にはGPT-4を、LTLからオートマトンへの変換にはSpotを用いる。
![Figure 1 : Planning a natural language mission, $\mu:\text{``Reach the oven in the kitchen''}$ , in a scene graph $\mathcal{G}$ of the Gibson environment Benevolence [ 36 ] with object, room, and floor attributes. The terms “oven” and “kitchen” in $\mu$ belong to the object and room attributes of th](https://ar5iv.labs.arxiv.org/html/2309.09182/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1LLMは、自然言語タスクをシーングラフ属性に適切に接地し、正しい検証可能なLTL論理式を生成できるか?
- RQ2LLMが生成する意味的ガイダンスを、形式的論理ヒューリスティクスとどのように統合することで、最適性を損なわず計画を加速できるか?
- RQ3階層的シーングラフの各レベルにわたるマルチレベルLLMヒューリスティクスガイダンスは、複雑で多階層の環境における計画効率を向上させるか?
- RQ4LLMとLTLヒューリスティクスの組み合わせは、ベースラインと比較してノードの展開数と計画時間をどの程度削減するか?
- RQ5本手法は、現実世界の3次元シーングラフにおいて、最初の経路の可能性と最適経路への収束の両方を達成できるか?
主な発見
- すべての階層レベルにLLMヒューリスティクスを適用するALL設定では、Benevolence環境において平均0.0007秒の高速な最初の実行可能経路の計算が可能であり、A*(1.1202秒)やNO-LLM(3.3260秒)と比較して顕著に高速であった。
- 同じ環境で、ALL設定は平均8.9062秒で最適経路を計算し、A*(11.7594秒)やNO-LLM(24.2516秒)を上回った。
- ALL設定における最初の経路と最適経路の相対コストは1.3763であり、速度と解の質のバランスが取れていることを示している。
- 複数の階層レベルにLLMヒューリスティクスを適用した場合、初期の計画イタレーションでノード展開数が最大90%まで削減され、効果的なガイダンスが得られた。
- すべてのシーンにおいて、最初の経路と最適経路の相対コスト比が1.03~1.04に保たれ、優れた最初の解の品質が得られた。
- 物体レベル(OBJ)および部屋レベル(ROOM)でのLLMヒューリスティクスの適用により、NO-LLMベースラインと比較してノード展開数が50%以上削減され、スケーラビリティの向上が顕著に示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。