[論文レビュー] Task and Motion Planning with Large Language Models for Object Rearrangement
本論文では、マルチオブジェクトリアレンジメントにおけるタスクおよびモーションプランニングのための常識的空間知識を抽出するために大規模言語モデル(LLMs)を活用するフレームワーク、LLM-GROPを提案する。自然言語命令に基づき、LLMsを用いて意味的に妥当なオブジェクト配置を生成し、モーションプランニングによってそれらをジオメトリックな配置に「グランドイング」することで、LLM-GROPは、未知の複雑な環境においても高い成功率と人間の意図に沿った配置を実現するモバイルマニピュレータの自然言語命令実行を可能にする。
Multi-object rearrangement is a crucial skill for service robots, and commonsense reasoning is frequently needed in this process. However, achieving commonsense arrangements requires knowledge about objects, which is hard to transfer to robots. Large language models (LLMs) are one potential source of this knowledge, but they do not naively capture information about plausible physical arrangements of the world. We propose LLM-GROP, which uses prompting to extract commonsense knowledge about semantically valid object configurations from an LLM and instantiates them with a task and motion planner in order to generalize to varying scene geometry. LLM-GROP allows us to go from natural-language commands to human-aligned object rearrangement in varied environments. Based on human evaluations, our approach achieves the highest rating while outperforming competitive baselines in terms of success rate while maintaining comparable cumulative action costs. Finally, we demonstrate a practical implementation of LLM-GROP on a mobile manipulator in real-world scenarios. Supplementary materials are available at: https://sites.google.com/view/llm-grop
研究の動機と目的
- サービスロボットが不十分な自然言語指示から常識的なオブジェクトリアレンジメントを実行できるようにする課題に対処すること。
- 高レベルの意味的知識(例:「ナイフの左にフォークを置く」)と低レベルのモーションプランニングの間のギャップを埋めること。
- タスク固有のトレーニングデータを必要とせずに、異なるシーンの幾何構造やオブジェクト配置に対しても一般化可能なロボット計画を向上させること。
- LLMから抽出された常識的知識が、既存のベースラインと比較して、より人間が好むかつ効率的なリアレンジメント計画をもたらすかどうかを評価すること。
提案手法
- 自然言語命令に基づき、大規模言語モデル(LLM)を用いて象徴的な空間的関係(例:「フォークをナイフの左に置く」)を生成する。
- タスクおよびモーションプランナを用いて物理的妥当性を評価することで、象徴的な空間的関係を幾何的配置に「グランドイング」する。
- 運動の実行可能性、タスク完了の効率性、長期的利得のバランスを最適化することで、得られたタスク・モーション計画を最適化する。
- セグウェイをベースとするプラットフォームにUR5eアームを搭載した実世界のモバイルマニピュレーションシステムに、LLMが生成した計画を統合する。
- ハードコードされたグリッピングポリシーと障害物回避機構を適用することで、物理的ロボット上の実世界でのデプロイを可能にする。
- 人間による評価を用いて、最終的なオブジェクト配置のユーザー満足度を評価し、LLM-GROPとベースラインの間で満足度と実行時間の観点から比較する。

実験結果
リサーチクエスチョン
- RQ1LLMは自然言語指示から、オブジェクトリアレンジメントのための常識的空間的関係を信頼性高く抽出できるか?
- RQ2LLM-GROPの、人間の意図に沿ったオブジェクトリアレンジメントにおけるパフォーマンスは、既存のタスクおよびモーションプランニングベースラインと比較してどうか?
- RQ3LLM-GROPは、再トレーニングを伴わずに、異なるシーンの幾何構造やオブジェクト数の変化に対し、どの程度一般化できるか?
- RQ4LLMから抽出された知識は、実世界のロボット実行において、より効率的かつ好まれる配置をもたらすか?
- RQ5LLM-GROPは、ベースラインと比較して、計画の効率性と人間の好みのトレードオフにおいて、どのような特性を示すか?
主な発見
- 人間評価においてLLM-GROPは最高のユーザー評価を達成し、ベースラインと比較して配置の質の面で顕著に優れていた。
- すべての手法の中で平均タスク完了時間が最短であったことから、実世界での実行において高い効率性を示した。
- LLM-GROPはベースラインと同等の累積的アクションコストを維持しながらも、ユーザー満足度が顕著に高く、効率性と好みの間の良好なトレードオフを実現していた。
- フレームワークは、実際のモバイルマニピュレータ上で、フォークをプレートの左に置く、イチゴをプレートの上に置くといった複雑なリアレンジメントタスクを成功裏に実行した。
- 5つのオブジェクトを含むタスクでさえも、ユーザー評価が一貫して高く維持されたことから、タスクの複雑さが増しても安定性を示した。
- 実世界のデモンストレーションにより、LLM-GROPが動的で複雑な屋内環境において、障害物や人間を避けるとともに、妥当で人間の意図に沿った配置を実現できることを確認した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。