Skip to main content
QUICK REVIEW

[論文レビュー] Empowering Large Language Models on Robotic Manipulation with Affordance Prompting

Guangran Cheng, Chuheng Zhang|arXiv (Cornell University)|Apr 17, 2024
Robot Manipulation and Learning被引用数 4
ひとこと要約

本稿では、大規模言語モデル(LLMs)が物理的現実に高レベルの計画と低レベルの制御シーケンスを根拠づけるためにアフォーダンスプロンプティングを用いることで、トレーニングフリーのフレームワークである LLM+A を提案する。LLMs に行動の結果を予測させ、物体にアフォーダンス値を割り当てるプロンプティングにより、微調整を必要とせず、多様なタスクで 80–96% の成功率を達成し、計画の妥当性と一般化性能を顕著に向上させる。

ABSTRACT

While large language models (LLMs) are successful in completing various language processing tasks, they easily fail to interact with the physical world by generating control sequences properly. We find that the main reason is that LLMs are not grounded in the physical world. Existing LLM-based approaches circumvent this problem by relying on additional pre-defined skills or pre-trained sub-policies, making it hard to adapt to new tasks. In contrast, we aim to address this problem and explore the possibility to prompt pre-trained LLMs to accomplish a series of robotic manipulation tasks in a training-free paradigm. Accordingly, we propose a framework called LLM+A(ffordance) where the LLM serves as both the sub-task planner (that generates high-level plans) and the motion controller (that generates low-level control sequences). To ground these plans and control sequences on the physical world, we develop the affordance prompting technique that stimulates the LLM to 1) predict the consequences of generated plans and 2) generate affordance values for relevant objects. Empirically, we evaluate the effectiveness of LLM+A in various language-conditioned robotic manipulation tasks, which show that our approach substantially improves performance by enhancing the feasibility of generated plans and control and can easily generalize to different environments.

研究の動機と目的

  • 物理的環境への根拠の欠如により、LLMs が実行可能なロボット制御シーケンスを生成できないという課題に対処すること。
  • 事前学習済みスキルや大規模データセットを必要とするエンドツーエンド微調整済みモデルに依存する既存の LLM を用いたロボット制御手法の限界を克服すること。
  • トレーニングフリーな統一フレームワークにおいて、LLMs が高レベルの計画者と低レベルのモーションコントローラーの両方として機能できることを可能にすること。
  • アフォーダンスプロンプティングによる物理世界の知識への根拠づけを通じて、LLM が生成する計画の妥当性と一般化性能を向上させること。
  • 微調整を追加せずに、LLMs が提示のみで相互作用の結果やタスク固有のアフォーダンスを推論できることを示し、新しい環境やロボット形状へのゼロショット転移を可能にすること。

提案手法

  • 言語条件付きロボット操作のため、事前学習済み LLM がサブタスク計画者およびモーションコントローラーとして機能する LLM+A フレームワークを提案する。
  • 物体の部分にアフォーダンス値を割り当てるために、行動の結果を予測するようモデルにプロンプトすることで、LLM の出力を物理世界に根拠づけるアフォーダンスプロンプティングを導入する。
  • 視覚言語モデル(VLMs)を用いて環境の観測を抽出し、それらをタスク指示と共に LLM に入力する。
  • 二段階のプロンプティングメカニズムを設計する:第一段階では LLM がサブタスクを計画し、結果を予測する。第二段階では、アフォーダンスに配慮した推論に基づいて低レベルの制御シーケンスを生成する。
  • 異なるタスクやロボット(例:xArm6 および UR5e)においても同じプロンプトテンプレートを適用することで、新しい環境やロボットタイプへのゼロショット一般化を実現する。
  • LLMs のイン・コンテキスト学習を活用し、微調整を伴わずに空間的関係、物体の機能的部品、物理的相互作用のダイナミクスを推論できることを活用する。

実験結果

リサーチクエスチョン

  • RQ1LLMs が物理的現実の知識に根拠づけられることで、微調整なしに実行可能で実行可能なロボット操作計画を生成できるか?
  • RQ2アフォーダンスプロンプティングは、現実のロボットタスクにおける LLM が生成する計画と制御シーケンスの妥当性をどの程度向上させるか?
  • RQ3LLM+A は、再トレーニングなしに、さまざまなロボットプラットフォーム、環境、タスクタイプにどの程度一般化できるか?
  • RQ4LLM+A の主な失敗モードは何か。また、それらは LLM のアフォーダンス予測や空間的推論の限界とどのように関連しているか?
  • RQ5LLMs は、提示のみで、タスク固有の相互作用部(例:押せる部分 vs. 把握可能な部分)や行動の結果を推論できるか?

主な発見

  • LLM+A は Towers-of-Hanoi-Seq タスクで 96%、CLIPORT の Put-Block-in-Bowl タスクで 95% の成功率を達成し、複雑な操作タスクにおいて優れた性能を示した。
  • CLIPORT の5つの多様なタスクにおいて平均 85% の成功率を達成し、異なるロボット(UR5e)やグリッパー(吸引式 vs. エンドエフェクタ)へのロバストなゼロショット一般化を示した。
  • 失敗分析の結果、失敗のわずか 4% が計画フェイルに起因しており、アフォーダンスプロンプティングによる根拠づけのおかげで LLM が高レベルの推論を非常に効果的に実行できていることが示された。
  • 最も一般的な失敗モードはアフォーダンス予測(13%)とモーション制御(13%)であり、特にブロック同士の複雑な相互作用を伴うタスクで顕著に見られた。
  • LLM+A は、事前学習済みスキルや微調整済みポリシーへの依存を顕著に低減し、ロボット分野におけるデータボトルネックを緩和するトレーニングフリーの代替手法を提供した。
  • 可視化例から、LLMs が物理的に関連する部分(例:Towers-of-Hanoi の上部のリング)に高いアフォーダンス値を割り当てていることが確認され、アフォーダンスプロンプティングが物理的推論を可能にしていることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。