[論文レビュー] Prompt a Robot to Walk with Large Language Models
本論文は、タスク固有の微調整を伴わず、GPT-4を用いて少量のショットテキストプロンプトを用いてロボット歩行の低レベル制御命令を直接生成する、革新的なフレームワークを提案する。この手法により、大規模言語モデル(LLM)が高次元のロボットシステムにおけるフィードバック制御装置として機能でき、複数のロボットおよび地形でシミュレーション上で成功した動的歩行を達成した。正常化歩行時間は0.721、困難な地形での成功率は0.6%であった。
Large language models (LLMs) pre-trained on vast internet-scale data have showcased remarkable capabilities across diverse domains. Recently, there has been escalating interest in deploying LLMs for robotics, aiming to harness the power of foundation models in real-world settings. However, this approach faces significant challenges, particularly in grounding these models in the physical world and in generating dynamic robot motions. To address these issues, we introduce a novel paradigm in which we use few-shot prompts collected from the physical environment, enabling the LLM to autoregressively generate low-level control commands for robots without task-specific fine-tuning. Experiments across various robots and environments validate that our method can effectively prompt a robot to walk. We thus illustrate how LLMs can proficiently function as low-level feedback controllers for dynamic motion control even in high-dimensional robotic systems. The project website and source code can be found at: https://prompt2walk.github.io/ .
研究の動機と目的
- 大規模言語モデル(LLM)が、タスク固有の微調整なしに、動的ロボット歩行の低レベルフィードバック制御装置として機能できるかどうかを調査すること。
- 実ロボットの軌道から収集した少量のショットプロンプトを用いて、LLMを物理的ロボット制御に根ざさせる課題に対処すること。
- LLMがイmitation学習や強化学習ではなく、イン・コンテキスト学習によって安定した動的歩行行動を生成できるかどうかを検討すること。
- 異なるロボット、地形、シミュレーション環境において、フレームワークの妥当性を検証すること。
提案手法
- 本手法は、GPT-4を用いた少量のショットプロンプトパラダイムを採用し、プロンプトに記述プロンプトと観測-行動履歴のシーケンスを含める。
- 制御命令は正規化された目標関節位置として生成され、200 HzでPDコントローラーが追従する。一方、LLMは10 Hzで推論を行う。
- 各推論ループの後、新しい観測と行動を用いてプロンプトを動的に更新し、文脈を維持する。
- フレームワークは、事前学習済みの強化学習ポリシーのデータを用いて初期化され、プロンプト内に現実的で実用的なデモンストレーションを提供する。
- テキストプロンプトは、タスクの説明、環境の観測、行動シーケンスを含めるように慎重に設計され、LLMのイン・コンテキスト学習を支援する。
- 微調整を避ける一方で、LLMのイン・コンテキスト学習能力に依存し、新しい歩行タスクへの一般化を実現する。

実験結果
リサーチクエスチョン
- RQ1LLMは、タスク固有の微調整なしに、動的ロボット歩行の低レベルフィードバック制御装置として機能できるか?
- RQ2少量のショットプロンプトを用いたイン・コンテキスト学習は、LLMが安定した動的歩行行動を生成するのにどの程度有効か?
- RQ3説明と観測-行動シーケンスを含むテキストプロンプトの設計が、ロボット歩行の成功にどの程度影響を与えるか?
- RQ4提案されたプロンプトフレームワークは、異なるロボットプラットフォームや地形に一般化可能か?
主な発見
- 不整地での正常化歩行時間(NWT)は0.721に達し、長期的な歩行性能が有効であることが示された。
- 最も困難な地形(E5)における成功率は0.6%であったが、複雑な環境下でも実現可能性が示された。
- LLMポリシーは、正規で生物学的に妥当なパターンを持つ関節軌道を生成したが、強化学習ベースラインとは顕著に異なるものであった。
- 説明プロンプトが成功の鍵であった。数値観測と行動のみを提供した場合、LLMは歩行に失敗した。
- フレームワークは、複数のロボット(A1とANYmal)、シミュレータ(MuJoCoとIsaac Gym)、地形にわたり一般化でき、クロス環境でのロバスト性が検証された。
- プロンプト設計は感受性が高く、わずかな変更が性能に顕著な影響を与えた。これは、LLMベースの制御におけるより良いプロンプト工学の必要性を示唆している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。