[論文レビュー] Interactive Task Planning with Language Models
本稿では、GPT-4などの大規模言語モデル(LLM)を用いて、トレーニング不要のインタラクティブなロボットタスク計画と再計画を可能にする、ITP(インタラクティブタスクプランニング)を提案する。高レベルの自然言語計画と低レベルのスキル実行を関数型APIを通じて統合し、ゼロショットの食器洗いタスクで100%の成功を達成するとともに、プロンプト工学や再トレーニングなしに新しいタスクに柔軟に適応する。
An interactive robot framework accomplishes long-horizon task planning and can easily generalize to new goals and distinct tasks, even during execution. However, most traditional methods require predefined module design, making it hard to generalize to different goals. Recent large language model based approaches can allow for more open-ended planning but often require heavy prompt engineering or domain specific pretrained models. To tackle this, we propose a simple framework that achieves interactive task planning with language models by incorporating both high-level planning and low-level skill execution through function calling, leveraging pretrained vision models to ground the scene in language. We verify the robustness of our system on the real world task of making milk tea drinks. Our system is able to generate novel high-level instructions for unseen objectives and successfully accomplishes user tasks. Furthermore, when the user sends a new request, our system is able to replan accordingly with precision based on the new request, task guidelines and previously executed steps. Our approach is easy to adapt to different tasks by simply substituting the task guidelines, without the need for additional complex prompt engineering. Please check more details on our https://wuphilipp.github.io/itp_site and https://youtu.be/TrKLuyv26_g.
研究の動機と目的
- タスク実行中にユーザーのフィードバックに応じて動的に再計画を行うトレーニング不要のインタラクティブなロボットシステムの開発。
- ロボットのタスク計画において、複雑なプロンプト工学やコードレベルの仕様の必要性を排除すること。
- タスクガイドラインと事前定義済みの低レベルスキルAPIのみを用いて、新しいタスクへの一般化を可能にすること。
- ドリンク作成や食器洗いなどの実世界のロボットアプリケーションにおいて、高レベル計画と実行の強靭性を示すこと。
- 多様なロボットタスクに迅速に適応できる柔軟でオープンソースのフレームワークの構築。
提案手法
- システムはGPT-4を高レベルプランナーとして用い、ユーザーの要請とタスクガイドラインに基づいて段階的な指示を生成する。
- 低レベルのロボットスキルは関数型言語ベースのAPIに抽象化され、LLMがコードレベルのプロンプト工学なしに直接関数を呼び出せるようにする。
- 完了したステップは「記憶」され、再計画の文脈として使用され、実行中に新しいユーザーの要請に適応できる。
- フレームワークは自然言語プロンプトとタスクガイドラインにのみ依存し、ファインチューニングや追加の価値関数の必要性を回避する。
- 視覚モデル(例:Grounded-DINO)を統合して物体を検出し局所化し、視覚入力をLLMに供給して根拠のある計画を可能にする。
- 新しいユーザーの要請、以前に実行されたステップ、タスクガイドラインを組み合わせることで、動的に更新された実行可能プランを生成する。
実験結果
リサーチクエスチョン
- RQ1プロンプト工学やファインチューニングなしに、LLMベースのシステムが未学習のタスクに対して正確で実行可能な高レベル計画を生成できるか?
- RQ2このようなシステムは、実行中に新しいユーザーの要請に、以前に実行されたステップと更新された目標を組み合わせて、どの程度適応できるか?
- RQ3タスクガイドラインとスキルAPIを変更するだけで、同じフレームワークが異なるロボットタスクにどの程度一般化できるか?
- RQ4新しいゼロショットの物体と目標の組み合わせに直面しても、計画の正しさとタスクの整合性をどの程度維持できるか?
- RQ5低レベルスキルの関数型API抽象化が、システムの強靭性と導入の容易さにどのような影響を与えるか?
主な発見
- ゼロショットの食器洗いタスクで100%の成功率を達成し、27件の新規要請のうち27件で正しい高レベル計画を生成した。
- ガイドラインに明示的に記載されていなくても、たとえばタロイチー牛乳やマシュマロ入り抹茶牛乳といった新規のドリンクレシピに対しても、実行可能な計画を正常に生成した。
- 実行中に新しいユーザーの要請に応じて、記憶済みの完了ステップと更新された目標を活用して、正確に計画を再調整する再計画能力を示した。
- 新しいタスクへの一般化には、タスクガイドラインと低レベルスキル定義の更新のみで十分であり、コアの計画・実行パイプラインに変更は不要だった。
- コードレベルのプロンプト工学や価値関数のトレーニングの必要性が排除され、新規タスクへの導入が著しく簡素化された。
- 多様で複雑なタスクの組み合わせ、例えば複数の物体と複数の場所を含む食器洗い要請に対しても、計画の正しさと真値との整合性を維持した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。