Skip to main content
QUICK REVIEW

[論文レビュー] Foundation Model based Open Vocabulary Task Planning and Executive System for General Purpose Service Robots

Yoshiki Obinata, Naoaki Kanazawa|arXiv (Cornell University)|Aug 7, 2023
Robotics and Automated SystemsEngineering被引用数 3
ひとこと要約

本論文は、一般用途のサービスロボット向けに、基礎モデルを活用したオープンボキャブラリーのタスク計画および実行システムを提案する。大規模言語モデル(LLM)と視覚言語モデル(VLM)を状態機械実行エンジンと統合することで、現実世界の環境において音声言語命令の堅牢で安定した実行を可能にする。このシステムは、RoboCup@home Japan Open 2022 GPSRで130点を記録し、他のチームを大きく上回り、優勝を達成した。

ABSTRACT

This paper describes a strategy for implementing a robotic system capable of performing General Purpose Service Robot (GPSR) tasks in robocup@home. The GPSR task is that a real robot hears a variety of commands in spoken language and executes a task in a daily life environment. To achieve the task, we integrate foundation models based inference system and a state machine task executable. The foundation models plan the task and detect objects with open vocabulary, and a state machine task executable manages each robot's actions. This system works stable, and we took first place in the RoboCup@home Japan Open 2022's GPSR with 130 points, more than 85 points ahead of the other teams.

研究の動機と目的

  • 一般用途のサービスロボットが日常の環境で多様な音声言語命令を理解し実行できるようにすること。
  • 基礎モデルを用いてオープンボキャブラリーの理解と行動計画を実現する課題に対処すること。
  • 故障や曖昧さがあっても、状態機械ベースの実行システムにより、安定的かつ決定論的なロボット行動を保証すること。
  • 人間のフィードバックと反復的改善を通じて、局所的な環境知識を統合し、障害を処理すること。
  • LLM、VLM、実行可能な状態機械を組み合わせることで、現実世界での実行における耐障害性を向上させること。

提案手法

  • システムは大規模言語モデル(GPT-3)を用いて、音声命令を原始的アクションのシーケンスに解析する。
  • 視覚言語モデル(OFA、Detic)により、オープンボキャブラリーのオブジェクト検出と視覚的質問応答が可能になる。
  • 状態機械タスク実行エンジンがアクションシーケンスを管理し、各原始的関数の成功または失敗に応じて決定論的な遷移が行われる。
  • 原始的関数には、move_to、grasp、follow、pass_to、speak、answer、visual_question_answering が含まれる。
  • 環境の自然言語記述(オブジェクトの位置や空間的関係など)を介して、局所的知識がLLMに組み込まれる。
  • 障害処理には、アクションの再試行、人間からのガイダンスの要請、フィードバックを用いた将来の実行改善が含まれる。

実験結果

リサーチクエスチョン

  • RQ1基礎モデルと状態機械実行エンジンを効果的に組み合わせることで、オープンボキャブラリーかつ現実世界のタスクにおいて、安定的かつ決定論的なロボット行動を実現するにはどうすればよいか?
  • RQ2LLMとVLMを共同で用いることで、日常の環境における複雑な自然言語命令の堅牢なオープンボキャブラリー理解が可能になるか?
  • RQ3オブジェクトの位置や空間的レイアウトといった、局所的な環境知識を、基礎モデルの推論に効果的に統合するにはどうすればよいか?
  • RQ4原始的関数が予期せず失敗した場合に、ロボットタスク実行における障害検出と回復を改善するメカニズムは何か?
  • RQ5基礎モデルと状態機械のハイブリッドシステムは、従来のルールベースまたは学習専用のアプローチに比べて、現実世界のサービスロボットコンテストでどの程度優れた性能を発揮できるか?

主な発見

  • 提案されたシステムは、RoboCup@home Japan Open 2022 GPSRコンテストで130点の総得点を記録し、優勝を達成した。
  • 2位チームとの得点差が85点以上にのぼり、オープンボキャブラリーのタスク実行において顕著な優位性を示した。
  • LLMによるタスク計画とVLMによる視覚的理解の統合により、堅牢なオープンボキャブラリーのオブジェクト検出と言語の意味的基盤付けが可能になった。
  • 状態機械実行エンジンのおかげで、障害があっても決定論的な動作が保証され、タスク実行中の安定性と信頼性が向上した。
  • 原始的関数の失敗時にユーザーに明確化を求めるプロンプトを発行することで、曖昧または不完全な命令を効果的に処理できた。
  • 研究者たちは、たとえばグリップ中にオブジェクトが落下するような微細な障害の検出に課題を抱えていることを特定し、改善されたフィードバックメカニズムとデータ収集の必要性を強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。