Skip to main content
QUICK REVIEW

[論文レビュー] Grounding Classical Task Planners via Vision-Language Models

Xiaohan Zhang, Yan Ding|arXiv (Cornell University)|Apr 17, 2023
AI-based Problem Solving and Planning被引用数 7
ひとこと要約

この論文では、視覚言語モデル(VLM)を用いて古典的タスクプランナをロボットの知覚に結びつけるTPVQAというフレームワークを提案する。VLMを用いて行動の前件条件(アフォーダンス)の検証と行動効果(失敗)の監視を視覚的質問応答(VQA)タスクとして行う。VLMと記号的計画を統合することで、TPVQAは複雑なタスクで70%のタスク完了率を達成し、行動名クエリのみに依存するか、前件条件のチェックを欠いたベースラインを著しく上回った。

ABSTRACT

Classical planning systems have shown great advances in utilizing rule-based human knowledge to compute accurate plans for service robots, but they face challenges due to the strong assumptions of perfect perception and action executions. To tackle these challenges, one solution is to connect the symbolic states and actions generated by classical planners to the robot's sensory observations, thus closing the perception-action loop. This research proposes a visually-grounded planning framework, named TPVQA, which leverages Vision-Language Models (VLMs) to detect action failures and verify action affordances towards enabling successful plan execution. Results from quantitative experiments show that TPVQA surpasses competitive baselines from previous studies in task completion rate.

研究の動機と目的

  • 現実世界の環境において完全な知覚と行動実行を仮定する古典的計画システムのギャップを埋める。
  • 計画監視に特化したカスタム設計に依存することを減らすために、事前学習済みの視覚言語モデルを活用する。
  • 自然言語クエリを用いてVLMで行動の前件条件を検証し、障害を検出することで、堅牢な計画実行を実現する。
  • 記号的計画と視覚的知覚を密接に統合することで、長時間にわたるロボットタスクにおけるタスク完了率を向上させる。

提案手法

  • TPVQAは、事前学習済みの視覚言語モデルを用いて、行動のアフォーダンスの検証と障害検出を視覚的質問応答(VQA)タスクとして定式化する。
  • 行動実行の前に、"りんごをつかめるでしょうか?"のような自然言語の質問をVLMに投げて前件条件を確認する。
  • 行動実行後は、"行動は成功しましたか?"や"皿はきれいですか?"といった質問を投げて効果を検証し、行動名のみのクエリに依存しない。
  • 記号的プランナの出力(前件条件と効果)をVLMのプロンプトとして使用することで、抽象的行動の意味的根拠を付与する。
  • 前件条件に失敗した場合や効果が達成されない場合は再計画をトリガーし、知覚-行動ループを閉じる。
  • フレームワークは、実際の家庭の画像と拡散増強画像を組み合わせたデータセット上で評価され、実機ロボットハードウェアにデプロイされた。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みの視覚言語モデルは、古典的計画文脈において行動の前件条件(アフォーダンス)を効果的に検証するために使用可能か?
  • RQ2世界状態の変化に関する意味的に根拠のある質問(例:"皿はきれいですか?")をVLMに投げることで、行動名に関する質問(例:"皿を洗うのは成功しましたか?")よりも障害検出が優れているか?
  • RQ3VLMを用いた監視は、行動名クエリや知覚なしのベースラインと比較して、長時間にわたるロボットタスクのタスク完了率を向上させられるか?
  • RQ4記号的計画と視覚言語モデルを統合することで、ロボットシステムにおけるカスタム知覚モジュールの必要性がどの程度低下するか?

主な発見

  • TPVQAは、eat_appleタスクで70%のタスク完了率を達成し、次に優れたベースライン(EffectVQAで53%)を著しく上回り、PaLMEVQAやSuccessVQAをも凌駆した。
  • 世界状態の変化に関する質問(例:"皿はきれいですか?")を用いたVQA戦略は、行動効果監視で79%の正確性を達成したのに対し、行動名に基づくクエリ(例:"皿を洗うのは成功しましたか?")はわずか45%の正確性にとどまった。
  • アフォーダンスと障害検出の両方を考慮した手法(TPVQAとPaLMEVQA)は、障害検出のみに焦点を当てた手法(EffectVQAとSuccessVQA)を上回り、前件条件のチェックの重要性を示した。
  • 知覚なしの記号的計画のみを用いたベースライン(TP)は、PaLMEVQA や SuccessVQA よりも高い成功率(63%)を示した。これは、VLMの予測が不正確であると性能が低下することを示唆している。
  • 意味的に豊かな質問を用いてVLMに問い合わせた場合、行動効果の検出(79%)は障害結果の検出(45%)よりも高い正確性を示した。これは、効果監視が成功/失敗の検出よりも信頼性が高いことを示している。
  • 実機ロボットへのデプロイにより、TPVQAが現実世界の物体再配置タスクにおいて実用的であることが実証され、シミュレーションを超えた実用性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。