[論文レビュー] Video Language Planning
ビデオ言語計画(VLP)は、視覚言語モデル(VLM)をポリシーおよび価値関数として使い、テキストから動画へのモデルをダイナミクスモデルとして用いる木探索ベースの手法であり、言語指示と画像観測から長時間スパンのマルチモーダル動画計画を生成する。計算リソースの予算に応じて計画の質を向上させることで、シミュレーションおよび実世界のプラットフォームにおける複雑なロボットタスクで最先端の成功確率を達成する。
We are interested in enabling visual planning for complex long-horizon tasks in the space of generated videos and language, leveraging recent advances in large generative models pretrained on Internet-scale data. To this end, we present video language planning (VLP), an algorithm that consists of a tree search procedure, where we train (i) vision-language models to serve as both policies and value functions, and (ii) text-to-video models as dynamics models. VLP takes as input a long-horizon task instruction and current image observation, and outputs a long video plan that provides detailed multimodal (video and language) specifications that describe how to complete the final task. VLP scales with increasing computation budget where more computation time results in improved video plans, and is able to synthesize long-horizon video plans across different robotics domains: from multi-object rearrangement, to multi-camera bi-arm dexterous manipulation. Generated video plans can be translated into real robot actions via goal-conditioned policies, conditioned on each intermediate frame of the generated video. Experiments show that VLP substantially improves long-horizon task success rates compared to prior methods on both simulated and real robots (across 3 hardware platforms).
研究の動機と目的
- 高レベルの言語推論と低レベルの視覚的ダイナミクスモデリングを統合することで、ロボティクスにおける長時間スパンの視覚的計画の課題に取り組む。
- 大規模言語モデル(LLM)および視覚言語モデル(VLM)が物理的現実に行動を根拠づけたり、時間経過に伴う推論をしたりする際の限界を克服する。
- テキストから動画へのモデルを活用して、延長された時間スパンにわたり詳細な物体の運動とダイナミクスをモデリングし、より現実的な動画のロールアウトを可能にする。
- 木探索を用いることで、計算量に応じて計画の質をスケーラブルかつ計算効率よく向上させ、長時間スパンの行動シーケンスのより良い探索を可能にする。
- 抽象的な言語ベースの計画と具体的な視覚的ダイナミクスの間のギャップを埋め、現実世界のロボット展開に適した根拠のある実行可能な動画計画を生成する。
提案手法
- 現在の画像とタスク指示から、視覚言語モデル(VLM)をポリシーとして用い、複数の候補となる次のステップのテキスト行動を生成する。
- テキストから動画へのモデルをダイナミクスモデルとして用い、各候補行動の将来の動画ロールアウトをシミュレートし、潜在的な結果の画像シーケンスを生成する。
- 同じVLMをヒューリスティック関数として用い、タスク進行度と視覚的妥当性に基づいて各動画ロールアウトの好ましさを評価する。
- 前方木探索を実行し、最も有望なロールアウトを再帰的に拡張することで、マルチモーダル(テキストおよび動画)の軌道を保持する木構造の探索木を構築する。
- 探索の深さと分岐数を増やすことで、計算リソースの増加に応じて計画の質を向上させ、長時間スパンの行動シーケンスのより良い探索を可能にする。
- 生成された動画の途中のフレームを条件として用いるゴール条件付きポリシーを用いて、最終的な動画計画をロボット行動に変換する。

実験結果
リサーチクエスチョン
- RQ1視覚言語モデルとテキストから動画へのモデルを、木探索フレームワーク内で効果的に統合することで、長時間スパンで根拠のある動画計画を生成できるか?
- RQ2テスト時の基礎モデルの合成が、複雑で長時間スパンのロボットタスクにおける計画の質とタスク成功確率を向上させるか?
- RQ3動画モデルにわずかな不正確さが生じても、ゴール条件付きポリシーを組み合わせることで、VLPが生成する動画計画は実際のロボットで信頼性高く実行可能か?
- RQ4このマルチモーダル計画フレームワークにおいて、計画の質は計算リソース予算の増加に伴ってどのように向上するか?
- RQ5不完全または弱教師ありの動画・言語データを、計画パイプラインの訓練および改善にどの程度活用できるか?
主な発見
- VLPは、3つのハードウェアプラットフォームを対象としたシミュレーテッドおよび実ロボット環境において、先行手法と比較して長時間スパンのタスク成功確率を顕著に向上させた。
- 直接指示から長時間の動画を生成することを目的としたエンドツーエンドのモデルと比較して、より包括的かつ一貫性のあるマルチモーダル計画を生成した。
- 計画の質は計算リソースに比例して向上し、計算リソースの増加に伴い、視覚的一致性とタスク進行度の両方が向上した。
- 動画計画はより良い根拠づけを示し、一貫性のあるシーンのダイナミクスを維持し、物体のテレポートのような物理的に不審な出来事の発生頻度を低減した。
- ゴール条件付きポリシーと組み合わせることで、VLPが生成する動画計画は、複数の物体の再配置やバイマンユアル操作といった複雑なタスクの成功実行を可能にした。
- 動画ダイナミクスに若干の不正確さ(例:物体の突然の出現)が見られるものの、全体の計画パイプラインは実世界の展開においても頑健で効果的であった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。