Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Model the World with Language

Jessy Lin, Yuqing Du|arXiv (Cornell University)|Jul 31, 2023
Multimodal Machine Learning ApplicationsComputer Science被引用数 3
ひとこと要約

Dynalangは、将来のテキスト、画像、報酬を予測することで、視覚的・時間的ワールドダイナミクスに言語を接地するマルチモーダルエージェントである。タスク固有の報酬に依存せず、堅牢な言語理解とタスク遂行を可能にし、視覚言語ナビゲーション、ゲームプレイ、ホーム環境タスクで最先端の結果を達成している。世界モデリングとポリシー学習を分離し、テキストおよび動画データに対する事前学習を可能にする。

ABSTRACT

To interact with humans and act in the world, agents need to understand the range of language that people use and relate it to the visual world. While current agents can learn to execute simple language instructions, we aim to build agents that leverage diverse language -- language like "this button turns on the TV" or "I put the bowls away" -- that conveys general knowledge, describes the state of the world, provides interactive feedback, and more. Our key idea is that agents should interpret such diverse language as a signal that helps them predict the future: what they will observe, how the world will behave, and which situations will be rewarded. This perspective unifies language understanding with future prediction as a powerful self-supervised learning objective. We instantiate this in Dynalang, an agent that learns a multimodal world model to predict future text and image representations, and learns to act from imagined model rollouts. While current methods that learn language-conditioned policies degrade in performance with more diverse types of language, we show that Dynalang learns to leverage environment descriptions, game rules, and instructions to excel on tasks ranging from game-playing to navigating photorealistic home scans. Finally, we show that our method enables additional capabilities due to learning a generative model: Dynalang can be pretrained on text-only data, enabling learning from offline datasets, and generate language grounded in an environment.

研究の動機と目的

  • 単なるタスク指示を超えた多様な言語(世界知識、状況記述、フィードバックなど)を理解するエージェントの開発。
  • 強化学習が複雑な言語使用に対して弱い信号しか提供しないという限界に対処すること。
  • マルチモーダルワールドモデリングの自己教師学習的目的として、言語理解と将来予測を統合すること。
  • 行動や報酬が存在しないテキストのみまたは動画のみのデータセットを用いた事前学習を可能にし、サンプル効率と一般化性能を向上させること。
  • ワールドモデルからの想像的ロールアウトを活用して、潜在空間で言語を生成し計画することを可能にすること。

提案手法

  • Dynalangは、視覚的および言語的観測を共有潜在空間に圧縮し、将来の予測を実行するマルチモーダルワールドモデルを用いる。
  • ワールドモデルは自己教師学習により、オンライン相互作用データを用いて、将来の潜在表現(テキストおよび画像)を予測するように訓練される。
  • 行動ポリシーは、潜在ワールドモデルを入力として強化学習により別個に訓練され、認識と意思決定を分離する。
  • モデルは、テキストのみまたは動画のみのデータを用いた事前学習をサポートし、ドメイン内言語データからの転移学習と性能向上を実現する。
  • 潜在空間でのワールドモデルのロールアウトにより言語生成が可能になり、エージェントが環境について語れるようになる。
  • 想像的ロールアウトを用いて将来の可能性を計画・推論し、潜在状態の確率的サンプリングにより不確実性をモデル化する。

実験結果

リサーチクエスチョン

  • RQ1将来のテキスト、画像、報酬の予測が、視覚的・環境的ダイナミクスに言語を接地するための統一的自己教師学習的目的として機能するか?
  • RQ2テキストのみまたは動画のみのデータを用いた事前学習が、ゼロショットまたはフェイントショット設定における下流タスク性能をどのように向上させるか?
  • RQ3エージェントが環境記述、ルール、フィードバックといった多様な言語をどれだけ活用してタスク遂行を改善できるか?
  • RQ4明示的な言語モデリング目的なしに、ワールドモデルが潜在空間での言語生成と計画をサポートできるか?
  • RQ5モデルが将来の観測を予測する能力が、複雑な言語入力を持つタスク間での一般化をどのように向上させるか?

主な発見

  • Dynalangは、ゲームマニュアルを読み込み、最も困難なステージを解決することで、Messengerベンチマークでタスク固有アーキテクチャを上回り、堅牢な言語接地を示した。
  • TinyStoriesなどのドメイン内テキストを少量事前学習することで、T5埋め込みを用いた場合と比較して性能ギャップの大部分を埋めることができ、一部の設定ではそれを上回った。
  • モデルは、言語入力から将来の観測と報酬を予測する能力を学習し、たとえばボトルを手に取っても報酬が得られない場合に正しく予測した。
  • 想像的ロールアウトは、ワールド状態の不確実性を捉えており、言語記述と整合する妥当な将来の可能性を示す異なるサンプルを生成した。
  • 1タイムステップあたり1トークンの入力が、文レベルのエンコーディングを上回った。これは、粗い文埋め込みよりも、細粒度のトークンレベル処理がより多くの情報を保持していることを示唆する。
  • 潜在ロールアウトからのトークン再構成により、エージェントが一貫性のある言語を生成でき、将来的にマルチモーダル言語モデルとして利用可能である可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。