Skip to main content
QUICK REVIEW

[論文レビュー] Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning

Juan Rocamonde, Victoriano Montesinos|arXiv (Cornell University)|Oct 19, 2023
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本論文では、CLIPなどの視覚言語モデルを、強化学習におけるゼロショット報酬モデルとして使用するVLM-RMという手法を提案している。環境状態のCLIP埋め込みと自然言語のプロンプトとの間のコサイン類似度を計算することで、報酬を算出する。報酬工学やファインチューニングを一切行わず、単一の文によるプロンプトのみで、膝をついたり、スプリットをしたり、蓮華座で座ったりするような複雑なタスクを、MuJoCoのヒューマノイドが成功裏に学習可能であり、モデルサイズのスケーリング効果とゼロショット設定における頑健性が顕著に示された。

ABSTRACT

Reinforcement learning (RL) requires either manually specifying a reward function, which is often infeasible, or learning a reward model from a large amount of human feedback, which is often very expensive. We study a more sample-efficient alternative: using pretrained vision-language models (VLMs) as zero-shot reward models (RMs) to specify tasks via natural language. We propose a natural and general approach to using VLMs as reward models, which we call VLM-RMs. We use VLM-RMs based on CLIP to train a MuJoCo humanoid to learn complex tasks without a manually specified reward function, such as kneeling, doing the splits, and sitting in a lotus position. For each of these tasks, we only provide a single sentence text prompt describing the desired task with minimal prompt engineering. We provide videos of the trained agents at: https://sites.google.com/view/vlm-rm. We can improve performance by providing a second "baseline" prompt and projecting out parts of the CLIP embedding space irrelevant to distinguish between goal and baseline. Further, we find a strong scaling effect for VLM-RMs: larger VLMs trained with more compute and data are better reward models. The failure modes of VLM-RMs we encountered are all related to known capability limitations of current VLMs, such as limited spatial reasoning ability or visually unrealistic environments that are far off-distribution for the VLM. We find that VLM-RMs are remarkably robust as long as the VLM is large enough. This suggests that future VLMs will become more and more useful reward models for a wide range of RL applications.

研究の動機と目的

  • 事前学習済みの視覚言語モデルを活用して、視覚ベースの強化学習における報酬関数の指定を、サンプル効率よくゼロショットで行う手法の開発。
  • VLMのゼロショット能力を活用することで、高コストな人間のフィードバックやタスク固有の報酬工学の必要性を排除すること。
  • CLIPのような大規模なVLMが、複雑なロボット制御タスクに効果的で汎用的な報酬モデルとして機能できるかどうかを評価すること。
  • VLMベースの報酬モデルのスケーリング特性(モデルサイズおよび学習データ量)を調査すること。
  • VLM-RMの失敗モードや制限要因を特定し、特に空間的推論能力や分布外シフトに関する課題を解明すること。

提案手法

  • 本手法は、CLIPを視覚言語モデルとして用い、現在の環境観測のCLIP埋め込みと、望ましいタスクを記述するテキストプロンプトとの間のコサイン類似度を計算することで報酬を算出する。
  • 関連のない方向を投影するためのベースラインプロンプト(中立的・デフォルトの状態を記述するプロンプト)をオプションで使用し、CLIP埋め込み空間における不要な方向を除去することで、報酬の識別性能を向上させる。
  • 報酬関数は、状態 s とタスクプロンプトに対して R(s, a, s') = cos(clip_img_enc(s), clip_text_enc(prompt)) として定義される。
  • 標準的なオフポリシー深層強化学習アルゴリズム(例:SAC)を用いて、VLMが導出する報酬信号に基づきポリシーを学習する。
  • VLMの認識と環境状態との整合性を高めるために、リアルなレンダリングを施したMuJoCo環境で実験を実施する。
  • 性能評価は、訓練成功確率、軌道品質、ベンチマークタスクにおける真値報酬との相関性を用いて行う。
Figure 1: We use CLIP as a reward model to train a MuJoCo humanoid robot to (1) stand with raised arms, (2) sit in a lotus position, (3) do the splits, and (4) kneel on the ground (from left to right). We specify each task using a single sentence text prompt. The prompts are simple (e.g., “a humanoi
Figure 1: We use CLIP as a reward model to train a MuJoCo humanoid robot to (1) stand with raised arms, (2) sit in a lotus position, (3) do the splits, and (4) kneel on the ground (from left to right). We specify each task using a single sentence text prompt. The prompts are simple (e.g., “a humanoi

実験結果

リサーチクエスチョン

  • RQ1CLIPのような視覚言語モデルを、ファインチューニングなしで視覚ベースの強化学習におけるゼロショット報酬モデルとして使用可能か?
  • RQ2大規模なVLMのサイズや学習データ量が、VLM-RMの性能に与える影響は何か?
  • RQ3ベースラインプロンプトを用いて報酬信号を正則化することで、VLM-RMにどのような影響があるか?
  • RQ4VLM-RMは、環境レンダリングにおける視覚的リアリズムや分布外シフトに対して、どの程度頑健か?
  • RQ5VLM-RMの主な失敗モードは何か?また、それらは現在のVLMに知られている制限要因とどのように関連しているか?

主な発見

  • VLM-RMは、1つのタスクごとに1文のプロンプトのみを用いて、膝をついたり、スプリットをしたり、蓮華座で座ったりするような複雑で非自明なタスクを、MuJoCoのヒューマノイドが成功裏に学習可能である。
  • CartPole や MountainCar といった標準的なRLベンチマークでも高い性能を示し、VLM-RM報酬と真値報酬との間に強い相関が確認された。
  • より大きなVLMは、より多くの計算リソースとデータで学習された場合、強いスケーリング効果を示し、複雑なヒューマノイドタスクの学習に成功するには、唯一最大の公開CLIPモデルが必要であった。
  • 関連のない埋め込み方向を除去するためのベースラインプロンプトの使用は、報酬の識別性能を向上させ、特に複雑なタスクにおいて効果を発揮した。
  • 失敗モードの主な原因は、空間的推論能力の低さや分布外の視覚入力への感受性といった、既知のVLMの制限に起因しており、VLM-RMフレームワーク自体の欠陥ではない。
  • VLMが十分に大きい限り、本手法は非常に頑健であることが示され、今後のVLMの進化に伴い、ゼロショット報酬モデルとしての有効性がさらに高まることが予想される。
(a) CartPole
(a) CartPole

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。