[論文レビュー] RoboCLIP: One Demonstration is Enough to Learn Robot Policies
RoboCLIPは、事前学習済みのビデオ・アンド・ランゲージモデル(VLM)を用いて報酬信号を生成することで、手動の報酬設計を不要にし、1本の動画またはテキストのデモからロボットポリシーの学習を可能にする、画期的な模倣学習手法である。この手法は、ロボットの操作タスクにおいて、最先端の手法と比較して2–3倍高いゼロショット成功率を達成しており、特にドメイン外のデモやVLMのファインチューニングなしでも有効である。
Reward specification is a notoriously difficult problem in reinforcement learning, requiring extensive expert supervision to design robust reward functions. Imitation learning (IL) methods attempt to circumvent these problems by utilizing expert demonstrations but typically require a large number of in-domain expert demonstrations. Inspired by advances in the field of Video-and-Language Models (VLMs), we present RoboCLIP, an online imitation learning method that uses a single demonstration (overcoming the large data requirement) in the form of a video demonstration or a textual description of the task to generate rewards without manual reward function design. Additionally, RoboCLIP can also utilize out-of-domain demonstrations, like videos of humans solving the task for reward generation, circumventing the need to have the same demonstration and deployment domains. RoboCLIP utilizes pretrained VLMs without any finetuning for reward generation. Reinforcement learning agents trained with RoboCLIP rewards demonstrate 2-3 times higher zero-shot performance than competing imitation learning methods on downstream robot manipulation tasks, doing so using only one video/text demonstration.
研究の動機と目的
- 強化学習における疎で高コストな専門家の監視を軽減するため、大規模なデモに依存するのを減らす。
- データ効率を向上させるために、動画または自然言語記述の1つのデモでのみ模倣学習を可能にする。
- ドメイン外のデモ(例えば、異なる環境の人の動画など)を用いて報酬信号を生成することを許容する。
- ロボットの環境に対してファインチューニングを行わず、事前学習済みVLMを活用して、意味的類似度に基づく報酬をオンラインRLで生成する。
- 最小限の人的監視で、ロボット操作タスクにおけるゼロショット一般化性能を向上させる。
提案手法
- RoboCLIPは、HowTo100Mから得た事前学習済みのS3D動画モデルを用い、エージェントのインタラクション動画とタスクデモ(テキストまたは動画)を潜在埋め込みに変換する。
- エージェントのロールアウトとデモの埋め込み間のコサイン類似度として、トラジェクトリーレベルの報酬を計算し、タスクの成功度の代理指標とする。
- エージェントが探索を繰り返すオンラインRLループ内で動作し、VLMがデモとの整合性に基づいて密度の高い意味的報酬を提供する。
- VLMはゼロショットの方法で使用される——ロボットの環境に対してファインチューニングは一切行わず、ドメイン間での一般化を維持する。
- ドメイン内およびドメイン外のデモ(異なる環境からの人の動画など)の両方をサポートする。
- 対照的学習をVLMで活用することで、動きや意味的構造を捉え、タスク完了の信号として不可欠な要素とする。

実験結果
リサーチクエスチョン
- RQ11つの動画またはテキストデモで、事前学習済みVLMを用いた報酬生成によってロボットポリシーの学習が可能か?
- RQ2ドメイン外のデモ(例えば、異なる環境からの人の動画)を用いても、ポリシー学習に有効な報酬信号が得られるか?
- RQ3RoboCLIPの性能は、最先端の模倣学習手法と比較して、ゼロショット成功率の面で優れているか?
- RQ4静止画像モデル(例:CLIP)と比較して、動画ベースのVLMを用いることで報酬品質とポリシー性能にどのような影響があるか?
- RQ5VLMの意味的埋め込みは、キッチン環境とVLMの事前学習分布との間でドメインシフトが生じても一般化可能か?
主な発見
- RoboCLIPは、Meta-WorldおよびFranka Kitchenの環境において、最先端の模倣学習ベースラインと比較して、2–3倍高いゼロショットタスク成功率を達成した。
- ドメイン内での1本の動画デモが、埋め込みの整合性が高いため、複数のデモよりも強い事前学習信号を提供し、優れた性能を発揮した。
- ドメイン外の人のデモ動画でさえ、事前学習データとは異なる環境やカメラ設定であっても、有用な報酬信号を提供した。
- CLIP(静止画像で学習されたビジョントランスフォーマー)を用いることで、有用な事前学習報酬が得られなかったため、報酬設計に有効なのは動きや時間的ダイナミクスが不可欠であることが示された。
- VLMが多様で非ロボットの動画で事前学習されている場合でも、ドメインをまたいで一般化がうまくいくことが実証され、強い性能を示した。
- VLMのファインチューニングを行わずとも、報酬信号は安定的かつ効果的であり、ゼロショット模倣に向けた事前学習済み埋め込みの頑健性が裏付けられた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。