Skip to main content
QUICK REVIEW

[論文レビュー] From Play to Policy: Conditional Behavior Generation from Uncurated Robot Data

Zichen Jeff Cui, Y. N. Wang|arXiv (Cornell University)|Oct 18, 2022
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

本稿では、報酬やオンライン相互作用を必要とせず、非エキスパートの人が記録した未加工なプレイデータからタスク固有のロボット行動を学習するトランスフォーマーに基づく手法、条件付き行動トランスフォーマー(C-BeT)を紹介する。将来のゴールに条件づけた行動生成とアクション離散化を組み合わせることで、先行研究比で平均45.7%の性能向上を達成し、視覚的およびプロピオセプティブなデータのみを用いて現実世界のポリシーを学習することに成功した。

ABSTRACT

While large-scale sequence modeling from offline data has led to impressive performance gains in natural language and image generation, directly translating such ideas to robotics has been challenging. One critical reason for this is that uncurated robot demonstration data, i.e. play data, collected from non-expert human demonstrators are often noisy, diverse, and distributionally multi-modal. This makes extracting useful, task-centric behaviors from such data a difficult generative modeling problem. In this work, we present Conditional Behavior Transformers (C-BeT), a method that combines the multi-modal generation ability of Behavior Transformer with future-conditioned goal specification. On a suite of simulated benchmark tasks, we find that C-BeT improves upon prior state-of-the-art work in learning from play data by an average of 45.7%. Further, we demonstrate for the first time that useful task-centric behaviors can be learned on a real-world robot purely from play data without any task labels or reward information. Robot videos are best viewed on our project website: https://play-to-policy.github.io

研究の動機と目的

  • 非エキスパートが記録した未加工で多様かつノイジーなロボットプレイデータからタスク固有の行動を学ぶという課題に対処すること。
  • タスク固有の報酬、ラベル、またはオンライン環境との相互作用を必要とせずに、ロボティクスにおける条件付き行動生成を可能にすること。
  • 自然言語処理やビジョン分野で一般的な大規模な生成モデルの成功を、オフラインで非構造化されたデータを用いたロボットポリシー学習に応用すること。
  • シミュレーションおよび実機のロボットにおいて、生のヒューマンデモから直接高パフォーマンスでゴールに条件づけられたポリシーを学習できることを示すこと。

提案手法

  • C-BeTは、行動トランスフォーマー(BeT)から変更を加えたトランスフォーマー・アーキテクチャを用い、アクションの離散化により連続的なアクションをモデル化することで、高次元の制御出力のシーケンスモデリングを可能にする。
  • 将来のゴール状態に条件づけたポリシー生成を採用し、Play-GCBCと同様に、望ましい結果に至るアクションを予測できるようにする。
  • 報酬の形状づけや報酬関数を一切必要とせず、未加工なヒューマンインタラクションのオフラインロールアウト上でエンドツーエンドで学習される。
  • 視覚的観測とプロピオセプティブフィードバックを入力として用いることで、人間によるゴールのラベルなしに視覚ベースのポリシー学習が可能になる。
  • 同じゴールに至る多様な軌道をモデル化することで、マルチモーダルな行動生成を実現し、分布的シフトに対して耐性を高める。
  • 大規模で未加工なプレイデータ上で自己教師あり学習を実施するため、現実世界への展開にスケーラブルである。

実験結果

リサーチクエスチョン

  • RQ1報酬信号を一切用いずに、オフラインで未加工なヒューマンプレイデータから、機能的でタスク固有の行動を条件付き生成モデルが学習できるか?
  • RQ2報酬に条件づけられたモデルや行動クローンベースラインと比較して、将来に条件づけられた行動生成は、未確認のゴールに対する一般化性とパフォーマンスでどの程度優れているか?
  • RQ3アクションの離散化を伴うトランスフォーマーに基づくモデルは、ロボット操作タスクにおける多様でマルチモーダルな軌道に対して、どの程度一般化できるか?
  • RQ4このようなモデルは、視覚的およびプロピオセプティブな観測のみを用いて、未加工なヒューマンデモから実世界のロボットタスクで高いパフォーマンスを達成できるか?

主な発見

  • C-BeTは、未加工なプレイデータから学習する際、シミュレーションベンチマークにおいて、先行研究比で平均45.7%のパフォーマンス向上を達成した。
  • モデルは、人間によるラベル付けや報酬信号を一切使用せず、4.5時間の未加工なヒューマンプレイデータのみを用いて、フレンカ・ロボット上で現実世界の操作タスク用の視覚的ポリシーを学習した。
  • マルチモーダルなブロックプッシュおよびキッチンタスクにおいて、C-BeTは未確認の干渉要因やゴール設定に対しても一般化でき、分布的シフトに対して耐性があることを示した。
  • 特に高次元の視覚環境では、標準的な行動クローンや報酬に条件づけられたトランスフォーマーと比較して、ゼロショットのゴール一般化性能で優れた結果を示した。
  • C-BeTは、ノイジーでエキスパートでないデータであっても、オフラインデータのみを用いて大規模かつマルチモーダルな行動生成がロボティクス分野で実現可能であることを示した。
  • この手法により、オンラインファインチューニングを必要とせず、タスク固有のポリシーを現実世界に展開可能となり、データ収集と工学的作業の負担を大幅に削減できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。