[論文レビュー] Scaling Robot Learning with Semantically Imagined Experience
本稿では、実世界のデータ収集を一切行わず、テキストから画像への拡散モデルを用いて意味的に意味のある、写真のようにリアルなデータ拡張を生成するROSIEという手法を提案する。自然言語のプロンプトを用いてオブジェクト、背景、不要物をインpaintingすることで、ポリシーが未学習のタスクや新しいごみだらけの環境に対しても一般化でき、分布外(OOD)のシナリオにおける成功検出のF1スコアを0.19から0.57まで著しく向上させる。
Recent advances in robot learning have shown promise in enabling robots to perform a variety of manipulation tasks and generalize to novel scenarios. One of the key contributing factors to this progress is the scale of robot data used to train the models. To obtain large-scale datasets, prior approaches have relied on either demonstrations requiring high human involvement or engineering-heavy autonomous data collection schemes, both of which are challenging to scale. To mitigate this issue, we propose an alternative route and leverage text-to-image foundation models widely used in computer vision and natural language processing to obtain meaningful data for robot learning without requiring additional robot data. We term our method Robot Learning with Semantically Imagened Experience (ROSIE). Specifically, we make use of the state of the art text-to-image diffusion models and perform aggressive data augmentation on top of our existing robotic manipulation datasets via inpainting various unseen objects for manipulation, backgrounds, and distractors with text guidance. Through extensive real-world experiments, we show that manipulation policies trained on data augmented this way are able to solve completely unseen tasks with new objects and can behave more robustly w.r.t. novel distractors. In addition, we find that we can improve the robustness and generalization of high-level robot learning tasks such as success detection through training with the diffusion-based data augmentation. The project's website and videos can be found at diffusion-rosie.github.io
研究の動機と目的
- 人間のデモや設計された自律システムに依存するため、コストが高く、時間がかかる実世界のロボットデータ収集のスケーリング課題に対処すること。
- 市販のテキストから画像への拡散モデルが、多様で現実的で意味的に意味のあるロボット学習のための訓練データを生成できるかどうかを調査すること。
- 未学習のオブジェクトやごみだらけのシーンを含む分布外(OOD)環境において、ロボットポリシーおよび成功検出器の頑健性と一般化性能を向上させること。
- セマンティクス的および空間的一致性を保ちつつ、新しいタスクにゼロショットで適応可能な汎用的なデータ拡張フレームワークを開発すること。
提案手法
- 最先端のテキストから画像への拡散モデル(例:DALL-E 2、Stable Diffusion)を用いて、既存のロボットデモンストレーション画像のセマンティックインパインティングを実行する。
- プロンプト工学を用いて、自然言語の指示を解析し、変更すべき領域(例:ターゲットオブジェクト、不要物、背景)を特定する。
- テキストガイド付きのインパインティングを適用し、シーンの残りの部分(ロボットのポーズやオブジェクトのグリップなど)を保持したまま、特定の画像領域を置き換える。
- プロンプトのバリエーションを用いて、オブジェクトの識別子、色、シーンの文脈を体系的に変化させることで、多様でリアルな訓練データを生成する。
- 実データと合成された意味的整合性のあるデータを組み合わせた拡張データセットを用いて、下流のモデル(例:ポリシー、成功検出器)を学習する。
- CLIPベースの成功検出器を用いて、未学習の不要物や新しいオブジェクトを含むOODテストセットにおける一般化性能を評価する。
実験結果
リサーチクエスチョン
- RQ1テキストガイドドの画像生成モデルは、ロボット学習におけるゼロショット一般化を向上させるために、現実的で意味的に意味のあるデータ拡張を生成できるか?
- RQ2ROSIEは、追加の実世界データ収集を一切行わずに、新しいオブジェクトや未学習の環境へのポリシーの一般化をどの程度向上させられるか?
- RQ3ROSIEは、新しい不要物を含む分布外(OOD)シナリオにおける成功検出のような高レベルのタスクの頑健性を向上させるか?
- RQ4拡散モデルを用いたデータ拡張の規模が、分布内およびOODベンチマークにおける下流のパフォーマンスにどのように影響するか?
主な発見
- ROSIEは、OODテストセットにおける成功検出のF1スコアを、拡張なしの0.19から完全なROSIE拡張での0.57まで著しく向上させ、新しい不要物に対して強い頑健性を示した。
- 分布内タスクにおけるパフォーマンスは安定しており(F1 ≈ 0.66)、ROSIEが見知った分布でのパフォーマンスを低下させないことを示している。
- ROSIEで拡張されたデータで学習したポリシーは、元の訓練データに存在しなかった完全に未学習のタスク(例:ピーチの近くにイエローチャンクバッグを移動する)に対しても成功して一般化した。
- この手法は、視覚的変化にもかかわらず、空間的および意味的整合性を保った有効なデータ拡張を可能にし、モデルがタスク関連の特徴を学習できるようにした。
- ROSIEはシミュレーションやモーションデータを一切必要とせず、画像レベルの意味的拡張に依存するだけで、一般化性能の向上を達成した。
- フレーム単位の拡張にもかかわらず、ロボティクストランスフォーマーのアーキテクチャにおいて安定したパフォーマンスが得られたことから、時間的整合性が保持されたことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。