[論文レビュー] MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations
MimicGen は、オブジェクト中心の軌道分割、空間変換、およびステッチ処理を通じて、少数の人のデモを新しい環境に適応させることで、大規模かつ多様なロボットデモデータセットを合成するデータ生成システムである。この手法により、長時間スケールかつ高精度なタスクにおける効果的な模倣学習が可能となり、人間がアノテートしたデータと同等の性能を達成する。わずか約200件のソースデモから、多様なオブジェクト、シーン、ロボットアームを含む18のタスクで50,000件を超える合成軌道を生成した。
Imitation learning from a large set of human demonstrations has proved to be an effective paradigm for building capable robot agents. However, the demonstrations can be extremely costly and time-consuming to collect. We introduce MimicGen, a system for automatically synthesizing large-scale, rich datasets from only a small number of human demonstrations by adapting them to new contexts. We use MimicGen to generate over 50K demonstrations across 18 tasks with diverse scene configurations, object instances, and robot arms from just ~200 human demonstrations. We show that robot agents can be effectively trained on this generated dataset by imitation learning to achieve strong performance in long-horizon and high-precision tasks, such as multi-part assembly and coffee preparation, across broad initial state distributions. We further demonstrate that the effectiveness and utility of MimicGen data compare favorably to collecting additional human demonstrations, making it a powerful and economical approach towards scaling up robot learning. Datasets, simulation environments, videos, and more at https://mimicgen.github.io .
研究の動機と目的
- ロボット学習のための大規模な人のデモを収集するのにかかる高コストと時間の問題を解決すること。
- 限られた人のデモを再利用して、新しいシーン、オブジェクト、ロボットハードウェアの分野で多様で高品質なデータを生成する汎用システムの開発。
- MimicGen が生成する合成データが、追加の人のアノテート済みデモと同等またはそれ以上の性能を示すかどうかを評価すること。
- 実世界の状況、例えばポーズ推定誤差やハードウェアのばらつきを想定した状況下でも、生成されたデータの頑健性を示すこと。
提案手法
- システムは、オブジェクト同士の相互作用と空間的関係に基づいて、人のデモをオブジェクト中心の軌道に分割する。
- 各新しいシーン設定に対して、ソースデモを選択し、空間変換(平行移動、回転)を適用して、オブジェクト中心のセグメントを新しいオブジェクトのポーズに一致させる。
- 変換されたセグメントをステッチ処理して、ロボットが実行可能で、記録可能な完全な軌道を形成する。
- 最小限の仮定で動作する。特別なマーカーや正確なポーズトラッキングは不要で、実世界への展開には標準的なポーズ推定技術を用いる。
- データ生成は複数のシミュレーション環境および物理的ロボットアームに適用され、オブジェクト初期化、セグメント選択、アクションノイズにランダムネスを導入することで多様性を向上させる。
- 生成されたデータセットを用いて、視覚運動方策則(visuomotor policies)を模倣学習で訓練し、長時間スケールおよび高精度タスクでの性能を評価する。
実験結果
リサーチクエスチョン
- RQ1少数の人のデモを、新しい環境において多様で高品質なロボット軌道を生成するために効果的に再利用できるか?
- RQ2MimicGen が生成する合成データを用いた模倣学習が、追加の人のアノテート済みデモを用いた場合と同等の性能を達成できるか?
- RQ3実世界の状況におけるポーズ推定誤差に対して、データ生成プロセスはどれほど頑健か?
- RQ4MimicGen は、マルチパーツアセンブリやコーヒープロセスなど、長時間スケールおよび高精度な操作タスクに一般化できるか?
- RQ5合成データで訓練された方策則の性能は、異なるデータ生成シードや環境変動に対しても安定しているか?
主な発見
- MimicGen は、わずか約200件の人のデモから、多様なシーン、オブジェクト、ロボットアームを含む18のタスクで50,000件を超える高品質なデモを生成した。
- MimicGen が生成したデータで訓練された方策則は、人のアノテート済みデータで訓練されたものと同等の成功確率を達成した。例えば、Square タスク(DGR)では96.7%、Coffee(SR)では90.7%の成功率を示し、人間のデータベースラインを同等または上回った。
- ポーズ推定誤差に対しても頑健であることが示された:10 mm / 10 deg のノイズが加わっても、成功確率は依然として高い水準を維持した(例:Square D0 で84.7%、Square D2 で39.3%)。実世界への適用可能性が裏付けられた。
- 異なるシードでのデータ生成成功率の差は1%未満(例:Stack Three では71.7±0.3% ~ 69.3±0.4%)であり、方策則の成功確率は報告値から2%未満のずれにとどまり、変動が小さく、再現性が高いことが示された。
- 実世界での展開において、MimicGen は特別なタグや正確なポーズトラッキングを必要とせず、標準的なオブジェクトポーズ推定技術のみで機能する軌道を正常に生成した。
- この手法により、高コストな人のデータ収集の必要性が顕著に削減された。MimicGen が生成する合成データは、下流タスクの性能において追加の人のデモを同等または上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。