[論文レビュー] Imitating Task and Motion Planning with Visuomotor Transformers
本論文では、タスクとモーションプランニング(TAMP)エージェントの行動を模倣するための、アノテーションなしで学習可能な視覚運動変換器ポリシーであるOPTIMUSを提案する。これにより、高速で反応性が高く、一般化性に優れたロボット操作が可能になる。TAMPが自律的に生成した大規模かつ多様なデモンストレーションを活用することで、最大8段階、72種類の物体を含む300以上の長時間スパンのタスクにおいて70–80%の成功率を達成し、特権状態情報なしでエンドツーエンド制御が可能であり、優れた一般化性能を示している。
Imitation learning is a powerful tool for training robot manipulation policies, allowing them to learn from expert demonstrations without manual programming or trial-and-error. However, common methods of data collection, such as human supervision, scale poorly, as they are time-consuming and labor-intensive. In contrast, Task and Motion Planning (TAMP) can autonomously generate large-scale datasets of diverse demonstrations. In this work, we show that the combination of large-scale datasets generated by TAMP supervisors and flexible Transformer models to fit them is a powerful paradigm for robot manipulation. To that end, we present a novel imitation learning system called OPTIMUS that trains large-scale visuomotor Transformer policies by imitating a TAMP agent. OPTIMUS introduces a pipeline for generating TAMP data that is specifically curated for imitation learning and can be used to train performant transformer-based policies. In this paper, we present a thorough study of the design decisions required to imitate TAMP and demonstrate that OPTIMUS can solve a wide variety of challenging vision-based manipulation tasks with over 70 different objects, ranging from long-horizon pick-and-place tasks, to shelf and articulated object manipulation, achieving 70 to 80% success rates. Video results and code at https://mihdalal.github.io/optimus/
研究の動機と目的
- 行動学習における人間によるアノテーション付きロボットデモンストレーション収集のスケーラビリティと人的負荷の問題を解決すること。
- 自律的TAMP生成データセットを活用することで、効率的で反応性が高く、一般化可能な視覚運動ポリシーを実現すること。
- 特権情報やマルチモーダルデモンストレーションといったTAMPの模倣における課題を、変換器ベースのアーキテクチャを用いて解消すること。
- 明示的なタスクレベルのアクションマッピングを必要とせず、高周波(30–50Hz)で動作するスケーラブルかつエンドツーエンドの視覚運動ポリシーを構築すること。
- TAMPの模倣が、物体の形状の多様性やタスクの多様性にわたって一般化可能であり、TAMPの反応性やリアルタイム実行における制限を超えるポリシーを生成できることを実証すること。
提案手法
- TAMPスーパーヴァイザーが生成した成功事例の多様で大規模なデータセットを用いて、オффラインの行動クラーニングにより大規模な視覚運動変換器ポリシーを学習する。
- システムは、RGB画像などの生の観測値を処理し、30–50Hzで低レベルの制御命令を出力することで、リアルタイムかつ反応性の高い制御を実現する。
- 明示的なタスクレベルのアクション予測を必要とせず、タスク構造を暗黙的に推論できるようにアーキテクチャを設計することで、物体数やタスク段階数の変動に対しても一般化が可能になる。
- TAMPが幾何学的・意味論的特権情報を活用して高品質な軌道を生成できるように、タスク関連の多様なデモンストレーションを生成するためのデータ生成パイプラインを開発した。
- マルチモーダルデモンストレーションに対応し、エキスパートと模倣ポリシー間の分布シフトを低減するためのアーキテクチャ的およびトレーニング的インサイトを統合した。
- ピックアンドプレース、シェルフへの配置、アーティキュレーテッドオブジェクトの操作など、広範な長時間スパンの操作タスクの分布をカバーしてフレームワークを評価した。

実験結果
リサーチクエスチョン
- RQ1TAMPが生成したデモンストレーションを用いた行動学習により学習された視覚運動変換器ポリシーは、特権状態情報なしで、多様で長時間スパンの操作タスクに一般化可能か?
- RQ2TAMPの模倣における課題(特権情報への依存、マルチモーダルデモンストレーションなど)を、スケーラブルな行動学習フレームワークで効果的に克服できるか?
- RQ3模倣されたポリシーは、TAMPスーパーヴァイザーのデモンストレーションを学習したにもかかわらず、反応性や耐障害性においてそれを上回る性能を示せるか?
- RQ4データ生成、ネットワークアーキテクチャ、トレーニングにおけるどのような設計選択が、視覚運動設定におけるTAMPの模倣に成功するために不可欠か?
- RQ5得られたポリシーは、物体の形状の多様性やタスクの多様性にわたって一般化を維持しながら、高周波(30–50Hz)のエンドツーエンド制御を達成できるか?
主な発見
- OPTIMUSは、最大8段階、72種類の物体を含む300以上の長時間スパンの操作タスクにおいて、70–80%の成功率を達成し、強力な一般化性能を示した。
- 訓練中に見られなかった新しい物体形状やタスク構成に対しても、効果的に一般化しており、強力な視覚的推論と適応能力を示している。
- 30–50Hzで動作し、明示的なタスクレベルのアクション予測や特権状態推定を必要とせず、リアルタイムかつ反応性の高い制御を実現している。
- 視覚運動変換器ポリシーは、複数のグリップや多様な物体との順次相互作用を含む、複雑なマルチモーダルTAMP軌道を効果的に模倣した。
- 動的または部分観測環境において、反応性や耐障害性の点で模倣ポリシーの性能がTAMPスーパーヴァイザーを上回った。
- TAMPが生成する大規模かつ多様なデータセットが、行動学習を用いた一般化可能で高周波の視覚運動ポリシーの訓練に非常に効果的であることが実証された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。