Skip to main content
QUICK REVIEW

[論文レビュー] Beyond Pick-and-Place: Tackling Robotic Stacking of Diverse Shapes

Alex X. Lee, Coline Devin|arXiv (Cornell University)|Oct 12, 2021
Reinforcement Learning in Robotics被引用数 16
ひとこと要約

本論文では、ロボットスタッキングのための多様なベンチマークであるRGB-Stackingを紹介し、シミュレーションから現実世界への転送とオフライン強化学習(RL)ファインチューニングを組み合わせた視覚ベースの強化学習(RL)フレームワークを提案する。本手法はドメインランダマイゼーションとインタラクティブなポリシー蒸留を用いて、非立方体形状の物体を現実世界で安定してスタッキングすることに成功し、未学習の物体組み合わせに対しても高い成功率で一般化を示した。オフラインRLのファインチューニング後、高い性能を発揮した。

ABSTRACT

We study the problem of robotic stacking with objects of complex geometry. We propose a challenging and diverse set of such objects that was carefully designed to require strategies beyond a simple "pick-and-place" solution. Our method is a reinforcement learning (RL) approach combined with vision-based interactive policy distillation and simulation-to-reality transfer. Our learned policies can efficiently handle multiple object combinations in the real world and exhibit a large variety of stacking skills. In a large experimental study, we investigate what choices matter for learning such general vision-based agents in simulation, and what affects optimal transfer to the real robot. We then leverage data collected by such policies and improve upon them with offline RL. A video and a blog post of our work are provided as supplementary material.

研究の動機と目的

  • 視覚ベースのロボットポリシーを用いて、現実世界で複雑な非立方体形状の物体をスタッキングする課題に取り組むこと。
  • 単純なピックアンドプレースタスクを超えた、スケーラブルで一般化可能なロボット操作のベンチマークを構築すること。
  • シミュレーションのハイパーパrameterとドメインランダマイゼーションが現実世界への転送性能に与える影響を調査すること。
  • シミュレーションから現実世界への転送で学習したポリシーに対するオフラインRLの有効性を評価すること。
  • 3Dプリントされた物体、シミュレーション環境、現実世界のセットアップドキュメンテーションを含む、完全に再現可能なベンチマークを公開すること。

提案手法

  • ドメインランダマイゼーションを用いてシミュレーションで訓練された視覚ベースのRLフレームワークを提案し、シミュレーションから現実世界への一般化を向上させる。
  • 人間のデモンストレーションを明示的に必要とせず、認識ポリシーの学習とスキル習得を分離するため、インタラクティブなポリシー蒸留を採用する。
  • RGBカメラとプロ prioceptionを備えた4自由度のロボットアームを用い、オフラインRLファインチューニングのための現実世界データを収集する。
  • 訓練中に画像のオーグメンテーションとドメインランダマイゼーションを適用し、現実世界の視覚的変動に対する耐性を向上させる。
  • 54,000回を超える大規模な現実世界データを活用して、初期のシミュレーションから現実世界への転送ポリシーを改善するオフラインRLエージェントを訓練する。
  • 152個の手続き的に生成され、3Dプリントされた物体、シミュレーション環境、現実世界のハードウェア手順書を含む完全なベンチマークを公開する。

実験結果

リサーチクエスチョン

  • RQ1ドメインランダマイゼーションとインタラクティブ蒸留を用いてシミュレーションで訓練された単一の視覚ベースポリシーは、現実世界の多様で非立方体形状の組み合わせに対して一般化可能か?
  • RQ2シミュレーションのハイパーパrameterとドメインランダマイゼーションは、ロボットスタッキングにおける現実世界性能にどのように影響するか?
  • RQ3シミュレーションから現実世界へのポリシーで収集したデータと、スクリプトされたエージェントで収集したデータに対して、オフラインRLファインチューニングは性能向上に寄与するか?
  • RQ4インタラクティブなポリシー蒸留は、人間のデモンストレーションがなくても、認識を意識したポリシー学習を可能にする役割を果たすか?
  • RQ5物体の幾何形状の設計が、スタッキングの難易度や複雑な戦略の出現にどのように影響を与えるか?

主な発見

  • ドメインランダマイゼーションとインタラクティブ蒸留を用いてシミュレーションで訓練された単一の視覚ベースポリシーは、現実世界で5つの異なる物体の組み合わせに対して高い成功率を達成し、単純なピックアンドプレースを超えた一般化を示した。
  • オフラインRLファインチューニングは、シミュレーションから現実世界へのポリシーで収集したデータに対しては顕著に性能を向上させたが、スクリプトされたエージェントで収集したデータに対しては逆に性能が低下した。
  • エンドツーエンドのRL訓練を通じて、上部の部品を使って物体をひっくり返すなどの多様なスタッキング戦略を自発的に学習した。これは接触ダイナミクスに関する自己発生的推論を示している。
  • ベンチマーク、RGB-Stackingは10,000以上の可能なスタッキング組み合わせをサポートしており、トレーニング用の物体よりも定量的に難しいとされるホールドアウトセットの物体も含んでいる。
  • 54,000回を超える現実世界の実験を含む広範なアブレーション実験から、ドメインランダマイゼーションと画像オーグメンテーションがシミュレーションから現実世界への転送成功に不可欠であることが示された。
  • 公開されたベンチマークには、完全なシミュレーション環境、3Dプリントされた物体の設計図、詳細な現実世界のハードウェアドキュメンテーションが含まれており、完全な再現性が確保されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。