Skip to main content
QUICK REVIEW

[論文レビュー] RoboAssembly: Learning Generalizable Furniture Assembly Policy in a Novel Multi-robot Contact-rich Simulation Environment

Mingxin Yu, Lin Shao|arXiv (Cornell University)|Dec 19, 2021
Innovations in Concrete and Construction Materials被引用数 4
ひとこと要約

本論文では、深層強化学習を用いて一般化可能な家具組立ポリシーを学習するための、マルチロボットで接触が豊富なシミュレーション環境「RoboAssembly」を紹介する。構造的表現とモデルフリー強化学習、および模倣学習を組み合わせることで、オブジェクト中心の設定下で未学習の椅子に対して74.5%の成功率を達成した。これは、RRT-Connectベースライン(18.8%)を著しく上回り、計画速度が速く、一般化性能に優れている。

ABSTRACT

Part assembly is a typical but challenging task in robotics, where robots assemble a set of individual parts into a complete shape. In this paper, we develop a robotic assembly simulation environment for furniture assembly. We formulate the part assembly task as a concrete reinforcement learning problem and propose a pipeline for robots to learn to assemble a diverse set of chairs. Experiments show that when testing with unseen chairs, our approach achieves a success rate of 74.5% under the object-centric setting and 50.0% under the full setting. We adopt an RRT-Connect algorithm as the baseline, which only achieves a success rate of 18.8% after a significantly longer computation time. Supplemental materials and videos are available on our project webpage.

研究の動機と目的

  • 複雑な家具組立タスクのための現実的で接触が豊富なマルチロボットシミュレーション環境の開発。
  • 構造的状態表現を用いた具体的な強化学習問題としてのロボット家具組立の定式化。
  • マルチロボット協調による、多様で未学習の椅子デザインの組立が可能な一般化可能なポリシーの学習。
  • 伝統的な運動計画法(例:RRT-Connect)と比較して、成功確率および計算効率の両面で向上を図ること。
  • 学習中に見未曾有の椅子構成に対してゼロショット一般化が可能であることを実証すること。

提案手法

  • 2台のFrankaアームを搭載した移動型プラットフォームを備えた、新しいマルチロボットシミュレーション環境の設計。接触が豊富な複雑な操作をサポート。
  • 複数のロボットが衝突を避けながら協調的に移動できるよう、運動計画モジュールを統合。
  • PartNetから抽出した220種類の椅子のデータセットを構築。実際の組立タスクを想定し、把持可能な領域と接続ポイントをアノテーション。
  • オブジェクト中心の状態表現と完全観測状態表現を用いた階層的強化学習問題としての組立タスクの定式化。
  • 640個の単一タスクポリシーからのデータ拡張を活用し、模倣学習とモデルフリー強化学習を用いて統合型ポリシーネットワークを訓練。
  • 640個の拡張済み単一タスクポリシーを学習データとして用いたマルチタスク学習パイプラインを構築。これにより、未学習の椅子デザインへのゼロショット一般化が可能に。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習ポリシーは、マルチロボットで接触が豊富な組立環境において、未学習の家具デザインに一般化可能か?
  • RQ2提案手法の強化学習ベースポリシーは、伝統的な運動計画法(例:RRT-Connect)と比較して、成功確率および計画効率の面で優れているか?
  • RQ3完全観測設定と比較して、オブジェクト中心の状態表現はポリシーの一般化性能をどの程度向上させるか?
  • RQ4模倣学習とモデルフリー強化学習を組み合わせることで、単一タスクからマルチタスクの家具組立スキルを効果的に転移できるか?
  • RQ5強化学習パイプラインに運動計画モジュールを統合することで、単体の計画器と比較して、より高速かつ信頼性の高い経路計画が可能になるか?

主な発見

  • オブジェクト中心の設定下で、未学習の椅子に対して74.5%の成功率を達成。これはRRT-Connectベースライン(18.8%)を著しく上回っている。
  • 完全観測設定下では、未学習の椅子に対して50.0%の成功率を達成。ゼロショット一般化能力が顕著に示された。
  • 訓練済みポリシーは1椅子あたり平均37.8kステップで実行可能な組立経路を計画したが、RRT-Connectは91.7kステップを要した。計算効率に優れていることが示された。
  • 640個の拡張済み単一タスクポリシーを学習データとして用いたマルチタスクポリシーは、192種類の未学習の椅子に対して効果的に一般化した。これにより、強靭性とスケーラビリティが確認された。
  • 平均して1回の成功した組立の計画時間を2分未満に短縮した。一方、RRT-Connectは著しく長い計算時間を要した。
  • ハードな学習データセットでは、オブジェクト中心設定下で79.4%の成功率を達成。複雑で挑戦的な椅子構成に対しても優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。