Skip to main content
QUICK REVIEW

[論文レビュー] Bi-Manual Manipulation and Attachment via Sim-to-Real Reinforcement Learning

Satoshi Kataoka, Seyed Kamyar Seyed Ghasemipour|arXiv (Cornell University)|Mar 15, 2022
Robot Manipulation and Learning被引用数 5
ひとこと要約

本論文では、関節空間制御と生観測を用いたシミュレータから実世界への強化学習アプローチを提示し、実際のxArm6ロボットにおいてブロックのピッキングで100%の成功、磁石付きブロックの接続で65%の成功を達成した。この手法により逆運動学やフィルタリングの必要がなくなり、制御が簡素化された。また、シミュレータの改造により、実世界への移行性が向上した。

ABSTRACT

Most successes in robotic manipulation have been restricted to single-arm robots, which limits the range of solvable tasks to pick-and-place, insertion, and objects rearrangement. In contrast, dual and multi arm robot platforms unlock a rich diversity of problems that can be tackled, such as laundry folding and executing cooking skills. However, developing controllers for multi-arm robots is complexified by a number of unique challenges, such as the need for coordinated bimanual behaviors, and collision avoidance amongst robots. Given these challenges, in this work we study how to solve bi-manual tasks using reinforcement learning (RL) trained in simulation, such that the resulting policies can be executed on real robotic platforms. Our RL approach results in significant simplifications due to using real-time (4Hz) joint-space control and directly passing unfiltered observations to neural networks policies. We also extensively discuss modifications to our simulated environment which lead to effective training of RL policies. In addition to designing control algorithms, a key challenge is how to design fair evaluation tasks for bi-manual robots that stress bimanual coordination, while removing orthogonal complicating factors such as high-level perception. In this work, we design a Connect Task, where the aim is for two robot arms to pick up and attach two blocks with magnetic connection points. We validate our approach with two xArm6 robots and 3D printed blocks with magnetic attachments, and find that our system has 100% success rate at picking up blocks, and 65% success rate at the Connect Task.

研究の動機と目的

  • 実世界のハードウェアに効果的に転送可能な、二本のアームを用いたシミュレータから実世界への強化学習パイプラインの開発。
  • マルチアームシステムにおける二本のアームの協調制御、アーム同士の衝突回避、および駆動系のノイズといった課題の解決。
  • 視認性や高精度制御の課題から独立した、二本のアームの協調制御を核とする最小限で効果的な評価タスク(磁石付きブロック接続)の設計。
  • 逆運動学や経路計画の必要がない、関節空間の行動と生センサ観測を用いたリアルタイム制御の簡素化。
  • シミュレータの改造(例:アクチュエータノイズ、観測ノイズ)が、訓練を遅くするものの、実機へのポリシー転送に不可欠であることを示すこと。

提案手法

  • 実際のロボットモデル、磁石付きブロック、アクチュエータダイナミクスを備えたカスタム環境を用いて、物理ベースのシミュレーションで深層強化学習ポリシーを訓練。
  • リアルタイム(4Hz)の関節空間制御を実装し、直接関節速度をロボットに出力することで、逆運動学や経路計画の必要性を排除。
  • 前処理やフィルタリングなしに、生の観測(関節位置、速度、ブロック状態)を直接深層ニューラルネットワークポリシーに供給。
  • アクチュエータノイズ、観測ノイズ、現実的な関節制限などを含むシミュレータの改造を導入し、シミュレータから実世界への転送性を向上。
  • タスク完了と協調性を重視した報酬形状を用いて、Proximal Policy Optimization (PPO) でポリシーを訓練。
  • 3Dプリントされた磁石付きブロックを用いて、2台の実際のxArm6ロボットでポリシーを検証し、距離と向きのヒューマン確認基準を用いた成功基準を設定。

実験結果

リサーチクエスチョン

  • RQ1シミュレーションで訓練された強化学習ポリシーが、明示的な衝突回避やフィルタリングなしに、二つの実際のロボットアームを協調制御して制御可能かどうか。
  • RQ2アクチュエータノイズや観測ノイズなどのシミュレータ改造が、実世界のロボットシステムへのポリシー転送性に与える影響は。
  • RQ3視認性や高精度制御の課題から独立した、二本のアームの協調制御を核とする最小限で効果的なタスク設計とは何か。
  • RQ4関節空間制御と生観測を用いることで、リアルタイムのロボット制御において逆運動学や経路計画の必要性を排除できるか。
  • RQ51つのニューラルネットワークポリシーが、実世界の二本アーム操作環境で、再試行可能(例:落下後に再ピッキング)な頑健な行動を学習できる範囲はどの程度か。

主な発見

  • 実際のxArm6ロボットにおいてピッキングタスクで100%の成功率を達成し、ブロックの確実な取得と保持が可能であることを示した。
  • 実世界での接続タスクでは65%の成功率を達成し、磁石付きブロック間の距離が1mm以内かつ正しい向きであることを成功基準とした。
  • アクチュエータノイズや観測ノイズなどのシミュレータ改造が、実世界への転送に不可欠であったが、訓練時間が延長された(例:改造ありで18億ステップ、なしで2億8千万ステップ)。
  • シミュレータ改造なしで訓練したポリシーは実機への一般化に失敗し、シミュレータから実世界へのドメインランダマイゼーションの重要性が浮き彫りになった。
  • 関節空間制御を用いることで、逆運動学、経路計画、衝突チェックのレイヤーの必要性が排除され、リアルタイム制御スタックが簡素化された。
  • 磁石付きブロック接続タスクは、二本アームの協調制御を核の課題として明確に分離し、視認性や高精度制御の負荷から独立した、二本アームスキルの集中評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。