Skip to main content
QUICK REVIEW

[論文レビュー] Circus ANYmal: A Quadruped Learning Dexterous Manipulation with Its Limbs

Fan Shi, Timon Homberger|arXiv (Cornell University)|Nov 17, 2020
Robotic Locomotion and Control参考文献 50被引用数 8
ひとこと要約

本論文では、モデルフリーの深層強化学習を用いて、四足歩行ロボットANYmalが全4本の脚を用いて、現実世界で器用でダイナミックな操作を実現する初の実証が行われた。訓練は、耐障害性を高めるためにランダム化を伴うシミュレーションで実施され、ポリシーは実機へのゼロショットデプロイを可能にし、ボールの回転速度が最大15°/sに達し、連続的な操作中に外部からの干渉に対しても頑健に回復することを達成した。

ABSTRACT

Quadrupedal robots are skillful at locomotion tasks while lacking manipulation skills, not to mention dexterous manipulation abilities. Inspired by the animal behavior and the duality between multi-legged locomotion and multi-fingered manipulation, we showcase a circus ball challenge on a quadrupedal robot, ANYmal. We employ a model-free reinforcement learning approach to train a deep policy that enables the robot to balance and manipulate a light-weight ball robustly using its limbs without any contact measurement sensor. The policy is trained in the simulation, in which we randomize many physical properties with additive noise and inject random disturbance force during manipulation, and achieves zero-shot deployment on the real robot without any adjustment. In the hardware experiments, dynamic performance is achieved with a maximum rotation speed of 15 deg/s, and robust recovery is showcased under external poking. To our best knowledge, it is the first work that demonstrates the dexterous dynamic manipulation on a real quadrupedal robot.

研究の動機と目的

  • 四足歩行ロボットが、動物に似た操作スキルを再現するように、全4本の脚を用いて器用でダイナミックな操作を実行できるようにすること。
  • 接触センサーや接触ダイナミクスの事前知識がなくとも、全脚を用いた操作のためのポリシーを訓練する課題を克服すること。
  • シミュレーションで学習したポリシーを実機の四足歩行ロボットにゼロショットでデプロイし、現実世界での調整なしに頑健な性能を維持すること。
  • 強化学習を通じて、歩行と操作の二重性を探索すること、特に報酬設計と制御戦略の観点から。

提案手法

  • 接触ダイナミクスの事前知識やセンサーフィードバックが一切ない状態で、モデルフリーの深層強化学習を用いてシミュレーション内でポリシーを訓練する。
  • ロール、ピッチ、ヨーの目標角速度への追従を重視し、過剰な制御入力に対してペナルティを課す報酬関数を用いて訓練する。
  • 物理的特性(例:質量、摩擦、減衰)のランダム化と、訓練中にランダムな干渉力の注入により、シミュレーションと実機のギャップに対する耐障害性を高める。
  • 外部接触センサーやビジョンを一切使用せず、関節のプロ prioceptiveフィードバックのみを用いるため、現実世界への実装が実用的である。
  • ロボットの本体がボールに触れることを防ぎ、唯一の足を用いて軽量なサーカスボールを操作するようにポリシーを訓練する。
  • 多脚歩行と多指操作の間にある本質的二重性を活用し、歩行制御の原則を操作制御に再利用する。

実験結果

リサーチクエスチョン

  • RQ1接触センサーや専用の操作装置がなくとも、四脚を用いて器用でダイナミックな操作を学習できるか?
  • RQ2シミュレーションで訓練した深層強化学習ポリシーが、実機の四足歩行ロボットに現実世界での微調整なしにゼロショットでデプロイ可能か?
  • RQ3標準的な歩行報酬関数と比較して、動的操作用に有効な報酬形状戦略は何か?
  • RQ4接触センシングが欠如している場合、四肢を用いた操作におけるポリシー学習と頑健性にどのような影響が生じるか?

主な発見

  • 実機のANYmalロボットへのゼロショットデプロイが達成され、現実世界での微調整なしに強いシミュレーションから実機への一般化を示した。
  • ロボットは2分以上にわたり連続的なダイナミックな操作を実行し、最大15°/sの安定したボール回転を維持した。
  • 操作中、ポキングなどの外部からの干渉に対しても、制御系が頑健に回復した。
  • 目標速度追従に基づく報酬設計が、直接的な速度ベースの報酬よりも優れており、特に複雑な接触状況下で顕著に効果を発揮した。
  • 歩行と操作の二重性を効果的に活用し、共通の制御原則が全脚操作に応用可能であることを示した。
  • 接触センサの欠如が性能に悪影響を及ぼさず、ポリシーは関節のプロ prioceptive情報と学習された接触ダイナミクスにのみ依存していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。