Skip to main content
QUICK REVIEW

[論文レビュー] Learning Robotic Manipulation Skills Using an Adaptive Force-Impedance Action Space

Maximilian Ulmer, Elie Aljalbout|arXiv (Cornell University)|Oct 19, 2021
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

本稿では、強化学習(RL)とリアルタイムの適応型力・インピーダンス制御を組み合わせることで、ロボット操作におけるサンプル効率、エネルギー効率、安全性を向上させる、生物にインspiredされた階層的アクションスペースAFORCEを提案する。高レベルのタスク計画と低レベルの物理的相互作用制御を分離することで、AFORCEは実機上でも安定したコンプライアンス制御を実現し、シミュレーションおよび実世界の接触豊富なタスクにおいてベースラインのアクションスペースを上回る性能を示す。

ABSTRACT

Intelligent agents must be able to think fast and slow to perform elaborate manipulation tasks. Reinforcement Learning (RL) has led to many promising results on a range of challenging decision-making tasks. However, in real-world robotics, these methods still struggle, as they require large amounts of expensive interactions and have slow feedback loops. On the other hand, fast human-like adaptive control methods can optimize complex robotic interactions, yet fail to integrate multimodal feedback needed for unstructured tasks. In this work, we propose to factor the learning problem in a hierarchical learning and adaption architecture to get the best of both worlds. The framework consists of two components, a slow reinforcement learning policy optimizing the task strategy given multimodal observations, and a fast, real-time adaptive control policy continuously optimizing the motion, stability, and effort of the manipulator. We combine these components through a bio-inspired action space that we call AFORCE. We demonstrate the new action space on a contact-rich manipulation task on real hardware and evaluate its performance on three simulated manipulation tasks. Our experiments show that AFORCE drastically improves sample efficiency while reducing energy consumption and improving safety.

研究の動機と目的

  • 実世界のロボット操作タスクにおける深層強化学習のサンプル非効率性と不安定性を解消すること。
  • 高速で反応性の高い適応制御と、遅いが戦略的なRLポリシー学習を統合し、性能を向上させること。
  • 接触豊富なタスク中に力とインピーダンスを連続的に適応可能にする、新しいアクションスペースの開発。
  • シミュレーションおよび実機上での評価を通じて、サンプル効率、エネルギー消費、安全性に焦点を当てた検証。
  • 階層的制御と生物にインspiredされたアクションスペースが、複雑な操作タスクにおいて標準的なRLアクションスペースを上回ることの実証。

提案手法

  • AFORCEは、高レベルのタスクポリシーと低レベルの物理的相互作用制御を分離する、キャタシアンの適応型力・インピーダンス制御アクションスペースを導入する。
  • 高レベルのRLポリシーは、タスク戦略を計画するための小型でマルチモーダルな観測空間上で動作するが、低レベルの適応制御器は、安定性とコンプライアンスを確保するために力とインピーダンスを継続的に調整する。
  • フレームワークは、人間の運動制御にインspiredされた階層的制御アーキテクチャを採用しており、RLポリシーが所望の力とインピーダンスパラメータを設定し、適応制御器がそれをリアルタイムで実装する。
  • アクションスペースは、不具合抑制とエネルギー効率に不可欠な、機械的インピーダンスと接触力の連続的・反応的適応を可能にするように設計されている。
  • 本手法は、3つのタスク(Lift, Wipe, Door)を対象としたシミュレーションと、Franka Emika Pandaロボットを用いた実機上での検証を通じて評価された。
  • 剛性や減衰などの適応パラメータは手動でチューニングされたが、今後の研究ではポリシーと同時に学習することを目的としている。

実験結果

リサーチクエスチョン

  • RQ1生物にインspiredされた階層的アクションスペースは、ロボット操作における深層強化学習のサンプル効率を向上させ得るか?
  • RQ2AFORCEは、標準的なアクションスペースと比較して、学習の安定性と収束速度に優れているか?
  • RQ3AFORCEは、接触豊富な操作タスクにおけるエネルギー効率と安全性をどの程度向上させているか?
  • RQ4リアルタイムの適応制御とRLの統合により、実機上でも安定的かつコンプライアンスのある挙動が達成可能か?
  • RQ5タスク計画と物理的相互作用制御の分離は、耐障害性と性能向上に寄与するか?

主な発見

  • AFORCEは、Wipeタスクにおいて500,000ステップの訓練後、一貫した最大報酬を達成し、すべてのベースラインと比較して学習速度と成功確率が優れていた。
  • Wipeタスクにおいて、AFORCEは数エピソードの訓練で全汚れマークを除去できたが、他の手法は一貫した接触や力制御を維持できなかった。
  • AFORCEは、Wipe環境において、変動型および変動型+力制御アクションスペースと比較して、平均エネルギー消費を低減した。
  • AFORCEは、全手法の中で最低のペナルティ率を示し、Wipeタスクでは12%のエピソードしか安全ペナルティを受けなかったが、変動型ベースのアクションスペースでは75%以上であった。
  • low+forceアクションスペースは平均1エピソードあたり17.16のペナルティを記録したが、AFORCEは17.76とそれに近い値を示したのに対し、変動型空間は1エピソードあたり平均400以上のペナルティを記録した。
  • AFORCEは、複数のランダムシードで安定した学習を示し、報酬の分散が小さく、ポリシーの収束が堅牢であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。