Skip to main content
QUICK REVIEW

[論文レビュー] ACNMP: Skill Transfer and Task Extrapolation through Learning from Demonstration and Reinforcement Learning via Representation Sharing

Mete Tuluhan Akbulut, Erhan Öztop|arXiv (Cornell University)|Mar 25, 2020
Reinforcement Learning in Robotics参考文献 35被引用数 11
ひとこと要約

本論文は、模倣学習(LfD)と強化学習(RL)の間で潜在表現を共有することにより、サンプル効率の良いポリシー改善とスキル転送を可能にする、新しいLfD+RLフレームワークACNMPを提案する。デモデータに対する教師あり学習と、新しいタスクに対する強化学習を同時に最適化することで、ACNMPは示されたスキルの特徴を保持しつつ、分布外の状況にも適応可能であり、実世界での検証を経て、外挿とクロスエムボディスキル転送において最先端の性能を達成している。

ABSTRACT

To equip robots with dexterous skills, an effective approach is to first transfer the desired skill via Learning from Demonstration (LfD), then let the robot improve it by self-exploration via Reinforcement Learning (RL). In this paper, we propose a novel LfD+RL framework, namely Adaptive Conditional Neural Movement Primitives (ACNMP), that allows efficient policy improvement in novel environments and effective skill transfer between different agents. This is achieved through exploiting the latent representation learned by the underlying Conditional Neural Process (CNP) model, and simultaneous training of the model with supervised learning (SL) for acquiring the demonstrated trajectories and via RL for new trajectory discovery. Through simulation experiments, we show that (i) ACNMP enables the system to extrapolate to situations where pure LfD fails; (ii) Simultaneous training of the system through SL and RL preserves the shape of demonstrations while adapting to novel situations due to the shared representations used by both learners; (iii) ACNMP enables order-of-magnitude sample-efficient RL in extrapolation of reaching tasks compared to the existing approaches; (iv) ACNMPs can be used to implement skill transfer between robots having different morphology, with competitive learning speeds and importantly with less number of assumptions compared to the state-of-the-art approaches. Finally, we show the real-world suitability of ACNMPs through real robot experiments that involve obstacle avoidance, pick and place and pouring actions.

研究の動機と目的

  • 初期のスキル習得後、学習から示された例(LfD)を用いた環境の変更に対するポリシー適応におけるサンプル非効率性を解消すること。
  • 強化学習によるポリシー最適化の過程で、専門家のデモの質的特徴を維持し、内因的スキル特徴への干渉を回避すること。
  • 異なる形状のロボット間で、共有潜在表現空間を学習することで、自動的なスキル転送を可能にすること。
  • LfDとRLの両成分に統一された表現を用いることで、示されたタスクパラメータ範囲を超えた一般化と外挿を向上させること。

提案手法

  • ACNMPは、タスクパラメータを条件として与えたデモ軌道の潜在表現を学習するため、共有エンコーダ・デコーダネットワークを備えた条件付きニューラルプロセス(CNP)アーキテクチャを採用する。
  • モデルは、専門家のデモデータに対する教師あり学習と、新しい環境におけるポリシー最適化のための強化学習を併用して訓練される。
  • CNPから得られる潜在表現が、LfDとRLの両コンponent間で共有されることで、一貫性のあるポリシー適応が可能になり、デモの忠実性が保持される。
  • システムは、RLによるポリシー更新と、デモデータを用いたSLによる誤差補正を交互に実行することで、形状の保存と一般化性能の向上が保証される。
  • 共有潜在空間により、異なる形状のロボット間で、デモを共通のポリシー表現にマッピングすることで、ゼロショットスキル転送が実現される。
  • 実世界での展開では、6自由度のロボットアーム上でACNMPが生成した関節軌道を追従するコントローラーが使用される。

実験結果

リサーチクエスチョン

  • RQ1ACNMPは、示された設定範囲外の新しいタスクパラメータに外挿する際にも、スキルの質を維持できるか?
  • RQ2LfDとRLの間で共有表現を学習することで、新しい環境におけるサンプル効率とポリシー一般化がどのように向上するか?
  • RQ3ACNMPは、RLによる微調整の過程で、専門家のデモの質的特徴をどの程度維持できるか?
  • RQ4ACNMPは、座標変換を明示的に定義することなく、異なる形状のロボット間で効果的なスキル転送を可能にするか?
  • RQ5ACNMPは、障害物回避やポーリングを含む実世界のロボット操作タスクにおいて、どの程度の性能を示すか?

主な発見

  • 障害物を伴うピックアンドプレースタスクにおいて、ACNMPはオブジェクト高さ9 cm、障害物高さ11 cmの条件で、平均関節誤差をCNMPの1.861°から0.994°にまで低減した。
  • ポーリングタスクでは、ACNMPにより、目標マーブルの誤差がLfDオンリーの600グラムから18回のロールアウト後に27グラムにまで低下し、効果的な外挿とRL適応が確認された。
  • ACNMPは、到達タスクの外挿に際して、既存手法と比較して1桁のサンプル効率を達成し、ポーリングタスクの成功適応にたった18回のロールアウトで十分であった。
  • システムは、新しい状況に適応しながらも、デモから得た高品質な軌道形状を維持しており、関節誤差が低く、滑らかな運動プロファイルが得られた。
  • ACNMPは、異なる形状のロボット間で、明示的な仮定を少なく、最先端のアプローチと同等の学習速度で、成功したスキル転送を実現した。
  • 実ロボット実験により、ACNMPが障害物回避、ピックアンドプレース、ポーリングタスクにおいて、ロバストであることが確認され、実世界への適用可能性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。