Skip to main content
QUICK REVIEW

[論文レビュー] Residual Learning from Demonstration: Adapting Dynamic Movement Primitives for Contact-rich Insertion Tasks

Todor Davchev, Kevin Sebastian Luck|arXiv (Cornell University)|Aug 18, 2020
Robot Manipulation and Learning参考文献 33被引用数 8
ひとこと要約

本稿では、接触を伴う挿入タスクのための動的移動素子(DMPs)の性能を向上させるために、行動コーディングと強化学習に基づく残差補正ポリシーを組み合わせた、残差学習によるデモ(rLfD)というフレームワークを提案する。この手法は、ロボットの全姿勢を直接タスク空間で処理することで、シミュレーションおよび実世界のピン、ギア、プラグ挿入タスクにおいて、DMPの性能、一般化能力、成功確率を顕著に向上させる。

ABSTRACT

Contacts and friction are inherent to nearly all robotic manipulation tasks. Through the motor skill of insertion, we study how robots can learn to cope when these attributes play a salient role. In this work we study ways for adapting dynamic movement primitives (DMP) to improve their performance in the context of contact rich insertion. We propose a framework we refer to as residual learning from demonstration (rLfD) that combines dynamic movement primitives (DMP) that rely on behavioural cloning with a reinforcement learning (RL) based residual correction policy. Our evaluation suggests that applying residual learning directly in task space and operating on the full pose of the robot can significantly improve the overall performance of DMPs. We show that rLfD outperforms alternatives and improves the generalisation abilities of DMPs. We evaluate this approach by training an agent to successfully perform both simulated and real world insertions of pegs, gears and plugs into respective sockets.

研究の動機と目的

  • 摩擦および接触力が重要な接触を伴う環境において、ロバストな挿入行動を学習する課題に対処すること。
  • 異なる幾何形状や接触ダイナミクスを伴う複雑な挿入タスクに応用する際の、動的移動素子(DMPs)の一般化能力およびロバスト性を向上させること。
  • 模倣学習(行動コーディング)と強化学習を組み合わせたハイブリッド学習フレームワークを構築し、実時間でDMP軌道を補正すること。
  • 接触感度の高い挿入タスクにおいて、シミュレーションから実世界への有効な転送を可能にすること。
  • 全姿勢空間における残差補正が、成功確率およびロバスト性において代替手法を上回ることを実証すること。

提案手法

  • 本フレームワークは、示された軌道に基づいて行動コーディングにより訓練されたDMPポリシーを用い、ベースラインの運動ポリシーを提供する。
  • 残差補正ポリシーは、強化学習を用いて訓練され、タスク空間の誤差と接触フィードバックに基づき、実時間でDMP出力を修正する。
  • 残差ポリシーは、タスク空間におけるロボットエンドエフェクタの全6次元姿勢(位置および姿勢)に直接作用するため、接触相互作用中の高精度な補正が可能である。
  • 残差補正は実行中にオンラインで適用され、接触力やノーマル軌道からのずれに応じて動的に適応可能である。
  • 成功した挿入を促進すると同時に、大きなずれや過剰な接触力をペナルティ化する報酬形状戦略が用いられる。
  • フレームワークはシミュレーションでエンドツーエンドに訓練され、ドメインランダマイゼーションや微調整を最小限に抑えて実世界のハードウェアに転送される。

実験結果

リサーチクエスチョン

  • RQ1強化学習で訓練された残差補正ポリシーは、接触を伴う挿入タスクにおけるDMPの成功確率を顕著に向上させることができるか?
  • RQ2全タスク空間の姿勢空間で残差ポリシーを動作させることで、関節空間または部分的姿勢補正と比較して、より優れた性能と一般化能力が得られるか?
  • RQ3rLfDは、多様な挿入幾何形状において、標準的なDMPや他の模倣学習+強化学習ベースラインと比較して、ロバスト性および成功確率の点で優れているか?
  • RQ4rLfDフレームワークは、広範な微調整を伴わずに、シミュレーションから実世界への実行に一般化できる程度はどの程度か?
  • RQ5残差補正ポリシーは、挿入中に変動する接触ダイナミクスや幾何的不一致を効果的に処理できるか?

主な発見

  • rLfDフレームワークは、単独で行動コーディングで訓練された標準的なDMPと比較して、著しく挿入成功確率を向上させる。
  • 全姿勢空間における残差補正は、関節空間または部分的姿勢補正と比較して、異なる挿入タスク(ピン、ギア、プラグ)における一般化能力が優れている。
  • 本手法は、シミュレーションおよび実世界の実験の両方で高い成功確率を達成し、有効なシミュレーションから実世界への転送を示している。
  • 強化学習に基づく残差補正の統合により、実行中に接触力や幾何的変動に適応可能となり、失敗モードが低減される。
  • 多様な挿入シナリオにおいて、他の模倣学習+強化学習ベースラインと比較して、ロバスト性および成功確率の点で優れた性能を発揮する。
  • 残差ポリシーは、軌道のずれや接触力の急激な上昇を効果的に低減し、滑らかで信頼性の高い挿入を実現する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。