Skip to main content
QUICK REVIEW

[論文レビュー] Robotic Imitation of Human Assembly Skills Using Hybrid Trajectory and Force Learning

Yan Wang, Cristian C. Beltran-Hernandez|arXiv (Cornell University)|Mar 10, 2021
Robot Manipulation and Learning参考文献 32被引用数 4
ひとこと要約

本論文では、軌道取得に階層的ゴール条件付き模倣学習(HGCIL)を組み合わせ、強化学習に基づく力制御を用いるハイブリッド学習フレームワークを提案する。この手法により、低クリアランス挿入と変動する力要件を伴う現実世界の組立タスクにおいて、ロバストで高品質な軌道および力制御を実現し、ベースライン手法に比べてサンプル効率と現実世界への一般化能が優れている。

ABSTRACT

Robotic assembly tasks involve complex and low-clearance insertion trajectories with varying contact forces at different stages. While the nominal motion trajectory can be easily obtained from human demonstrations through kinesthetic teaching, teleoperation, simulation, among other methods, the force profile is harder to obtain especially when a real robot is unavailable. It is difficult to obtain a realistic force profile in simulation even with physics engines. Such simulated force profiles tend to be unsuitable for the actual robotic assembly due to the reality gap and uncertainty in the assembly process. To address this problem, we present a combined learning-based framework to imitate human assembly skills through hybrid trajectory learning and force learning. The main contribution of this work is the development of a framework that combines hierarchical imitation learning, to learn the nominal motion trajectory, with a reinforcement learning-based force control scheme to learn an optimal force control policy, that can satisfy the nominal trajectory while adapting to the force requirement of the assembly task. To further improve the imitation learning part, we develop a hierarchical architecture, following the idea of goal-conditioned imitation learning, to generate the trajectory learning policy on the extit{skill} level offline. Through experimental validations, we corroborate that the proposed learning-based framework is robust to uncertainty in the assembly task, can generate high-quality trajectories, and can find suitable force control policies, which adapt to the task's force requirements more efficiently.

研究の動機と目的

  • シミュレーションにおけるリアリティギャップのため、ロボット組立タスクで現実的な力プロファイルを学習する課題に対処すること。
  • 低クリアランスで接触が豊富な組立タスクに対して、軌道と力の学習を統合したロバストなフレームワークを開発すること。
  • 階層的模倣学習を用いて軌道ポリシーの学習をすることで、サンプル効率と一般化性能を向上させること。
  • 最小限のファインチューニングで、シミュレーションで訓練されたポリシーを現実世界のロボットハードウェアに効果的に転送できること。
  • 不確実性下でのタスクフェーズ(探索 vs. 挿入)に応じて、力制御を動的に適応させること。

提案手法

  • フレームワークは、軌道実行のための部分的ゴールを生成する高レベルのスキルポリシーを学習するため、階層的ゴール条件付き模倣学習(HGCIL)を用いる。これにより、サンプル効率とロバスト性が向上する。
  • 並列位置/力制御器は、PDとPI制御を組み合わせる:PDはポーズ誤差に基づいて位置軌道を制御し、PIは測定された接触力に基づいて力を調整する。
  • 力制御ポリシーは強化学習(RL)を用いて学習され、ポリシーは名目的な軌道に従いながら所望の力レベルを維持するように訓練される。
  • システムは2段階の訓練プロセスを採用する:まずオフラインでHGCILを用いて軌道ポリシーを学習し、その後、前処理タスクからの転移学習を活用してRLベースの力ポリシーを訓練する。
  • 制御器はタスクフェーズに応じてゲイン $K_p^p$ と $K_p^f$ を動的に調整する — 挿入フェーズでは安定性を高めるために $K_p^p$ を増加させ、力のオーバーシュートを防ぐために $K_p^f$ を低減する。
  • デモンストレーションデータは、キネステティックティーチングまたはシミュレーションを用いて収集され、力ポリシーは類似タスクからの事前訓練済みポリシーを初期値として用いることで収束を加速する。

実験結果

リサーチクエスチョン

  • RQ1階層的模倣学習アプローチは、人間のデモンストレーションから、サンプル効率を向上させつつ、複雑な低クリアランス挿入軌道を効果的に学習できるか?
  • RQ2強化学習ベースの力制御ポリシーは、組立タスクの異なるフェーズ(例えば、探索と挿入)において変動する力要件にどのように適応できるか?
  • RQ3シミュレーションで訓練されたポリシーは、広範な再調整なしに、現実世界のロボットハードウェアにどの程度成功裏に転送可能か?
  • RQ4ハイブリッド軌道・力学習フレームワークは、現実世界の組立において、軌道と力の両方の不確実性をどのように処理するか?
  • RQ5提案されたフレームワークは、標準的な行動コーディングと、リラベル付きゴール条件付き行動コーディングに比べ、タスク成功度とサンプル効率の両面で優れているか?

主な発見

  • HGCIL手法は、シミュレーションにおいて、ヴァナラの行動コーディングやGCBCリラベルベースラインに比べ、より高品質な軌道の模倣と優れたサンプル効率を達成した。
  • シミュレーションで訓練されたポリシー(P-14モデル)は、再訓練なしに実機のUR3eロボットに成功裏に転送され、L挿入タスクを33.3分の訓練時間で完了した。
  • 障害物と摩擦を伴うHDMI挿入タスクにおいて、学習済みポリシーは16.3秒(326ステップ)でタスクを完了したが、初期ポリシーは25秒以内に失敗した。
  • 制御器は実行中に $K_p^p$ と $K_p^f$ を動的に調整した:挿入フェーズでは軌道追随性を高めるために $K_p^p$ を増加させ、力のオーバーシュートを抑えるために $K_p^f$ を低減した。
  • フレームワークは、軌道の不確実性と力の不確実性に対してロバストであり、さまざまな挿入フェーズにおいて安定した接触力を維持した。
  • L挿入タスクからの事前訓練済み力ポリシーを用いた転移学習により、コンデンサーおよびHDMI組立などの後続タスクの訓練時間が顕著に短縮された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。