Skip to main content
QUICK REVIEW

[論文レビュー] A Learning Framework for High Precision Industrial Assembly

Yongxiang Fan, Jieliang Luo|arXiv (Cornell University)|Sep 23, 2018
Reinforcement Learning in Robotics参考文献 13被引用数 4
ひとこと要約

本論文では、モデルベースの軌道最適化とアクター・クリティック強化学習を組み合わせたハイブリッド学習フレームワークを提案する。このフレームワークにより、高精度な産業用組立作業が可能になる。最適軌道をセミスーパvisorとして用い、クリティックネットワークでポリシー学習を安定化させることで、純粋な強化学習に比べて収束が速く、より高い安定性を達成し、データ要求を低減するとともに、高剛性システムにおける力/トルクフィードバック環境でも安定性が向上する。

ABSTRACT

Automatic assembly has broad applications in industries. Traditional assembly tasks utilize predefined trajectories or tuned force control parameters, which make the automatic assembly time-consuming, difficult to generalize, and not robust to uncertainties. In this paper, we propose a learning framework for high precision industrial assembly. The framework combines both the supervised learning and the reinforcement learning. The supervised learning utilizes trajectory optimization to provide the initial guidance to the policy, while the reinforcement learning utilizes actor-critic algorithm to establish the evaluation system even the supervisor is not accurate. The proposed learning framework is more efficient compared with the reinforcement learning and achieves better stability performance than the supervised learning. The effectiveness of the method is verified by both the simulation and experiment.

研究の動機と目的

  • 手動による軌道チューニングに依存する伝統的な組立手法の限界を解消し、環境の不確実性に敏感である問題を解決すること。
  • 力/トルクフィードバックと剛体ロボットダイナミクスを伴う高精度組立タスクにおけるデータ効率性と学習安定性を向上させること。
  • モデルベース最適化とモデルフリー強化学習の長所を組み合わせた、より優れた性能と信頼性を実現する学習フレームワークを開発すること。
  • ピッグインホールおよび類似タスクにおける穴の位置、形状、クリアランスの変動に対しても、ロバストな一般化を可能にすること。

提案手法

  • 最適軌道最適化を用い、位置および力/トルクフィードバックをセミスーパvisorとして、初期の最適軌道を生成する。
  • アクター・クリティックネットワークを、最適軌道からの教師あり学習と、クリティックネットワークからのポリシー勾配更新の両方を用いて訓練する。
  • クリティックネットワークは、スーパvisorの出力とリアルタイムのポリシー探索に基づいてQ値を学習し、ポリシー品質の安定した真の基準評価を提供する。
  • アクターネットワークは、教師ありガイドラインとポリシー勾配信号の両方を組み合わせて更新され、収束性と安定性が向上する。
  • ハイブリッドトレーニング戦略により、ランダムな探索に依存するのを減らし、探索空間を狭め、データ効率性を向上させる。
  • 低レベルのトラッキングコントローラーを統合し、ポリシーから導出された速度指令を実行することで、エンドエフェクタの正確な運動を保証する。

実験結果

リサーチクエスチョン

  • RQ1モデルベース最適化とアクター・クリティック強化学習を組み合わせたハイブリッド学習フレームワークは、高精度組立におけるデータ効率性と安定性を向上させることができるか?
  • RQ2クリティックネットワークの統合は、剛体ロボットダイナミクスと力/トルクフィードバックによる軌道最適化の不安定要因をどのように緩和するか?
  • RQ3学習されたポリシーは、穴の位置、形状、クリアランスの変動に対してどの程度一般化できるか?
  • RQ4シミュレーションおよび実世界の実験において、純粋なDDPG、TD3、SACと比較して、本フレームワークのサンプル効率性と収束速度はどのように異なるか?

主な発見

  • ガイドド-DDPGフレームワークは、800回のロールアウトでレゴブロック挿入タスクに成功したが、純粋なDDPGは5,000回のロールアウトを要し、性能が一貫して得られなかった。
  • 提案手法により、トレーニング時間は83分(DDPG)から37.3分に短縮され、ロールアウト回数も7,000回から1,500回に削減され、データおよび時間効率に顕著な改善が見られた。
  • ポリシーは、穴の位置に0.5 mmの不確実性、最大5 mmのオフセット、4×2ブロックや穴が不完全なシリンダーなど、さまざまな形状に対しても正常にブロック挿入を実行した。
  • クリアランスの変動に対してもポリシーが一般化でき、0.1 mm、1 μm、0 μmのクリアランスを持つ穴に対しても正常に挿入を実行した。幾何的不確実性に対してもロバストであることが示された。
  • 実験では、ガイドド-DDPGは1.5時間で3 mmの探索半径内でポリシーを発見したが、純粋なDDPGは1 mmの探索半径内でポリシーを発見するのにも2時間かかった。これは、より広範かつ効率的な探索を可能にしたことを示している。
  • クリティックネットワークは、軌道最適化器の不正確さを是正することで、トレーニングを効果的に安定化させ、ポリシーの崩壊を防ぎ、信頼性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。