[論文レビュー] Deep Reinforcement Learning for Contact-Rich Skills Using Compliant Movement Primitives
本稿では、接触が豊富なロボット組立スキル(例:ピンを穴に挿入)を、不確実性に対して高いロバスト性を示すように学習するため、柔軟性のある動的移動素子(DMP)を用いた深層強化学習フレームワークを提案する。タスクを自由移動フェーズと接触フェーズに分解し、カタログ空間で制御を実行し、力に適応する剛性結合項を導入することで、サンプル効率が良く、一般化可能で、シミュレーションから実世界への転送が可能なポリシーを、UR5e ロボットで実現した。
In recent years, industrial robots have been installed in various industries to handle advanced manufacturing and high precision tasks. However, further integration of industrial robots is hampered by their limited flexibility, adaptability and decision making skills compared to human operators. Assembly tasks are especially challenging for robots since they are contact-rich and sensitive to even small uncertainties. While reinforcement learning (RL) offers a promising framework to learn contact-rich control policies from scratch, its applicability to high-dimensional continuous state-action spaces remains rather limited due to high brittleness and sample complexity. To address those issues, we propose different pruning methods that facilitate convergence and generalization. In particular, we divide the task into free and contact-rich sub-tasks, perform the control in Cartesian rather than joint space, and parameterize the control policy. Those pruning methods are naturally implemented within the framework of dynamic movement primitives (DMP). To handle contact-rich tasks, we extend the DMP framework by introducing a coupling term that acts like the human wrist and provides active compliance under contact with the environment. We demonstrate that the proposed method can learn insertion skills that are invariant to space, size, shape, and closely related scenarios, while handling large uncertainties. Finally we demonstrate that the learned policy can be easily transferred from simulations to real world and achieve similar performance on UR5e robot.
研究の動機と目的
- 工業用ロボットが、柔軟性に欠け、設定コストが高いため、接触が豊富で不確実性のある組立作業を処理する能力に限界があることに対処する。
- 高次元連続制御空間におけるモデルフリー強化学習のサンプル非効率性と脆さを克服する。
- 穴やピンのサイズ、形状、空間的位置の変動に対しても一般化可能でありながら、局在化および把持誤差に対してロバストであるようにすること。
- シミュレーションから実世界のロボットハードウェア(UR5e)へのポリシーの効果的転送を実現するため、シミュレーションから実世界へのギャップを埋めること。
- 人間の手首の挙動を模倣するための剛性結合項を DMP フレームワークに拡張すること。
提案手法
- 本手法は、ピンを穴に挿入タスクを、明確に分離された自由移動フェーズと接触が豊富な挿入フェーズに分け、それぞれが別個の DMP に従う。
- 制御は関節空間ではなく、エンドエフェクタのカタログ空間で実行することで、力・トルクの関係を単純化し、タスクレベルの解釈可能性を向上させる。
- DMP フレームワークに、相互作用力に基づいて軌道実行を適応的に変更することで、能動的剛性を提供する新しい結合項を導入する。
- 報酬形状を用いて成功した挿入を促進し、衝突を最小限に抑えるようにすることで、安定なオンポリシー強化学習アルゴリズムである PPO を用いてポリシーを訓練する。
- 力から制御信号へのマッピングではなく、剛性パラメータを直接学習することで、探索空間を圧縮し、次元削減とサンプル効率の向上を実現する。
- 本手法により、未観測のピン形状や穴の位置に対しても一般化可能なエンドツーエンドの挿入ポリシーが学習可能となり、最大 8 mm の線形誤差および 12° の角誤差に対してもロバストである。
実験結果
リサーチクエスチョン
- RQ1高次元連続状態・行動空間を持つ接触が豊富なロボットタスクに対して、深層強化学習ポリシーを効率的に訓練できるか?
- RQ2タスクの分解とカタログ空間制御は、接触が豊富な操作において、サンプル効率と一般化性をどのように向上させるか?
- RQ3学習された剛性メカニズムは、大きな局在化および把持誤差下でもロバストな性能を実現できるか?
- RQ4シミュレーションで訓練されたポリシーが、実世界のロボットハードウェアにどれほど効果的に転送できるか?
- RQ5本手法は、ピンと穴のサイズ、形状、空間的位置の変動に対しても一般化可能か?
主な発見
- 標準条件(誤差ゼロ)下では 99.5% の成功率を達成したが、最大 8 mm の線形誤差および 12° の角誤差を加えると 77.5% に低下した。
- 視覚的局在化誤差が 8 mm 以下および 8° 以下の場合、標準ポリシーと組み合わせて、円柱形および直方体形のピンに対してそれぞれ 92% の成功率を示した。
- 本手法は、実世界の UR5e ロボットで多様なピンおよび穴の構成に対して高い成功率を達成するなど、成功裏にシミュレーションから実世界への転送を実現した。
- 以前に観測されていなかった断面形状(例:三角形、立方体)のピンに対しても一般化可能であり、それぞれ 9/10 および 8/10 の成功率を示したが、大きな誤差下でも有効であった。
- カタログ空間における DMP と学習された剛性の組み合わせにより、脆さが軽減され、収束性が向上し、高次元行動空間であっても PPO を用いた有効な訓練が可能になった。
- 特に再トレーニングなしで大きな不確実性を扱える点を除き、本手法は、空間的、サイズ的、形状的、関連する状況において、先行手法を上回る一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。