[논문 리뷰] Deep Reinforcement Learning for Contact-Rich Skills Using Compliant Movement Primitives
이 논문은 유연한 동적 운동 보편성(DMPs)을 사용한 딥 강화학습 프레임워크를 제안하여, 펜-홀 삽입과 같은 접촉이 풍부한 로봇 조립 기술을 불확실성에 대해 매우 높은 내구성으로 학습한다. 작업을 자유 운동 단계와 접촉 중심 단계로 분해하고, 카르테시안 공간에서 제어하며, 힘 적응형 유연성 결합 항을 도입하여, 샘플 효율적이고 일반화 가능하며 시뮬레이션에서 실제 환경으로의 전이가 가능한 정책을 달성하였다. 이는 UR5e 로봇에서 성취되었다.
In recent years, industrial robots have been installed in various industries to handle advanced manufacturing and high precision tasks. However, further integration of industrial robots is hampered by their limited flexibility, adaptability and decision making skills compared to human operators. Assembly tasks are especially challenging for robots since they are contact-rich and sensitive to even small uncertainties. While reinforcement learning (RL) offers a promising framework to learn contact-rich control policies from scratch, its applicability to high-dimensional continuous state-action spaces remains rather limited due to high brittleness and sample complexity. To address those issues, we propose different pruning methods that facilitate convergence and generalization. In particular, we divide the task into free and contact-rich sub-tasks, perform the control in Cartesian rather than joint space, and parameterize the control policy. Those pruning methods are naturally implemented within the framework of dynamic movement primitives (DMP). To handle contact-rich tasks, we extend the DMP framework by introducing a coupling term that acts like the human wrist and provides active compliance under contact with the environment. We demonstrate that the proposed method can learn insertion skills that are invariant to space, size, shape, and closely related scenarios, while handling large uncertainties. Finally we demonstrate that the learned policy can be easily transferred from simulations to real world and achieve similar performance on UR5e robot.
연구 동기 및 목표
- 산업용 로봇이 유연성 부족과 높은 설정 비용으로 인해 접촉이 풍부하고 불확실한 조립 작업을 처리하는 데에 한계가 있음을 해결하기 위해.
- 고차원 연속 제어 공간에서 모델-무료 강화학습의 샘플 비효율성과 취약성을 극복하기 위해.
- 구멍/페그의 크기, 모양, 공간적 위치의 변형에 대해 일반화하면서도, 정렬 및 잡기 오류에 대해 내구성을 유지하기 위해.
- 시뮬레이션에서 실제 로봇 하드웨어(UR5e)로 효과적으로 전이되는 정책을 개발하여 시뮬레이션-실세계 갭을 메우기 위해.
- 인간의 손목 행동을 모방하는 활성 유연성 제공을 위해 DMP 프레임워크에 유연성 결합 항을 추가하기 위해.
제안 방법
- 이 방법은 펜-홀 작업을 자유 운동 단계와 접촉 중심 삽입 단계로 명확히 분리하고, 각 단계에 별도의 DMP를 적용한다.
- 제어는 관절 공간이 아닌 카르테시안 종단기구 공간에서 수행되어, 힘-토크 관계를 단순화하고 작업 수준의 해석 가능성을 향상시킨다.
- DMP 프레임워크에 새로운 결합 항을 도입하여, 상호작용 힘에 기반해 궤적 실행을 적응적으로 조정함으로써 활성 유연성을 제공한다.
- 성공적인 삽입을 장려하고 충돌을 최소화하기 위해 보상 형태 조정을 사용하여 Proximal Policy Optimization(PPO) 알고리즘을 사용해 정책을 훈련한다. PPO는 안정적인 온-폴리시 RL 알고리즘이다.
- 힘을 제어 신호로 매핑하는 대신, 직접 유연성 매개변수를 학습함으로써 검색 공간을 단순화하여 차원을 감소시키고 샘플 효율성을 향상시킨다.
- 이 방법은 예측되지 않은 펜의 형태와 구멍의 위치에 대해 일반화 가능한 종단기계적 정책을 엔드 투 엔드로 학습할 수 있게 하며, 선형 오차 8 mm 이내 및 각도 오차 12° 이내에서도 내구성을 유지한다.
실험 결과
연구 질문
- RQ1고차원 연속 상태-행동 공간을 가진 접촉이 풍부한 로봇 작업에 대해 딥 강화학습 정책을 샘플 효율적으로 훈련시킬 수 있는가?
- RQ2작업 분해와 카르테시안 공간 제어는 접촉이 풍부한 조작에서 샘플 효율성과 일반화를 어떻게 향상시킬 수 있는가?
- RQ3학습된 유연성 메커니즘이 큰 정렬 및 잡기 불확실성 하에서도 안정적인 성능을 달성할 수 있는가?
- RQ4시뮬레이션에서 훈련된 정책이 실제 로봇 하드웨어로 얼마나 효과적으로 전이될 수 있는가?
- RQ5이 방법은 펜과 구멍의 크기, 모양, 공간적 위치의 변형에 대해 일반화할 수 있는가?
주요 결과
- 정상 조건(오차 0)에서 정책은 99.5%의 성공률을 기록했으며, 선형 오차 8 mm 이내 및 각도 오차 12° 이내로 증가할 경우 성공률은 77.5%로 감소했다.
- 시각적 정렬 오차가 8 mm 이내 및 8° 이내일 경우, 정상 정책과 조합하여 원통형 및 정육면체형 펜 모두에서 성공률이 92%로 떨어졌다.
- 이 방법은 성공적인 시뮬레이션-실세계 전이를 보였으며, 다양한 펜과 구멍 구성에서 실제 UR5e 로봇에서 높은 성공률을 달성했다.
- 기존에 보지 못한 단면 형태인 삼각형 및 정육면체형 펜에 대해서도 일반화되었으며, 각각 9/10 및 8/10의 성공률을 기록했다. 이는 큰 오차 조건에서도 성공했다.
- 카르테시안 공간 DMP와 학습된 유연성의 조합은 취약성을 줄이고 수렴을 향상시켜, 고차원 행동 공간에서도 PPO를 효과적으로 사용할 수 있게 했다.
- 특히 재훈련 없이도 큰 불확실성을 다루는 데서, 이전의 접근 방식에 비해 공간, 크기, 형태, 관련 시나리오 전반에 걸쳐 일반화 성능에서 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.