Skip to main content
QUICK REVIEW

[논문 리뷰] Motion Planner Augmented Reinforcement Learning for Robot Manipulation in Obstructed Environments

Jun Yamada, Youngwoon Lee|arXiv (Cornell University)|2020. 10. 22.
Reinforcement Learning in Robotics참고 문헌 36인용 수 15
한 줄 요약

이 논문은 동작 크기 기반으로 샘플 기반 운동 계획을 모델-프리 강화학습(Reinforcement Learning, RL) 에이전트의 행동 공간에 동적으로 통합함으로써 성능을 향상시키는 Motion Planner Augmented Reinforcement Learning (MoPA-RL) 프레임워크를 제안한다. 큰 이동 거리에 대해 직접 동작 실행과 운동 계획 간을 부드럽게 전환함으로써 MoPA-RL은 방해 요소가 있는 환경에서 더 빠르고 안전한 탐색과 향상된 샘플 효율성을 가능하게 하여, 복잡한 장애물이 있는 조작 작업에서 기존 표준 RL보다 뚜렷하게 뛰어난 성능을 발휘한다.

ABSTRACT

Deep reinforcement learning (RL) agents are able to learn contact-rich manipulation tasks by maximizing a reward signal, but require large amounts of experience, especially in environments with many obstacles that complicate exploration. In contrast, motion planners use explicit models of the agent and environment to plan collision-free paths to faraway goals, but suffer from inaccurate models in tasks that require contacts with the environment. To combine the benefits of both approaches, we propose motion planner augmented RL (MoPA-RL) which augments the action space of an RL agent with the long-horizon planning capabilities of motion planners. Based on the magnitude of the action, our approach smoothly transitions between directly executing the action and invoking a motion planner. We evaluate our approach on various simulated manipulation tasks and compare it to alternative action spaces in terms of learning efficiency and safety. The experiments demonstrate that MoPA-RL increases learning efficiency, leads to a faster exploration, and results in safer policies that avoid collisions with the environment. Videos and code are available at https://clvrai.com/mopa-rl .

연구 동기 및 목표

  • 로봇 조작을 위한 딥 강화학습에서 장애물이 있는 환경에서의 비효율적 탐색과 충돌 위험 문제를 해결하기 위해.
  • 모델-프리 RL(접촉이 많은 작업에 유리함)의 장점과 장기적인 시점에서 충돌 없이 이동할 수 있는 운동 계획의 장점을 결합하면서도, RL 에이전트의 아키텍처나 학습 알고리즘을 수정하지 않고서도 가능하게 하기 위해.
  • 행동 크기에 따라 자율적으로 운동 계획을 사용할지 여부를 결정할 수 있도록 하여 학습 효율성과 안전성을 향상시키기 위해.
  • 장애물, 좁은 통로, 접촉이 많은 상호작용이 포함된 도전적인 2D 및 3D 조작 작업에서 방법의 성능을 평가하기 위해.

제안 방법

  • 모델-프리 RL 에이전트의 행동 공간을 개선하기 위해 임계값 기반 메커니즘을 도입한다: 행동 크기가 임계값 Δq_step를 초과하면 운동 계획기가 동작하고, 그 이하일 경우 직접 행동을 실행한다.
  • RRT나 PRM 등의 샘플 기반 기법에 기반한 운동 계획기는 큰 관절 공간 이동에 대해 충돌 없는 경로를 계산하여 안전한 장거리 이동을 가능하게 한다.
  • RL 정책은 보상 최적화를 통해 엔드 투 엔드로 훈련되며, 언제 운동 계획기를 사용할지, 언제 기본 행동을 직접 실행할지를 학습한다.
  • 탐색의 균형을 향상시키고 훈련 안정성과 성능을 향상시키기 위해, 행동 공간의 재스케일링 기법을 도입한다.
  • 이 프레임워크는 어떤 모델-프리 RL 알고리즘(예: SAC)과도 호환되며, 아키텍처 변경이나 작업에 특화된 보상 설계가 필요하지 않다.
  • 운동 계획기가 안전한 경로를 생성할 수 있는 능력을 활용함으로써 자연스럽게 충돌을 피할 수 있으며, 좁거나 혼잡한 환경에서도 효과적이다.

실험 결과

연구 질문

  • RQ1딥 강화학습 에이전트의 행동 공간에 운동 계획을 통합함으로써 장애물이 있는 환경에서 샘플 효율성이 향상되는가?
  • RQ2직접 실행과 운동 계획을 조합한 하이브리드 행동 공간은 표준 RL과 비교해 탐색 성능와 정책 안전성에 어떤 영향을 미치는가?
  • RQ3학습 속도와 작업 성공률 측면에서, 직접 행동 실행과 운동 계획 간 전환에 적합한 최적의 임계값은 무엇인가?
  • RQ4행동 공간 재스케일링은 장기적인 시점의 이동을 위해 기본 행동으로 탐색하는 것과 운동 계획을 사용하는 것 사이의 균형에 어떤 영향을 미치는가?
  • RQ5MoPA-RL은 표준 RL이 반복적인 충돌으로 실패하는 혼잡한 환경에서 접촉이 많은 조작 작업(예: 밀기, 삽입)을 성공적으로 학습할 수 있는가?

주요 결과

  • MoPA-RL은 학습 효율성을 크게 향상시켰으며, MoPA-SAC 에이전트는 기존의 SAC 에이전트가 탐색이 열악하여 실패한 100만 개의 학습 스텝 내에 작업 성공을 달성했다.
  • MoPA-SAC 에이전트는 시작 위치 근처에 국한되어 있는 기존 RL 에이전트와 달리, 먼 목표 상태에 도달하기 위해 운동 계획을 활용함으로써 더 넓은 상태 공간을 탐색한다.
  • 접촉력 분석 결과, MoPA-RL 에이전트는 낮은 평균 접촉력을 유지하여 의도치 않은 충돌이 최소화된 안전한 실행을 보였고, 기존 RL 에이전트는 반복적인 충돌로 인해 높은 접촉력을 보였다.
  • 제거 실험 결과, 접촉이 많은 조작을 위한 직접 행동 실행이 필수적임을 확인했으며, 이를 제거하면 미세 운동 제어가 필요한 작업에서 성능이 떨어졌다.
  • 행동 공간 재스케일링은 균형 잡힌 탐색을 장려함으로써 학습 성능을 향상시키며, 다양한 행동 범위 임계값 Δq_MP에 대해 강건한 성능을 보이며, 중간 범위에서 최적의 성능을 발휘했다.
  • MoPA-SAC (Ours) 버전은 충돌이 자주 발생하는 계획 또는 운동 계획 사용 빈도가 낮은 MoPA-SAC (IK) 및 MoPA-SAC (Discrete) 보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.