Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reactive Planning in Dynamic Environments

Kei Ota, Devesh K. Jha|arXiv (Cornell University)|2020. 10. 31.
Reinforcement Learning in Robotics참고 문헌 32인용 수 5
한 줄 요약

이 논문은 깊이 카메라만을 사용하여 동적 환경에서 반응형 계획을 수행할 수 있도록 하는 엔드 투 엔드 딥 강화학습 프레임워크를 제안한다. 운동학적 계획, 웨이포인트 생성을 위한 지도학습, 경로 조건이 붙은 강화학습을 통한 궤적 추종을 조합함으로써, 시뮬레이션과 실제 6-도르의 조작자 작업 모두에서 높은 샘플 효율성과 새로운 환경으로의 일반화 성능을 달성하였으며, 랜덤 장애물 상황에서 90%의 성공률, 이동하는 목표물 상황에서 100%의 성공률을 기록하였다.

ABSTRACT

The main novelty of the proposed approach is that it allows a robot to learn an end-to-end policy which can adapt to changes in the environment during execution. While goal conditioning of policies has been studied in the RL literature, such approaches are not easily extended to cases where the robot's goal can change during execution. This is something that humans are naturally able to do. However, it is difficult for robots to learn such reflexes (i.e., to naturally respond to dynamic environments), especially when the goal location is not explicitly provided to the robot, and instead needs to be perceived through a vision sensor. In the current work, we present a method that can achieve such behavior by combining traditional kinematic planning, deep learning, and deep reinforcement learning in a synergistic fashion to generalize to arbitrary environments. We demonstrate the proposed approach for several reaching and pick-and-place tasks in simulation, as well as on a real system of a 6-DoF industrial manipulator. A video describing our work could be found \url{https://youtu.be/hE-Ew59GRPQ}.

연구 동기 및 목표

  • 실행 도중 변화하는 목표에 대해 반응적으로 적응할 수 있도록 로봇의 능력을 향상시키기 위해, 인간이 지닌 능력이지만 로봇 시스템에선 구현하기 어려운 기능을 실현한다.
  • 목표가 명시적으로 제공되지 않고 시각을 통해 인식되어야 하는 상황에서, 작업 실행 중 목표 변경 문제를 해결한다.
  • 저비용 깊이 센서를 사용하여 실시간으로 작동하는 샘플 효율적이고 일반화 가능한 정책을 개발한다.
  • 실제 세계 데이터 수집을 최소화하기 위해 실세계2시뮬레이션 전이 함수를 사용해 완전히 시뮬레이션 환경에서 훈련함으로써 시뮬레이션에서 실제 세계로의 격차를 해소한다.
  • 궤적 계획과 궤적 추종을 분리함으로써 모듈러하고 확장 가능한 학습을 가능하게 한다.

제안 방법

  • 오프라인 RRT* 계획기를 통해 생성된 궤적을 사용하여, 깊이 이미지에서 웨이포인트 시퀀스를 예측하는 딥 컨volution 신경망(CNN)을 지도학습 방식으로 훈련한다.
  • 주어진 웨이포인트 시퀀스를 따라가도록 학습하는 경로 조건이 붙은 딥 강화학습(RL) 정책이 제안되며, 이는 효율적이고 안정적인 궤적 추적을 가능하게 한다.
  • 실세계 이미지를 시뮬레이션 이미지로 매핑하는 실세계2시뮬레이션 전이 함수를 사용하여 시뮬레이션 환경에서 RL 정책을 훈련함으로써 효율적이고 현실적인 훈련이 가능해진다.
  • 시스템은 이중 단계 아키텍처를 사용한다: (1) 지도학습을 통한 시각 기반 웨이포인트 예측, (2) RL을 통한 반응형 궤적 추종이며, 실행 중 목표 상태가 동적으로 업데이트된다.
  • RL 훈련 중 커리큘럼 학습을 활용하여 수렴성과 안정성을 향상시킨다.
  • 전체 정책는 시뮬레이션 환경에서 훈련되고, 실세계 6-도르 산업 조작자에 그대로 배포되며, 보정 조정 없이도 작동한다.

실험 결과

연구 질문

  • RQ1로봇이 목표 사양이 명시되지 않은 상태에서 동적으로 변화하는 목표에 대해 반응형 정책을 엔드 투 엔드로 학습할 수 있는가?
  • RQ2목표 사양이 명시되지 않은 상태에서, 재학습 없이도 새로운 환경과 장애물 구성으로 일반화할 수 있는 시각 기반 로봇은 어떻게 설계할 수 있는가?
  • RQ3경로 조건이 붙은 강화학습은 복잡한 로봇 조작 작업에서 샘플 효율성과 최종 성능을 향상시킬 수 있는가?
  • RQ4실세계2시뮬레이션 전이 함수는 얼마나 효과적으로 최소한의 실제 세계 데이터로 시뮬레이션에서 실제 세계로의 정책 전이를 가능하게 하는가?
  • RQ5궤적 계획과 궤적 추종을 분리함으로써, 동적 환경에서 학습의 안정성과 일반화 능력이 향상되는가?

주요 결과

  • 제안된 방법은 무작위 장애물 상황에서 실제 세계 일반화 작업에서 90%의 성공률을 달성하였으며, 베이스라인(0% 성공)에 비해 뚜렷한 우월성을 보였다.
  • 실제 시스템에서 이동 목표 작업에서 100%의 성공률을 기록하여, 목표가 동적으로 변화하는 상황에서도 견고한 반응형 계획 능력을 입증하였다.
  • 경로 조건이 붙은 RL 에이전트는 웨이포인트를 사용하지 않은 베이스라인 RL 에이전트보다 더 빠른 수렴과 더 나은 최종 성능을 달성하여 샘플 효율성이 향상되었다.
  • RL 기반 저수준 제어기로 PID 기반 베이스라인 대비 평균 각加속도를 최대 80% 감소시켜 더 부드럽고 안정적인 동작을 구현하였다.
  • PID 기반 베이스라인 대비 목표에 도달하는 데 걸리는 시간을 6개 시나리오에서 평균 50% 이상 단축시켰으며, 실행 시간은 0.89–1.26초에서 0.48–0.57초로 감소하였다.
  • 시뮬레이션과 실제 세계 배포 모두에서 예측 불가능한 환경으로의 일반화가 효과적으로 이루어졌으며, 시뮬레이션에서 실제 세계로의 전이 후 보정 조정 없이도 작동하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.