Skip to main content
QUICK REVIEW

[논문 리뷰] Virtual-to-real Deep Reinforcement Learning: Continuous Control of Mobile Robots for Mapless Navigation

Lei Tai, Giuseppe Paolo|arXiv (Cornell University)|2017. 03. 01.
Robotic Path Planning Algorithms참고 문헌 23인용 수 99
한 줄 요약

본 논문은 10-dimensional sparse laser range findings와 목표 상대 위치만을 이용하여 asynchronous deep reinforcement learning으로 엔드-투-엔드 학습된 맵 없는 모션 플래너를 제시하고, 미세 조정 없이 가상 환경에서 실 로봇으로의 전이가 가능함을 시연한다.

ABSTRACT

We present a learning-based mapless motion planner by taking the sparse 10-dimensional range findings and the target position with respect to the mobile robot coordinate frame as input and the continuous steering commands as output. Traditional motion planners for mobile ground robots with a laser range sensor mostly depend on the obstacle map of the navigation environment where both the highly precise laser sensor and the obstacle map building work of the environment are indispensable. We show that, through an asynchronous deep reinforcement learning method, a mapless motion planner can be trained end-to-end without any manually designed features and prior demonstrations. The trained planner can be directly applied in unseen virtual and real environments. The experiments show that the proposed mapless motion planner can navigate the nonholonomic mobile robot to the desired targets without colliding with any obstacles.

연구 동기 및 목표

  • Sparse range 데이터와 상대 타깃 위치를 입력으로 사용하는 비지도 맵 없는 비전동 로봇용 모션 플래너를 개발한다.
  • 플래너를 비동기 심층 강화 학습으로 엔드-투-엔드 학습하여 연속 조향 명령을 출력하도록 한다.
  • 미세 조정 없이 가상 시뮬레이션에서 실제 로봇으로의 학습 정책 전이 가능성을 시연한다.
  • 가상 및 실제 조건에서 전통적인 맵 기반 플래너와의 강건성 비교를 평가한다.

제안 방법

  • 상태 x_t를 10-dim 희박 레이저 발견, 이전 속도, 상대 타깃 위치로 구성된 연속 제어 DRL 문제로 형식화한다.
  • 샘플 수집 스레드를 병렬로 실행하여 actor와 critic 네트워크를 학습하는 ADDPG(Asynchronous DDPG)를 사용한다.
  • 네트워크 출력은 각 축의 제약을 갖는 연속 선형 속도와 각속도로, 각속도는 (-1,1), 선형은 (0,1)로 tanh와 sigmoid 활성화로 제한된다.
  • 가상 환경(V-REP)에서 두 가지 실내 레이아웃으로 학습하고 타깃을 무작위화하며 도달, 충돌, 목표로의 진행을 결합한 보상을 최적화한다.
  • 보상: r = r_arrive if close to target, r_collision if collision, else c_r(d_{t-1}-d_t) where d_t is distance to target.
  • 관측 입력은 10-dim 레이저 발견, 2-d 이전 속도, 2-d 상대 타깃을 합쳐 14-dim 벡터로 병합된다.
  • 정책을 위한 512 노드의 3층 완전 연결 크리틱 및 액터 네트워크를 사용한다.
  • Adam 옵티마이저를 사용하고 출력은 로봇의 현실적 한계(예: max linear 0.5 m/s, max angular 1 rad/s)로 제한한다.

실험 결과

연구 질문

  • RQ1맵 없는 플래너가 희소 범위 데이터와 타깃 위치만으로 비대칭 구동 로봇을 navigational 할 수 있는가?
  • RQ2비동기 DRL 접근법이 이 설정에서 연속 제어를 위한 학습을 효율적으로 가능하게 하는가?
  • RQ3학습된 정책이 미세 조정 없이 가상 시뮬레이션에서 실제 로봇으로 전이될 수 있는가?
  • RQ4맵 없는 플래너가 보이지 않는 환경에서의 강건성과 속도 측면에서 전통적인 맵 기반 플래너와 비교해 어떤 차이가 있는가?

주요 결과

  • 가상에서 10-dim sparse laser readings를 사용하여 학습된 맵 없는 플래너가 unseen 가상 환경에서 충돌 없이 목표로 내비게이션을 달성한다.
  • ADDPG 방법은 샘플 처리량을 증가시키고 Q-값 수렴을 향상시키며 표준 DDPG에 비해 학습 속도를 가속한다.
  • 실제 환경 테스트에서 Env-2로 학습된 모델은 10-dim Move Base가 실패하거나 인간의 개입이 필요했던 내비게이션 작업을 완료하여 미세 조정 없이도 전이가 가능함을 보였다.
  • 맵 없는 플래너는 맵 기반 기준선 대비 약 1 ms 정도의 의사결정 속도로 실행되며 훨씬 빠르다.
  • 학습된 정책은 복잡한 실내 환경에서의 강건성을 보이며 희박한 관측의 저비용 센서로 확대 적용이 가능하다.
  • 필요 시 자연스럽게 재가용(회전 재수행)이 발생하며 실험 중 충돌이 관찰되지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.