[논문 리뷰] Learning Navigation Behaviors End to End.
이 논문은 보상 함수와 신경망 아키텍처를 동시에 최적화하는 진화적 강화학습 프레임워크인 AutoRL을 사용하여 점대점 및 경로 추종 탐색 정책의 엔드 투 엔드 학습을 제안한다. 얻어진 정책은 새로운 환경과 이동 장애물에 일반화되며, 성공률에서 베이스라인 대비 각각 23%와 26% 높은 성능을 보이며, 치명적인 기억 상실 없이 센서 및 액추에이터 노이즈에 강건하다.
We learn end-to-end point-to-point and path-following navigation behaviors that avoid moving obstacles. These policies receive noisy lidar observations and output robot linear and angular velocities. The policies are trained in small, static environments with AutoRL, an evolutionary automation layer around Reinforcement Learning (RL) that searches for a deep RL reward and neural network architecture with large-scale hyper-parameter optimization. AutoRL first finds a reward that maximizes task completion, and then finds a neural network architecture that maximizes the cumulative of the found reward. Empirical evaluations, both in simulation and on-robot, show that AutoRL policies do not suffer from the catastrophic forgetfulness that plagues many other deep reinforcement learning algorithms, generalize to new environments and moving obstacles, are robust to sensor, actuator, and localization noise, and can serve as robust building blocks for larger navigation tasks. Our path-following and point-to-point policies are respectively 23% and 26% more successful than comparison methods across new environments. Video at: this https URL
연구 동기 및 목표
- 노이즈가 있는 LiDAR 입력을 사용하여 이동 장애물을 신뢰성 있게 피하는 엔드 투 엔드 탐색 정책을 개발하기 위해.
- 다양한 환경에서 안정적인 정책 학습을 가능하게 하여 딥 강화학습에서의 치명적인 기억 상실 문제를 해결하기 위해.
- 정적 훈련 설정을 초월하여 미리 보지 못한 환경과 동적 장애물에 대한 일반화를 향상시키기 위해.
- 실세계 센서 및 액추에이터 노이즈 조건에서 더 큰 로봇 작업을 위한 강건한 탐색 빌딩 블록을 만들기 위해.
제안 방법
- 딥 강화학습에 대한 대규모 하이퍼파rameter 최적화를 수행하는 진화적 자동화 레이어인 AutoRL을 활용한다.
- 먼저 AutoRL을 사용하여 정적 환경에서 작업 완료를 최대화하는 보상 함수를 탐색한다.
- 그 후 AutoRL을 사용하여 발견된 보상 함수 하에서 누적 수익을 최대화하는 신경망 아키텍처를 식별한다.
- 노이즈가 있는 LiDAR 관측치를 입력으로 받아 로봇 제어를 위한 선형 속도와 각속도를 출력하는 정책을 엔드 투 엔드로 훈련한다.
- 모의 환경과 실제 로봇 배포를 통해 정책의 강건성과 일반화 능력을 평가한다.
- 같은 훈련된 정책을 새로운, 보지 못한 환경과 동적 장애물 시나리오에 적용하여 이식 가능성 테스트를 수행한다.
실험 결과
연구 질문
- RQ1AutoRL를 통해 학습된 엔드 투 엔드 탐색 정책은 미세조정 없이 새로운, 보지 못한 환경에 일반화될 수 있는가?
- RQ2AutoRL는 탐색 작업을 위한 딥 강화학습에서 치명적인 기억 상실을 어떻게 완화하는가?
- RQ3학습된 정책이 센서, 액추에이터 및 위치 추정 노이즈 하에서도 얼마나 강건한가?
- RQ4이동 장애물이 있는 동적 환경에서 기존 방법 대비 정책의 성능은 어떠한가?
- RQ5정책은 고수준 탐색 작업 조합의 신뢰할 수 있는 구성 요소로 활용될 수 있는가?
주요 결과
- AutoRL로 훈련된 정책는 경로 추종 작업에서 새로운 환경에서 비교 방법 대비 23% 높은 성공률을 달성했다.
- 점대점 탐색 작업에서 새로운 환경에서의 정책는 베이스라인 대비 26% 높은 성공률을 기록했다.
- 정책는 성능 저하 없이 센서, 액추에이터 및 위치 추정 노이즈에 강건함을 입증했다.
- 정책는 치명적인 기억 상실을 보이지 않아 다양한 훈련 및 평가 환경에서 성능를 유지했다.
- 경쟁 방법 대비 상당히 뛰어난 동적 장애물 및 새로운 환경에 대한 일반화 능력을 보였다.
- 로봇 내부 평가를 통해 정책의 실세계 적용 가능성과 배포 시 안정성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.