Skip to main content
QUICK REVIEW

[논문 리뷰] Navigation by Imitation in a Pedestrian-Rich Environment

Jing Bi, Tianyou Xiao|arXiv (Cornell University)|2018. 11. 01.
Robotic Path Planning Algorithms참고 문헌 9인용 수 9
한 줄 요약

이 논문은 로봇이 보행자 밀도가 높은 환경에서 주행하는 동안 전문가의 간섭을 통해 학습함으로써 자율 주행을 가능하게 하는 Learn-from-Intervention DAgger 알고리즘을 제안한다. 오류 복귀 기능과 딥 컨volution 네트워크를 통합함으로써, 명시적인 보행자 모델링 없이도 다양한 실제 환경 상황에서 강건한 일반화를 달성하며, 반복 학습 라운드를 거치면서 성능이 향상된다.

ABSTRACT

Deep neural networks trained on demonstrations of human actions give robot the ability to perform self-driving on the road. However, navigation in a pedestrian-rich environment, such as a campus setup, is still challenging---one needs to take frequent interventions to the robot and take control over the robot from early steps leading to a mistake. An arduous burden is, hence, placed on the learning framework design and data acquisition. In this paper, we propose a new learning-from-intervention Dataset Aggregation (DAgger) algorithm to overcome the limitations brought by applying imitation learning to navigation in the pedestrian-rich environment. Our new learning algorithm implements an error backtrack function that is able to effectively learn from expert interventions. Combining our new learning algorithm with deep convolutional neural networks and a hierarchically-nested policy-selection mechanism, we show that our robot is able to map pixels direct to control commands and navigate successfully in real world without explicitly modeling the pedestrian behaviors or the world model.

연구 동기 및 목표

  • 대학 캠퍼스와 같이 복잡하고 보행자 밀도가 높은 환경에서 로봇의 안전한 주행을 훈련시키는 데 도전하는 데 목적이 있다. 기존의 모방 학습 기법은 분포 이탈 문제로 인해 실패하기 때문이다.
  • 사전에 수집된 광범위한 시연 데이터에 대한 의존도를 줄이기 위해, 운영 중 실시간으로 전문가의 간섭을 통해 상호작용 학습이 가능하도록 하는 데 목적이 있다.
  • 반복적인 데이터 집합을 통해 인간의 수정 사례를 통합함으로써 정책의 일반화 성능을 향상시키는 확장 가능하고 효율적인 모방 학습 프레임워크를 개발하는 데 목적이 있다.
  • 명시적인 세계 모델링 또는 보행자 행동 모델링 없이도 원시 RGB 이미지에서 제어 명령어로의 엔드 투 엔드 주행을 가능하게 하는 데 목적이 있다.
  • 훈련 데이터에 포함되지 않은 다양한 새로운 실제 환경에서 물리적 로봇 플랫폼에서 강건하고 실시간 성능을 입증하는 데 목적이 있다.

제안 방법

  • 로봇이 실수를 할 경우 전문가의 간섭에서 학습할 수 있도록 오류 복귀 기능을 통합한 새로운 Learn-from-Intervention DAgger 알고리즘을 제안한다.
  • 환경적 맥락과 관측된 상태에 따라 제어 정책을 동적으로 선택하는 계층적 정책 선택 메커니즘을 사용한다.
  • 딥 컨volution 네트워크(예: ResNet)를 활용하여 원시 픽셀 입력을 직접 조향 및 속도 제어 명령어로 매핑한다.
  • 최근 상태와 예측된 동작을 저장하는 고정 길이의 데이터 큐를 구현하며, 전문가의 간섭이 발생할 때만 큐가 갱신된다.
  • 10 FPS에서 Jetson TX2에서 실시간 추론을 수행하여 네트워크 출력을 PWM 신호로 변환해 액추에이터 제어에 활용한다.
  • 반복적으로 새로운 간섭 데이터를 집계하며, 정책 성능 향상에 따라 데이터 수집 빈도가 점차 감소한다.

실험 결과

연구 질문

  • RQ1로봇이 사전에 수집된 시연 데이터에만 의존하지 않고 전문가의 간섭에서 학습함으로써 보행자 밀도가 높은 환경에서 주행을 학습할 수 있는가?
  • RQ2기본적인 행동 복제나 전통적인 DAgger와 비교해 Learn-from-Intervention DAgger 알고리즘이 정책의 일반화 성능을 어떻게 향상시키는가?
  • RQ3보행자 동역학을 명시적으로 모델링하지 않은 시각 기반 엔드 투 엔드 정책이 원시 이미지를 제어 명령어로 매핑하는 데 어느 정도의 성능을 발휘할 수 있는가?
  • RQ4전문가의 간섭 빈도는 시간이 지남에 따라 어떻게 변화하며, 이는 정책 향상에 어떤 의미를 갖는가?
  • RQ5훈련 데이터에 포함되지 않은 새로운 환경과 시나리오에 대해 학습된 정책이 일반화될 수 있는가?

주요 결과

  • Learn-from-Intervention DAgger 프로세스의 각 반복 라운드를 거치면서 성공적인 주행 시도 횟수가 증가하여 모든 시나리오에서 정책의 일반화 성능 향상이 확인되었다.
  • 경로 추종 및 보행자 추종 작업의 간섭 없이 경과한 시간(TWI)이 반복 라운드를 거치며 크게 증가하여 더 긴 자율 주행 주기를 경험함을 보여주었다.
  • 훈련 데이터 세트의 크기가 각 시나리오에서 다섯 번째 반복 이후에 수렴하여, 정책 성능 향상에 따라 데이터 수집의 수익 감소 현상이 나타남을 확인했다.
  • Jetson TX2에서 10 FPS로 실시간 추론을 달성하여 실제 환경 조건에서 안정적이고 반응성이 뛰어난 제어를 가능하게 했다.
  • 로봇은 훈련 데이터에 포함되지 않은 네 곳의 새로운 캠퍼스 지역에서 성공적으로 주행하여, 훈련 데이터를 초월한 강력한 일반화 성능을 입증했다.
  • 최소한의 정확한 전문가 수정 사례에서 효과적인 학습이 가능하여 데이터 수집 부담은 줄였지만 높은 성능을 유지할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.