Skip to main content
QUICK REVIEW

[논문 리뷰] Navigation In Urban Environments Amongst Pedestrians Using Multi-Objective Deep Reinforcement Learning

Niranjan Deshpande, Dominique Vaufreydaz|arXiv (Cornell University)|2021. 10. 11.
Autonomous Vehicle Technology and Safety참고 문헌 20인용 수 10
한 줄 요약

이 논문은 보행자가 있는 도시 환경에서 자율 주행을 향상시키기 위해 임계값이 적용된 렉시코그래픽 Q-학습을 사용하는 다목적 강화학습 접근법을 제안한다. 안전성과 속도 목표를 별도로 고려하는 에이전트를 훈련하고 그 정책을 통합함으로써, 알려진 환경과 알려지지 않은 환경에서 모두 100% 충돌 방지 성능과 감소된 브레이킹을 달성하며, 모든 지표에서 단일 목표 DQN 기준선보다 뛰어난 성능을 보였다.

ABSTRACT

Urban autonomous driving in the presence of pedestrians as vulnerable road users is still a challenging and less examined research problem. This work formulates navigation in urban environments as a multi objective reinforcement learning problem. A deep learning variant of thresholded lexicographic Q-learning is presented for autonomous navigation amongst pedestrians. The multi objective DQN agent is trained on a custom urban environment developed in CARLA simulator. The proposed method is evaluated by comparing it with a single objective DQN variant on known and unknown environments. Evaluation results show that the proposed method outperforms the single objective DQN variant with respect to all aspects.

연구 동기 및 목표

  • 복잡한 도시 환경에서 보행자가 존재할 때 안전성과 속도라는 상충되는 목표를 동시에 고려한 자율 주행 문제를 해결하기 위해.
  • 충돌 회피와 속도라는 상충되는 목표를 잘 균형 잡지 못하는 스칼라 보상 구조를 사용하는 단일 목표 강화학습의 한계를 극복하기 위해.
  • 안전성과 속도를 위한 별도의 정책을 학습하고, 이를 통합된 의사결정 정책으로 조합하는 다목적 딥 강화학습 프레임워크를 개발하기 위해.
  • 모델의 탄력성과 일반화 능력을 평가하기 위해 알려진 환경과 알려지지 않은 도시 환경 모두에서 성능을 평가하기 위해.
  • 다목적 학습이 단일 목표 접근법보다 더 안전하고 부드럽고 효율적인 주행을 가능하게 함을 입증하기 위해.

제안 방법

  • 안전성과 속도 목표를 위한 별도의 보상 벡터를 가진 다목적 마르코프 결정 과정(MOMDP)을 사용한다.
  • 임계값이 적용된 렉시코그래픽 Q-학습 변형을 사용하며, 안전성이 속도보다 우선시되어 충돌 방지를 항상 확보한 후에야 속도 최적화가 이루어지도록 한다.
  • 두 개의 에이전트를 훈련한다: 하나는 상태 처리를 위한 CNN을, 다른 하나는 시간적 의존성과 보행자 의도를 모델링하기 위한 LSTM을 사용한다.
  • 각 목표를 위한 별도의 Q-함수를 사용하며, 고차원 상태 공간에서의 확장성을 확보하기 위해 Q-값은 딥 신경망을 통해 근사한다.
  • 최종 정책는 두 에이전트의 출력을 통합하여 유도되며, 먼저 안전성이 보장된 후에 속도 최적화가 이루어지도록 한다.
  • 훈련은 실제 보행자 행동과 교통 규칙을 구현한 CARLA 시뮬레이터 내에서 구축된 커스터마이징된 도시 환경에서 수행된다.

실험 결과

연구 질문

  • RQ1다목적 딥 강화학습 접근법이 도시 환경에서 보행자와 함께 주행할 때 단일 목표 DQN보다 성능이 뛰어나게 되는가?
  • RQ2스칼라 보상 기반 방법과 비교했을 때, 임계값이 적용된 렉시코그래픽 Q-학습은 안전성과 주행의 부드러움을 얼마나 향상시키는가?
  • RQ3LSTM 기반 에이전트의 통합은 속도, 정지 행동, 보행자와의 거리 유지 측면에서 성능을 얼마나 향상시키는가?
  • RQ4제안된 방법은 CARLA의 Town01과 Town04와 같은 알려지지 않은 도시 환경으로 일반화되는가?
  • RQ5다목적 프레임워크는 충돌 방지를 유지하면서도 불필요한 브레이킹을 줄이는가?

주요 결과

  • 다목적 DQN 에이전트는 알려진 환경과 알려지지 않은 환경 모두에서 100% 충돌 방지 에피소드를 달성했으며, 단일 목표 DQN의 알려진 환경 97%, 알려지지 않은 환경 95% 및 97% 성능을 뛰어넘었다.
  • 알려지지 않은 환경에서 다목적 에이전트는 평균 정차 횟수를 단일 목표 에이전트의 11.51회에서 5.99회로 감소시켜 더 자연스럽고 부드러운 주행 행동을 보였다.
  • 알려지지 않은 환경에서 다목적 에이전트는 98%의 성공률을 기록했으며, 단일 목표 에이전트의 95%보다 높아 일반화 능력이 뛰어나다는 것을 입증했다.
  • 알려지지 않은 환경에서 다목적 에이전트는 가장 가까운 보행자와의 평균 거리를 0.75m(2m 이내) 유지했으며, 이는 단일 목표 에이전트의 0.41m보다 유의미하게 높아 안전 마진이 향상되었음을 나타낸다.
  • 알려지지 않은 환경에서 다목적 에이전트는 평균 속도 5.98 m/s를 기록했으며, 단일 목표 에이전트의 3.43 m/s를 뛰어넘어 안전성과 속도를 효과적으로 균형 잡을 수 있음을 보여주었다.
  • LSTM 기반 에이전트 변형은 모든 지표에서 CNN 전용 변형보다 뛰어나며, 특히 정차 횟수 감소와 횡단 시간 향상 측면에서 뛰어난 성능을 보여, 의도 예측을 위한 기억 기능의 유용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.