Skip to main content
QUICK REVIEW

[논문 리뷰] Quadratic Q-network for Learning Continuous Control for Autonomous Vehicles

Pin Wang, Hanhan Li|arXiv (Cornell University)|2019. 11. 29.
Reinforcement Learning in Robotics참고 문헌 17인용 수 9
한 줄 요약

이 논문은 자율 주행 차량의 동적 주행 환경에서 부드럽고 연속적인 제어를 가능하게 하기 위해 Q-학습과 PID 제어 지식을 융합한 이차 Q-네트워크를 제안한다. 동작에 대한 Q-함수를 이차형태로 모델링하고 도메인 특화 동작 네트워크를 통합함으로써, 정책 기반 강화학습이나 이산 동작 분할을 사용하지 않고도 차선 변경 및 램프 통합 작업에서 안정적이고 고보상의 주행 정책을 달성한다.

ABSTRACT

Reinforcement Learning algorithms have recently been proposed to learn time-sequential control policies in the field of autonomous driving. Direct applications of Reinforcement Learning algorithms with discrete action space will yield unsatisfactory results at the operational level of driving where continuous control actions are actually required. In addition, the design of neural networks often fails to incorporate the domain knowledge of the targeting problem such as the classical control theories in our case. In this paper, we propose a hybrid model by combining Q-learning and classic PID (Proportion Integration Differentiation) controller for handling continuous vehicle control problems under dynamic driving environment. Particularly, instead of using a big neural network as Q-function approximation, we design a Quadratic Q-function over actions with multiple simple neural networks for finding optimal values within a continuous space. We also build an action network based on the domain knowledge of the control mechanism of a PID controller to guide the agent to explore optimal actions more efficiently.We test our proposed approach in simulation under two common but challenging driving situations, the lane change scenario and ramp merge scenario. Results show that the autonomous vehicle agent can successfully learn a smooth and efficient driving behavior in both situations.

연구 동기 및 목표

  • 표준 강화학습에서 이산 동작 공간이 연속 제어 성능을 저하시키는 문제를 해결한다.
  • 이산 동작 공간에서의 딥 Q-네트워크의 한계를 극복하기 위해 닫힌 형태의 최적 동작 해법을 설계한다.
  • 고전 제어 이론(PID)의 도메인 지식을 신경망 아키텍처에 통합하여 샘플 효율성과 정책의 부드러움을 향상시킨다.
  • 연속 동작을 사용하는 모델-프리 강화학습 프레임워크를 통해 복잡한 주행 행동—차선 변경 및 램프 통합—의 효과적인 학습을 보여준다.
  • 별도의 정책 네트워크를 피하고 학습의 불안정성을 줄임으로써 정책 기반 강화학습 방법에 대한 확장 가능한 대안을 제공한다.

제안 방법

  • 동작에 대한 Q-값을 동작의 이차 함수로 매개변수화하는 이차 Q-함수를 제안하여 최적 동작의 해석적 계산을 가능하게 한다.
  • 비선형 상태 특징을 추출하기 위해 신경망을 사용하며, 이를 이차 Q-함수의 입력으로 활용한다.
  • PID 제어 원리를 기반으로 한 동작 네트워크를 설계하여 탐색을 이끌고 부드럽고 물리적으로 타당한 동작을 생성한다.
  • 경험 재생 및 타겟 네트워크를 사용하여 Adam 옵timizer와 할인 인자 0.95를 사용해 네트워크를 훈련시킨다.
  • 메모리 크기 2000, 배치 크기 64로 경험 재생을 적용하고, 1000단계마다 타겟 네트워크를 업데이트한다.
  • 학습 안정성과 수렴성을 향상시키기 위해 우선순위 경험 재생을 사용한 더블 DQN 접근법을 적용한다.

실험 결과

연구 질문

  • RQ1이차 Q-함수 근사가 자율 주행 환경에서 연속 제어 정책의 효율적이고 안정적인 학습을 가능하게 할 수 있는가?
  • RQ2PID 제어에서 유래한 도메인 지식을 통합함으로써 강화학습 기반 주행 에이전트의 샘플 효율성과 정책의 부드러움은 어떻게 향상되는가?
  • RQ3제안된 방법이 시뮬레이션 환경에서 복잡한 주행 행동—차선 변경 및 램프 통합—을 성공적으로 학습할 수 있는가?
  • RQ4이중 Q-네트워크가 이산 동작 분할을 사용하는 표준 DQN보다 주행의 부드러움과 보상 축적 측면에서 성능이 뛰어나게 되는가?
  • RQ5제어 이론에 기반한 동작 네트워크가 연속 제어 과제에서 탐색 시간을 얼마나 줄이고 수렴성을 향상시키는가?

주요 결과

  • 훈련 손실이 시간이 지남에 따라 수렴했고, 누적 총 보상이 안정적으로 증가하여 주행 행동의 효과적인 학습을 확인했다.
  • 테스트 결과는 체크포인트당 100 에피소드 동안 평균 보상이 일관되게 상승하는 추세를 보였으며, 이는 에이전트가 강건하고 일반화 가능한 정책을 학습했다는 것을 확인했다.
  • 차선 변경 시나리오에서 최종 훈련 단계의 궤적은 초반 단계에 비해 크게 더 부드럽고 안정적이게 되었다.
  • 램프 통합 시나리오에서 가속도 프로파일이 최종 모델에서 더 부드러워져 종방향 제어 향상과 승차 편안함 향상을 나타냈다.
  • 최종 정책는 안전성, 편안함, 효율성을 우선시하는 보상 함수 설계에 반영된 바와 같이 안전하고 효율적이며 편안한 주행 행동을 달성했다.
  • 정책 기반 강화학습 방법이나 이산 동작 공간 근사치를 요구하지 않고도 연속 제어 정책을 성공적으로 학습했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.