[논문 리뷰] An Auto-tuning Framework for Autonomous Vehicles
이 논문은 수백만 티어의 전문가 주행 데이터를 기반으로 한 새로운 순위 기반 조건부 역강화학습(RC-IRL) 알고리즘을 사용하여 레벨-4 자율주행차 운동계획자에 대한 데이터 기반 오토튜닝 프레임워크를 제안한다. 이 프레임워크는 전문가 주행 데이터를 기반으로 한 오프라인 훈련과 자동 레이블링을 통해 보다 효율적이고 안전하며 자동화된 보상 함수 튜닝을 가능하게 하여 시뮬레이션 및 실제 도로 테스트에서 25,000마일 이상의 주행 이력 동안 100% 충돌 없음과 뛰어난 궤적 부드러움을 달성하였다.
Many autonomous driving motion planners generate trajectories by optimizing a reward/cost functional. Designing and tuning a high-performance reward/cost functional for Level-4 autonomous driving vehicles with exposure to different driving conditions is challenging. Traditionally, reward/cost functional tuning involves substantial human effort and time spent on both simulations and road tests. As the scenario becomes more complicated, tuning to improve the motion planner performance becomes increasingly difficult. To systematically solve this issue, we develop a data-driven auto-tuning framework based on the Apollo autonomous driving framework. The framework includes a novel rank-based conditional inverse reinforcement learning algorithm, an offline training strategy and an automatic method of collecting and labeling data. Our auto-tuning framework has the following advantages that make it suitable for tuning an autonomous driving motion planner. First, compared to that of most inverse reinforcement learning algorithms, our algorithm training is efficient and capable of being applied to different scenarios. Second, the offline training strategy offers a safe way to adjust the parameters before public road testing. Third, the expert driving data and information about the surrounding environment are collected and automatically labeled, which considerably reduces the manual effort. Finally, the motion planner tuned by the framework is examined via both simulation and public road testing and is shown to achieve good performance.
연구 동기 및 목표
- 다양한 주행 환경에서 자율주행차 운동계획자에 대한 보상/비용 함수 수작업 튜닝의 과제를 해결하기 위해.
- 전문가 주행 데이터를 활용한 안전한 오프라인 학습을 통해 훈련 과정에서의 인간의 노력과 위험을 감소시키기 위해.
- 자동화된 데이터 수집 및 레이블링을 통해 복잡하고 희귀한 장면에서도 일반화 능력과 성능을 향상시키기 위해.
- 아폴로 자율주행 플랫폼과 호환되는 확장 가능하고 종단 간 프레임워크를 개발하기 위해.
- 시뮬레이션 및 광범위한 실제 도로 테스트를 통해 프레임워크의 효과성을 검증하기 위해.
제안 방법
- 프레임워크는 전문가 시연 데이터로부터 보상 함수를 학습하기 위해 새로운 순위 기반 조건부 역강화학습(RC-IRL) 알고리즘을 사용한다.
- 전문가 궤적과 생성된 궤적을 비교하기 위해 시아미즈 신경망 아키텍처를 사용하여 전문가 행동과 유사도 기반으로 궤적을 순위 매긴다.
- 시간 할인 보상 함수는 시간 단계 간 공유 파라미터를 사용하여 궤적 평가의 일관성을 유지한다.
- 환경 맥락 및 자동차 자체 상태 특징을 활용하여 전문가 주행 데이터를 자동으로 수집하고 레이블링함으로써 수동 레이블링 작업을 감소시킨다.
- 실시간 안전 위험을 피하기 위해 7억 1,800만 프레임과 28억 개의 샘플링된 궤적을 포함한 필터링된 데이터셋을 기반으로 오프라인 훈련을 수행한다.
- 확률적 경사 하강법과 ADAM 또는 RMSProp를 사용하여 보상 함수를 최적화하며, 약 2 에포크 내에 수렴한다.
실험 결과
연구 질문
- RQ1데이터 기반 오토튜닝 프레임워크는 자율주행차 운동계획자에 대한 보상 함수 튜닝에 소요되는 인간의 노력과 시간을 줄일 수 있는가?
- RQ2제안된 순위 기반 조건부 IRL 방법은 보상 함수를 효과적으로 학습하는 데 있어 표준 GAN 기반 접근법과 비교해 어떤가?
- RQ3이 프레임워크는 복잡하고 희귀한 사례를 포함한 다양한 주행 환경에서 안전성이나 부드러움을 해치지 않고 일반화 가능한가?
- RQ4자동으로 레이블링된 데이터를 사용한 오프라인 훈련이 온라인 또는 수동 튜닝 수준의 성능을 유지하는 데 얼마나 효과적인가?
- RQ5이 프레임워크를 통해 튜닝된 운동계획자의 실제 도로 성능은 안전성과 궤적 품질 측면에서 어떠한가?
주요 결과
- 오토튜닝 프레임워크로 튜닝된 운동계획자는 3,400개 이상의 테스트 케이스에서 시뮬레이션 환경에서 100% 충돌 없음 성능을 달성하였다.
- 시아미즈 기반 RC-IRL 방법은 종방향 가속도 제약 조건(|a_station| < 4.0)을 99.33% 준수하였으며, GAN 기반 베이스라인 대비 86.80%를 기록하여 우수한 성능을 보였다.
- 시간에 따라 변화하는 종방향 급속도 제약 조건(|j_station| < 6.0)을 97.77% 준수하였으며, GAN 방법 대비 71.20%를 기록하였다.
- 튜닝된 보상 함수는 공개 도로에서 검증되었으며, 2018년 4월 2일 이래로 25,000마일 이상의 실제 주행에서 뛰어난 성능을 보였다.
- 시아미즈 네트워크가 학습한 시간 할인 요소는 GAN 기반 방법보다 전문가 행동과 더 나은 분포 일치를 보였다.
- 오프라인 훈련 전략은 훈련 중 실시간 피드백이 필요 없이 안전한 파rameter 튜닝을 가능하게 하여 시스템의 안전성을 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.