[논문 리뷰] ApolloRL: a Reinforcement Learning Platform for Autonomous Driving
ApolloRL은 실세계 주행 데이터, 시뮬레이션, 훈련 및 평가를 확장성 있고 분산 아키텍처로 통합한 개방형 엔드 투 엔드 강화학습 플랫폼으로, 자율주행을 위한 것입니다. 연구자들이 SOTA 알고리즘인 PPO와 SAC를 사용하여 실세계 주행 시나리오 300시간에 걸쳐 RL 에이전트를 훈련하고 벤치마킹할 수 있게 하여 복잡한 교통 환경에서 안정적이고 재현 가능한 성능 향상을 달성합니다.
We introduce ApolloRL, an open platform for research in reinforcement learning for autonomous driving. The platform provides a complete closed-loop pipeline with training, simulation, and evaluation components. It comes with 300 hours of real-world data in driving scenarios and popular baselines such as Proximal Policy Optimization (PPO) and Soft Actor-Critic (SAC) agents. We elaborate in this paper on the architecture and the environment defined in the platform. In addition, we discuss the performance of the baseline agents in the ApolloRL environment.
연구 동기 및 목표
- 부정확한 정보, 다중 목표, 복잡한 행동 공간, 지연된 보상 등 자율주행 의사결정 과제의 과제를 해결하기 위해.
- 실세계 자율주행 시나리오에서 강화학습 연구를 위한 통합적이고 확장성 있고 유연한 플랫폼을 제공하기 위해.
- 대규모 고정밀 실세계 주행 데이터를 활용하여 시뮬레이션과 실세계 구현 간 격차를 해소하기 위해.
- 통합된 훈련, 시뮬레이션 및 평가 파이프라인을 통해 RL 알고리즘의 빠른 반복 및 평가를 지원하기 위해.
- 데이터, 도구 및 커뮤니티 협업에 대한 개방형 접근을 통해 딥 강화학습 분야의 연구를 자극하고 가속화하기 위해.
제안 방법
- 플랫폼은 인식, 계획, 제어 및 시뮬레이션 모듈을 통합한 클로즈드 루프 파이프라인을 사용하여 엔드 투 엔드 RL 훈련을 가능하게 합니다.
- 실세계 주행 데이터 300시간(훈련용 50,000시간, 테스트용 10,000시간)을 활용하여 시뮬레이션에서 현실적이고 다양한 교통 시나리오를 생성합니다.
- 환경은 관측, 행동 및 보상 형상 조정을 커스터마이징할 수 있어 유연한 RL 알고리즘 구현을 가능하게 합니다.
- 다중 에이전트 및 시나리오에 걸쳐 훈련과 평가를 확장하기 위해 분산 시뮬레이션 및 분산 훈련 구성 요소를 사용합니다.
- 기본 에이전트는 전문 운전사 로그에서 지도학습을 통해 사전 훈련된 후 가상 환경에서 강화학습을 통해 개선됩니다.
- 플랫폼은 Proximal Policy Optimization (PPO) 및 Soft Actor-Critic (SAC)와 같은 인기 있는 연속 제어 RL 알고리즘을 지원합니다.
실험 결과
연구 질문
- RQ1통합적이고 개방된 플랫폼이 자율주행을 위한 딥 강화학습 연구를 크게 가속화할 수 있는가?
- RQ2시뮬레이션된 실세계 유도 시나리오에서 훈련된 RL 에이전트가 복잡하고 장기적인 주행 과제로 일반화하는 데 얼마나 효과적인가?
- RQ3PPO 및 SAC 에이전트가 기본 접근 방식에 비해 실세계 주행 시나리오에서 성능을 얼마나 향상시킬 수 있는가?
- RQ4플랫폼이 다양한 고정밀 교통 환경에서 RL 에이전트의 스케일링 가능하고 재현 가능한 훈련 및 평가를 지원할 수 있는가?
- RQ5자율주행 의사결정에서 지도학습 사전 훈련과 강화학습 미세조정을 조합할 잠재력은 무엇인가?
주요 결과
- ApolloRL 플랫폼은 훈련 단계 동안 누적 보상 곡선이 안정적으로 향상되는 것으로 나타나, RL 에이전트의 안정적이고 재현 가능한 훈련을 성공적으로 가능하게 했습니다.
- PPO 및 SAC로 훈련된 기본 에이전트는 복잡한 주행 시나리오에서 측정 가능한 성능 향상을 달성했으며, 일부는 실도 주행 자율주행 시스템의 기본 성능을 초월했습니다.
- 플랫폼은 수십 개의 다양한 자율주행 시나리오(Autonomous Driving Scenarios, ADS)에 대한 에이전트 훈련을 지원하며, 시나리오당 20~30초 이내에 대부분의 경우 훈련 목표를 달성했습니다.
- 실세계 데이터를 시뮬레이션에 통합함으로써 고정밀 시나리오 생성이 가능해져 현실적인 에이전트 훈련 및 평가를 지원합니다.
- 플랫폼의 분산 아키텍처는 시뮬레이션 및 훈련의 효율적 확장을 가능하게 하여 향후 수천 개의 시나리오로의 확장도 지원합니다.
- 플랫폼은 확장 가능하며 사용자 정의 알고리즘, 하이퍼파라미터, 모델 및 탐색 전략을 지원하여 광범위한 연구 적용 가능성을 제공합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.