Skip to main content
QUICK REVIEW

[논문 리뷰] DeepQTest: Testing Autonomous Driving Systems with Reinforcement Learning and Real-world Weather Data

Chengjie Lu, Tao Yue|arXiv (Cornell University)|2023. 10. 08.
Autonomous Vehicle Technology and Safety인용 수 5
한 줄 요약

DeepQTest는 딥 Q넷을 사용하여 환경 조건을 동적으로 구성함으로써 자율주행 시스템(ADS)을 위한 현실적이고 안전이 중요한 테스트 시나리오를 강화학습 기반으로 생성하는 방법이다. 충돌 탐지 및 현실성에서 랜덤, 그리디, 최신 기술 기반 기준보다 뛰어나며, 시간까지 충돌(TTC)이 최적의 보상 함수로 확인되었다.

ABSTRACT

Autonomous driving systems (ADSs) are capable of sensing the environment and making driving decisions autonomously. These systems are safety-critical, and testing them is one of the important approaches to ensure their safety. However, due to the inherent complexity of ADSs and the high dimensionality of their operating environment, the number of possible test scenarios for ADSs is infinite. Besides, the operating environment of ADSs is dynamic, continuously evolving, and full of uncertainties, which requires a testing approach adaptive to the environment. In addition, existing ADS testing techniques have limited effectiveness in ensuring the realism of test scenarios, especially the realism of weather conditions and their changes over time. Recently, reinforcement learning (RL) has demonstrated great potential in addressing challenging problems, especially those requiring constant adaptations to dynamic environments. To this end, we present DeepQTest, a novel ADS testing approach that uses RL to learn environment configurations with a high chance of revealing abnormal ADS behaviors. Specifically, DeepQTest employs Deep Q-Learning and adopts three safety and comfort measures to construct the reward functions. To ensure the realism of generated scenarios, DeepQTest defines a set of realistic constraints and introduces real-world weather conditions into the simulated environment. We employed three comparison baselines, i.e., random, greedy, and a state-of-the-art RL-based approach DeepCOllision, for evaluating DeepQTest on an industrial-scale ADS. Evaluation results show that DeepQTest demonstrated significantly better effectiveness in terms of generating scenarios leading to collisions and ensuring scenario realism compared with the baselines. In addition, among the three reward functions implemented in DeepQTest, Time-To-Collision is recommended as the best design according to our study.

연구 동기 및 목표

  • 복잡하고 동적인 환경에서 안전이 중요한 자율주행 시스템(ADS)을 위한 고영향력이고 현실적인 테스트 시나리오를 생성하는 데 도전한다.
  • 기존 테스트 방법이 현실적인 기상 조건과 그 시간에 따른 변화를 시뮬레이션하는 데 한계를 가지는 것을 극복한다.
  • 강화학습을 활용해 환경 파라미터를 적응적으로 구성함으로써 온라인 시스템 수준의 테스트 효율성과 효율성을 향상시킨다.
  • 실제 기상 데이터 통합과 사전 정의된 물리적 제약 조건을 통해 시나리오의 현실성을 확보한다.
  • 다양한 보상 함수가 테스트 시나리오 생성 품질과 효과성에 미치는 영향을 조사한다.

제안 방법

  • 테스트 시나리오 생성을 순차적 의사결정 문제로 모델링하여 마르코프 결정 과정(MDP)으로 표현하며, RL 에이전트가 이상적인 ADS 행동을 유도하기 위해 환경 파라미터를 구성한다.
  • 심층 Q넷(DQN)을 RL 알고리즘으로 사용하여 시뮬레이션 환경과의 상호작용을 통해 최적의 환경 구성 방식을 학습한다.
  • 교통, 기상, 차량 동역학을 포함한 고차원 환경 상태를 다중 모달 센서 융합을 통해 인코딩한다.
  • 충돌 유발 시나리오 유도를 위해 시간까지 충돌(TTC), 물체까지 거리(DTO), 진동도(Jerk)의 세 가지 보상 함수를 정의한다.
  • 실제 기상 및 일출·일몰 시간 데이터를 실효과 생성기(Real-effect Generator)를 통해 시뮬레이션에 통합하여 시나리오의 현실성을 향상시킨다.
  • REST API 엔드포인트를 통해 환경 설정을 가능하게 하여 precipitations(강수), 조명, 교통 밀도 등의 시뮬레이션 파라미터를 프로그래밍 방식으로 제어할 수 있도록 한다.
Figure 1: Overview of DeepQTest
Figure 1: Overview of DeepQTest

실험 결과

연구 질문

  • RQ1DeepQTest는 랜덤, 그리디, DeepCollision 기준 대비 충돌을 유도하는 테스트 시나리오 생성에 얼마나 효과적인가?
  • RQ2다양한 테스트 접근 방식 간에 기상 조건 및 일조 시간 측면에서 생성된 테스트 시나리오의 현실성은 어떻게 비교되는가?
  • RQ3세 가지 보상 함수(TTC, DTO, Jerk) 중 어느 것이 충돌 탐지 및 시나리오 다양성 측면에서 가장 효과적인 테스트 시나리오 생성에 기여하는가?
  • RQ4보상 함수 간 상관관계는 어느 정도이며, 이는 다목적 테스트 전략 설계에 어떤 영향을 미치는가?
  • RQ5생성된 테스트 시나리오는 향후 ADS 버전의 회귀 테스트에 재사용 가능한가?

주요 결과

  • DeepQTest는 충돌을 유도하는 테스트 시나리오 생성에서 랜덤 및 그리디 기준보다 유의미하게 뛰어난 성능을 보이며, 효과성 측면에서 통계적으로 유의미한 향상을 보였다.
  • 최신 기술 기반 강화학습 기반 접근 방식인 DeepCollision 대비 DeepQTest는 충돌 탐지율을 유지하거나 향상시키면서도 더 현실적인 테스트 시나리오를 생성하였다.
  • 시간까지 충돌(TTC)이 가장 뛰어난 성능을 보였으며, 가장 높은 충돌률과 현실성 및 효과성의 최적 균형을 달성하였다.
  • TTC와 DTO 간 양의 상관관계가 관찰되었고, TTC와 Jerk 간에는 음의 상관관계가 있었으며, 이는 시간적 안전성과 주행 편안함 지표 간의 상충관계를 시사하였다.
  • ScenarioCollector를 통해 수집된 생성된 테스트 시나리오는 ScenarioRunner를 통해 재생이 가능하며, 충돌 여부 및 궤적 이탈 정도와 같은 실행 속성 추적을 통해 향후 ADS 버전의 회귀 테스트에 적합하다.
  • 실제 기상 데이터 및 일조 시간의 시뮬레이션 통합은 생성된 테스트 시나리오의 현실성을 크게 향상시켰으며, 이는 이전 연구에서의 핵심 한계를 해결한 것이다.
Figure 2: Domain model of the configurable parameters of the ADS operating environment
Figure 2: Domain model of the configurable parameters of the ADS operating environment

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.