[논문 리뷰] When Do Drivers Concentrate? Attention-based Driver Behavior Modeling With Deep Reinforcement Learning
이 논문은 실제 궤적 데이터를 사용하여 차량 추종 상황에서 운전자의 시간적 주의 할당을 모델링하는 주의 강화된 액터-크리틱 강화학습 프레임워크인 ATD3를 제안한다. 액터 네트워크에 시간적 주의 메커니즘을 통합하고 TD3를 가치 추정에 사용함으로써, 모델은 일곱 가지 베이스라인보다 운전자의 행동 예측에서 뛰어난 성능을 보이며, 돌연한 속도 감소 시 주의가 균일한 분포에서 최근 관측치로 이동하는 경향을 드러내어 분산 패턴에 대한 새로운 통찰을 제공한다.
Driver distraction a significant risk to driving safety. Apart from spatial domain, research on temporal inattention is also necessary. This paper aims to figure out the pattern of drivers' temporal attention allocation. In this paper, we propose an actor-critic method - Attention-based Twin Delayed Deep Deterministic policy gradient (ATD3) algorithm to approximate a driver' s action according to observations and measure the driver' s attention allocation for consecutive time steps in car-following model. Considering reaction time, we construct the attention mechanism in the actor network to capture temporal dependencies of consecutive observations. In the critic network, we employ Twin Delayed Deep Deterministic policy gradient algorithm (TD3) to address overestimated value estimates persisting in the actor-critic algorithm. We conduct experiments on real-world vehicle trajectory datasets and show that the accuracy of our proposed approach outperforms seven baseline algorithms. Moreover, the results reveal that the attention of the drivers in smooth vehicles is uniformly distributed in previous observations while they keep their attention to recent observations when sudden decreases of relative speeds occur. This study is the first contribution to drivers' temporal attention and provides scientific support for safety measures in transportation systems from the perspective of data mining.
연구 동기 및 목표
- 동적 주행 상황, 특히 상대 속도 변화가 발생할 때 운전자가 시간에 따라 주의를 어떻게 할당하는지 모델링하는 것.
- 운전 안전 분야에서 공간적 분산 외의 시간적 무관심에 대한 연구 격차를 해결하는 것.
- 주의 메커니즘을 사용하여 운전 행동의 시간적 의존성을 포착하는 딥 강화학습 프레임워크를 개발하는 것.
- 주의 동역학을 모델링하여 차량 추종 작업에서의 행동 예측 정확도를 향상시키는 것.
제안 방법
- 주어진 액터-크리틱 알고리즘으로서 주의 메커니즘과 Twin Delayed Deep Deterministic Policy Gradient (TD3)를 결합한 ATD3를 제안한다.
- 현재 결정에 대한 관련성에 따라 과거 관측치를 가중치 적용하기 위해 액터 네트워크에 시간적 주의 메커니즘을 통합한다.
- 값 함수 학습에서 과대추정 편향을 줄이기 위해 크리틱 네트워크에서 TD3를 사용한다.
- 실제 차량 궤적 데이터셋을 기반으로 모델을 엔드 투 엔드로 훈련하여 차량 추종 작업에서의 운전 행동 예측을 수행한다.
- 연속적인 관측치에 주의를 기울임으로써 반응 시간 모델링을 구현하여 운전 행동의 시간적 의존성을 포착한다.
- 액터는 주의를 기울인 관측치를 바탕으로 행동을 생성하고, 크리틱은 행동-가치를 평가하는 이중 네트워크 아키텍처를 사용한다.
실험 결과
연구 질문
- RQ1운전자가 차량 추종 작업 중 시간에 따라 주의를 어떻게 분배하는가?
- RQ2상대 속도가 돌연 감소할 경우 운전자의 주의 할당 패턴은 어떻게 변화하는가?
- RQ3주의 메커니즘을 갖춘 딥 강화학습은 기존 베이스라인 모델 대비 운전 행동 예측 정확도를 향상시킬 수 있는가?
- RQ4시간적 주의를 포함함으로써 모델이 운전 행동의 동역학을 포착하는 데 어떤 영향을 미치는가?
주요 결과
- 제안된 ATD3 모델은 실제 궤적 데이터셋에서 일곱 가지 베이스라인 알고리즘보다 높은 예측 정확도를 달성한다.
- 부드럽게 주행하는 차량을 따라갈 경우 운전자는 과거 관측치에 대해 균일하게 주의를 분배한다.
- 상대 속도가 돌연 감소할 경우 운전자는 최근 관측치로 주의를 이동시킨다.
- 주의 메커니즘이 운전 행동의 시간적 동역학을 성공적으로 포착하여 맥락에 따라 달라지는 주의 패턴을 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.