Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning Based High-level Driving Behavior Decision-making Model in Heterogeneous Traffic

Zhengwei Bai, Baigen Cai|arXiv (Cornell University)|Feb 15, 2019
Autonomous Vehicle Technology and Safety参考文献 13被引用 10
一句话总结

该论文提出了一种基于深度强化学习(DRL)的车联网高阶驾驶行为决策模型,用于异质交通环境,采用超网格矩阵(HGM)统一V2X数据,并利用双流参数共享DNN与双值DQN架构学习最优策略。该模型在训练速度、换道次数以及不同车联网比例下的泛化能力方面表现更优,相较于基线方法在速度和效率上更具优势。

ABSTRACT

High-level driving behavior decision-making is an open-challenging problem for connected vehicle technology, especially in heterogeneous traffic scenarios. In this paper, a deep reinforcement learning based high-level driving behavior decision-making approach is proposed for connected vehicle in heterogeneous traffic situations. The model is composed of three main parts: a data preprocessor that maps hybrid data into a data format called hyper-grid matrix, a two-stream deep neural network that extracts the hidden features, and a deep reinforcement learning network that learns the optimal policy. Moreover, a simulation environment, which includes different heterogeneous traffic scenarios, is built to train and test the proposed method. The results demonstrate that the model has the capability to learn the optimal high-level driving policy such as driving fast through heterogeneous traffic without unnecessary lane changes. Furthermore, two separate models are used to compare with the proposed model, and the performances are analyzed in detail.

研究动机与目标

  • 为解决混合车联网与人工驾驶车辆共存的异质交通环境中高阶驾驶决策问题。
  • 克服现有模型依赖原始传感器数据或假设非联网车辆行为一致的局限性。
  • 通过统一数据格式将原始V2X数据与神经网络解耦,提升模型泛化能力与鲁棒性。
  • 构建一种DRL框架,通过在模拟异质环境中端到端训练,学习最优策略(如快速、稳定驾驶且无非必要换道)。
  • 验证模型在不同车联网比例(CAV)与人工驾驶车辆(HV)比例下的性能与泛化能力。

提出的方法

  • 模型使用超网格矩阵(HGM)将原始V2X数据转换为统一、结构化的格式,实现输入表示与神经网络的解耦。
  • 采用双流、参数共享的深度神经网络,处理HGM中的空间与时间特征,实现异质数据的有效融合。
  • 策略网络采用双值DQN架构,以提升价值函数逼近与策略学习效果。
  • DRL智能体采用ε-greedy探索策略,ε在100万步内线性从1降至0.1。
  • 构建了定制化仿真环境,包含五种异质交通场景,涵盖不同比例的CAV、AHVs(自动驾驶人工驾驶车辆)与CHVs(车联网人工驾驶车辆)。
  • 模型在闭环仿真环境中进行训练与测试,智能体观测环境、采取动作(如加速、变道),并根据速度、安全性和效率获得密集奖励。

实验结果

研究问题

  • RQ1基于DRL的模型能否学习到一种最优高阶驾驶策略,实现在密集异质交通中快速、安全、高效行驶且无非必要换道?
  • RQ2所提出的HGM数据映射技术相较于直接使用原始V2X数据,如何提升模型泛化能力?
  • RQ3双流参数共享DNN在复杂交通场景中如何增强对混合V2X输入的特征提取能力?
  • RQ4在不同CAV比例下,所提模型与现有方法(如Min的方法、坐标法)在速度、换道次数与超车行为方面的性能对比如何?
  • RQ5该模型是否能在多样化的异质交通构成中保持稳健性能与泛化能力?

主要发现

  • 在第4种场景(75% CAVs)中,所提模型平均速度达1974 km/h,显著优于Min的方法(1907 km/h)与坐标法(1875 km/h)。
  • 该模型在减少平均换道次数方面优于基线方法,在所有测试场景中均表现出最低换道次数,表明策略效率更高。
  • 在第5种场景(100% CAVs)中,所提模型达到1969 km/h,表明在全联网环境中仍具备强大性能。
  • 坐标法因绕过HGM,性能出现下降(如第3种场景中为1867 km/h),证实HGM在提升模型泛化能力方面具有关键作用。
  • 所提模型训练过程稳定,超车行为波动小;而Min的方法在训练期间表现出高方差。
  • 该模型在全部五个测试场景中均表现出良好泛化能力,无论CAV比例如何均保持高性能;而Min的方法在各场景中结果几乎相同,表明其适应能力差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。