[论文解读] An End-to-end Deep Reinforcement Learning Approach for the Long-term Short-term Planning on the Frenet Space
本文提出了一种端到端的连续深度强化学习(DRL)框架,用于高速公路自动驾驶,直接在Frenet坐标系中运行,实现了平滑、连续的时空轨迹生成。通过在Frenet坐标系中建模状态空间和动作空间,并使用过去轨迹的时空卷积主干网络,该方法在复杂交通场景下相比离散DRL和基于规则的基线方法表现出更优性能,尤其在动态变道和密集交通脱困操作中表现突出。
Tactical decision making and strategic motion planning for autonomous highway driving are challenging due to the complication of predicting other road users' behaviors, diversity of environments, and complexity of the traffic interactions. This paper presents a novel end-to-end continuous deep reinforcement learning approach towards autonomous cars' decision-making and motion planning. For the first time, we define both states and action spaces on the Frenet space to make the driving behavior less variant to the road curvatures than the surrounding actors' dynamics and traffic interactions. The agent receives time-series data of past trajectories of the surrounding vehicles and applies convolutional neural networks along the time channels to extract features in the backbone. The algorithm generates continuous spatiotemporal trajectories on the Frenet frame for the feedback controller to track. Extensive high-fidelity highway simulations on CARLA show the superiority of the presented approach compared with commonly used baselines and discrete reinforcement learning on various traffic scenarios. Furthermore, the proposed method's advantage is confirmed with a more comprehensive performance evaluation against 1000 randomly generated test scenarios.
研究动机与目标
- 解决在复杂动态交通条件下,高速公路自动驾驶中的长期决策与短期轨迹规划挑战。
- 克服现有DRL和基于规则方法中离散动作空间与固定轨迹生成的局限性。
- 实现端到端学习,将原始传感器观测直接映射为连续、运动学可行的轨迹,无需中间离散化。
- 通过利用Frenet坐标系表示,提升在密集交通中对曲率不敏感的行为规划能力,增强机动性与适应性。
- 通过高保真CARLA模拟,在1,000个随机生成的高速公路场景中验证方法的鲁棒性与泛化能力。
提出的方法
- 在Frenet坐标系(s, d, v, a)中表示状态空间,以解耦纵向与横向动力学,并降低对道路曲率的敏感性。
- 使用一维时间卷积神经网络(TCN)处理周围车辆的时间序列轨迹,从历史观测中提取时空特征。
- 采用连续动作空间,在Frenet坐标系中生成平滑的多项式基时空轨迹(如五次多项式),用于反馈跟踪。
- 使用近端策略优化(PPO)训练端到端DRL智能体,其奖励函数平衡了速度、安全性和乘坐舒适性。
- 采用分层架构,其中DRL智能体作为高层规划器,直接输出轨迹,无需依赖离散的格网或航点网格。
- 在CARLA模拟中通过多样化交通场景(包括密集交通、汇入车道和高速变道)验证性能。
实验结果
研究问题
- RQ1在Frenet坐标系中的端到端连续DRL智能体是否能在长期高速公路轨迹规划中超越离散DRL和基于规则的基线方法?
- RQ2Frenet空间表示如何提升对道路曲率的鲁棒性,并增强在密集交通中的机动性?
- RQ3连续动作空间DRL在不离散化动作空间的情况下,能在多大程度上学习生成安全、舒适且高效的轨迹?
- RQ4该智能体在1,000个随机生成的高速公路场景(包含不同交通密度和车辆动力学)中是否具备良好的泛化能力?
- RQ5在轨迹规划中,连续DRL与离散DRL方法在计算成本与性能之间存在何种权衡?
主要发现
- 在1,000个测试场景中,端到端连续DRL智能体取得了平均69分(满分100分)的最高性能得分,优于Safe基线(65分)和Agile基线(52分)。
- 在密集交通脱困场景中,连续DRL智能体成功在车辆间创建了安全通行路径,而离散智能体因刚性格网约束而失败,持续尾随前车。
- 连续DRL智能体实现了76%的速度、52%的安全性和78%的舒适性,相比基于规则的智能体,在多个竞争目标间实现了更优的平衡。
- 该方法的计算成本保持一致,不受轨迹复杂度影响,而离散智能体的性能随离散化程度提高而下降。
- 基于Frenet的状态表示使智能体能够在不同道路曲率和交通交互场景中泛化,且性能无下降。
- 智能体在汇入和变道任务中表现出更优的机动性,尤其在高速、低净空场景中,离散智能体无法生成可行轨迹。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。