[论文解读] Naturalistic Driver Intention and Path Prediction using Recurrent Neural Networks
本文提出一种带有混合密度网络输出层的循环神经网络(RNN),利用真实世界的激光雷达数据,预测无信号灯城市交叉口处驾驶员的多模态意图与轨迹。该模型将不确定的预测聚类为按概率排序的合理路径,在包含五个交叉口共23,000辆车辆的大规模自然驾驶数据集上,性能优于基线模型。
Understanding the intentions of drivers at intersections is a critical component for autonomous vehicles. Urban intersections that do not have traffic signals are a common epicentre of highly variable vehicle movement and interactions. We present a method for predicting driver intent at urban intersections through multi-modal trajectory prediction with uncertainty. Our method is based on recurrent neural networks combined with a mixture density network output layer. To consolidate the multi-modal nature of the output probability distribution, we introduce a clustering algorithm that extracts the set of possible paths that exist in the prediction output, and ranks them according to likelihood. To verify the method's performance and generalizability, we present a real-world dataset that consists of over 23,000 vehicles traversing five different intersections, collected using a vehicle mounted Lidar based tracking system. An array of metrics is used to demonstrate the performance of the model against several baselines.
研究动机与目标
- 解决在传统数据集和模型难以应对的动态无信号灯城市交叉口环境中,预测驾驶员意图的挑战。
- 开发一种能够捕捉驾驶员行为多模态特性的方法——例如左转、右转或直行——而非假设单一确定性路径。
- 实现实时、可泛化的预测,适用于多种交叉口几何结构,无需高精地图或大量预处理。
- 提供概率性、不确定性感知的输出,以反映在模糊情境下真实的驾驶员决策过程。
- 利用大规模自然驾驶数据集,在真实驾驶场景中验证模型的泛化能力与鲁棒性。
提出的方法
- 采用长短期记忆(LSTM)循环神经网络,建模驾驶员轨迹序列中的时间依赖性。
- 使用混合密度网络(MDN)输出层,对未来的多模态轨迹概率分布进行建模。
- 对MDN输出应用聚类算法,提取按概率排序的离散可能路径集合。
- 使用真实世界的激光雷达跟踪数据端到端训练模型,无需数据筛选或未来时间依赖性。
- 采用以交叉口入口为中心的参考坐标系,统一不同交叉口的轨迹输入。
- 通过将输出视为高斯混合模型,实现不确定性估计,从而对每条预测路径进行置信度评分。
实验结果
研究问题
- RQ1深度学习模型是否能仅基于实时、自然的轨迹数据,有效预测无信号灯交叉口处的多模态驾驶员意图?
- RQ2所提出的RNN-MDN模型结合聚类方法,在真实世界数据上的准确性和鲁棒性相较于基线方法表现如何?
- RQ3该模型在无需高精地图或地图特定微调的情况下,能否在不同交叉口几何结构间实现良好泛化?
- RQ4与单路径或确定性模型相比,引入不确定性和多模态输出在多大程度上提升了预测性能?
- RQ5训练过程中对序列的建模对预测精度有何影响,特别是与仅使用第一步损失函数相比?
主要发现
- RNN-FF模型在多模态轨迹预测中优于所有基线模型,尤其在左转和右转预测中表现突出,最可能的预测路径始终优于其他备选路径。
- 该模型成功捕捉了驾驶员行为的多模态特性,例如可同时预测一辆尚未明确转向的车辆的直行与左转路径。
- 即使真实轨迹并非最高预测路径,其仍始终包含在多模态输出集合中,表明模型具有强大鲁棒性。
- 仅使用第一步损失的RNN-FL模型表现较差,表明训练过程中完整序列建模对实现长时程预测的准确性至关重要。
- RNN-ZF与RNN-FF模型性能差异极小,表明推理时从多模态输出中采样不会显著降低预测效果。
- 该模型在不同交叉口间表现出强大的泛化能力,包括训练中未见过的交叉口,尽管存在轻微数据错位,性能仍保持稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。