[论文解读] SSL-Lanes: Self-Supervised Learning for Motion Forecasting in Autonomous Driving
SSL-Lanes 提出了一种用于自动驾驶中运动预测的自监督学习框架,通过四种新颖的掩码任务——车道掩码、到交叉口距离预测、驾驶操作分类和成功/失败分类——利用地图和轨迹数据中的免费伪标签。该方法在 Argoverse 基准测试中实现了最先进性能,模型架构复杂度更低,推理速度更快,优于基于 Transformer 的模型,证明了其在不增加推理成本的情况下具备更强的泛化能力和鲁棒性。
Self-supervised learning (SSL) is an emerging technique that has been successfully employed to train convolutional neural networks (CNNs) and graph neural networks (GNNs) for more transferable, generalizable, and robust representation learning. However its potential in motion forecasting for autonomous driving has rarely been explored. In this study, we report the first systematic exploration and assessment of incorporating self-supervision into motion forecasting. We first propose to investigate four novel self-supervised learning tasks for motion forecasting with theoretical rationale and quantitative and qualitative comparisons on the challenging large-scale Argoverse dataset. Secondly, we point out that our auxiliary SSL-based learning setup not only outperforms forecasting methods which use transformers, complicated fusion mechanisms and sophisticated online dense goal candidate optimization algorithms in terms of performance accuracy, but also has low inference time and architectural complexity. Lastly, we conduct several experiments to understand why SSL improves motion forecasting. Code is open-sourced at \url{https://github.com/AutoVision-cloud/SSL-Lanes}.
研究动机与目标
- 探究自监督学习(SSL)是否能在不增加模型复杂度或推理时间的前提下,提升自动驾驶中运动预测的性能。
- 设计针对领域特性的 SSL 掩码任务,利用 readily available 的地图和智能体轨迹信息生成有效的伪标签。
- 评估 SSL 是否能提升泛化能力,特别是在左转/右转、加速和数据不平衡等挑战性场景下的表现。
- 通过消融实验和鲁棒性分析,理解 SSL 提升预测性能的内在原因。
提出的方法
- 提出四种新颖的自监督掩码任务:车道掩码、到交叉口距离预测、驾驶操作分类和成功/失败状态分类。
- 直接从地图结构和智能体动态中提取伪标签,用于训练标准运动预测模型,无需额外标注。
- 将 SSL 任务集成到标准编码器-解码器架构中,共享地图和智能体编码器,保持低推理成本。
- 使用车道掩码掩码任务训练地图编码器,并将其参数迁移至主预测模型。
- 采用多任务训练设置,将 SSL 目标与主预测损失以 1:1 比例结合,无需超参数调优。
- 在数据稀疏性、噪声鲁棒性以及跨城市和驾驶类型泛化性方面进行广泛的消融研究。
实验结果
研究问题
- RQ1自监督学习能否在保持低模型复杂度和快速推理的前提下,提升运动预测的准确性?
- RQ2哪些特定的自监督掩码任务最有效于捕捉如转弯和加速等复杂驾驶行为?
- RQ3在数据不平衡情况下,SSL 是否能提升泛化能力,尤其是对左转等稀有操作?
- RQ4SSL 在真实驾驶场景中面对噪声输入特征时,如何提升鲁棒性?
- RQ5为何 SSL 能够学习到比监督学习更优的特征表示?
主要发现
- SSL-Lanes 在 Argoverse 基准测试中达到最先进性能,模型复杂度更低,推理速度更快,优于基于 Transformer 的方法。
- 车道掩码任务在捕捉右转行为方面最为有效,而到交叉口距离预测任务在提升左转预测性能方面表现最佳。
- 驾驶操作分类和成功/失败分类显著提升了对加速和减速等复杂行为的预测准确性。
- 使用 SSL 训练的模型在数据稀疏情况下泛化能力更强,在仅使用 25% 数据训练时仍能保持更高性能。
- SSL 模型在特征噪声方面表现出更优的鲁棒性,在 25% 和 50% 特征损坏情况下性能仍优于监督基线模型。
- 实验结果证实,SSL 能够学习到更丰富、更具泛化能力的特征表示,尤其在稀有操作和数据分布不平衡场景下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。