Skip to main content
QUICK REVIEW

[论文解读] End-to-end Lane Shape Prediction with Transformers

Ruijin Liu, Zejian Yuan|arXiv (Cornell University)|Nov 9, 2020
Autonomous Vehicle Technology and Safety参考文献 21被引用 9
一句话总结

本文提出一种基于Transformer的端到端车道形状预测方法,通过直接回归物理可解释车道形状模型的参数,实现对长而细的车道线的精确检测,能够捕捉全局上下文和空间依赖关系。该方法在TuSimple基准测试中实现了最先进性能,模型参数量最小、推理速度最快,同时在具有挑战性的自建数据集(FVL)上展现出强大的零样本泛化能力。

ABSTRACT

Lane detection, the process of identifying lane markings as approximated curves, is widely used for lane departure warning and adaptive cruise control in autonomous vehicles. The popular pipeline that solves it in two steps -- feature extraction plus post-processing, while useful, is too inefficient and flawed in learning the global context and lanes' long and thin structures. To tackle these issues, we propose an end-to-end method that directly outputs parameters of a lane shape model, using a network built with a transformer to learn richer structures and context. The lane shape model is formulated based on road structures and camera pose, providing physical interpretation for parameters of network output. The transformer models non-local interactions with a self-attention mechanism to capture slender structures and global context. The proposed method is validated on the TuSimple benchmark and shows state-of-the-art accuracy with the most lightweight model size and fastest speed. Additionally, our method shows excellent adaptability to a challenging self-collected lane detection dataset, showing its powerful deployment potential in real applications. Codes are available at https://github.com/liuruijin17/LSTR.

研究动机与目标

  • 解决两阶段车道检测流水线效率低下、难以捕捉全局上下文和细长车道结构的局限性。
  • 克服基于CNN的方法在建模长距离依赖关系以及处理车道线遮挡方面的不足。
  • 开发一种轻量化、高效且可部署的车道检测系统,适用于移动设备和实时自动驾驶应用。
  • 提升对未见环境(包括夜间场景和多样化交通条件)的泛化能力和可迁移性。
  • 通过基于物理道路几何和相机位姿的车道参数化方法,实现可解释的输出。

提出的方法

  • 将车道检测建模为基于相机位姿和道路几何推导出的物理车道形状模型中参数的直接回归。
  • 设计一种基于Transformer的编码器-解码器网络,利用自注意力机制建模图像中跨区域的非局部、长距离特征交互。
  • 采用匈牙利损失与二分图匹配机制,实现预测结果与真实车道的一对一匹配,避免使用非极大值抑制(NMS)。
  • 使用可学习的预测曲线头(消融实验中为7个)作为端到端训练的锚点,平衡正负样本比例。
  • 通过多头自注意力机制融合空间与上下文特征,提升对细长车道结构的检测能力。
  • 使用可微分损失函数端到端训练整个网络,同时优化车道参数回归与实例匹配任务。

实验结果

研究问题

  • RQ1基于Transformer的端到端网络是否能在保持更小模型尺寸和更短推理时间的同时,超越现有两阶段和基于锚点的方法,在车道检测精度上表现更优?
  • RQ2物理可解释的车道形状模型在多大程度上能提升车道检测输出的泛化能力和可解释性?
  • RQ3所提方法在未见环境(如夜间场景和多样化城市路况)下的泛化能力如何,且无需微调?
  • RQ4为平衡检测性能与训练效率,预测曲线头的最优数量是多少?
  • RQ5自注意力机制是否能有效捕捉检测细长、遮挡或弯曲车道线所必需的全局上下文与长距离依赖关系?

主要发现

  • 所提方法在TuSimple基准测试中达到最先进精度,F1得分为96.8%,错误率最低,且推理速度最快。
  • 该模型在所有SOTA方法中参数量最小(少于150万个参数),极适合移动设备部署。
  • 在自建的Forward View Lane(FVL)数据集中,模型无需微调即可有效泛化至夜间场景、城市交通和多变天气等复杂条件。
  • 消融实验表明,7个预测曲线头能取得最佳性能,过少或过多的头数均会降低泛化能力和拟合精度。
  • 可视化注意力图显示,解码器聚焦于局部车道结构,实现直接实例分离,无需后处理。
  • 采用一对一匹配的匈牙利损失可实现鲁棒训练,且无需非极大值抑制,简化了推理流程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。