[论文解读] Structure-Aware Network for Lane Marker Extraction with Dynamic Vision Sensor
本论文提出了一种结构感知网络(SANet),结合多方向切片卷积,用于从高分辨率动态视觉传感器(DVS)图像中提取车道标记。该研究构建了DET数据集——包含5,424张1280×800分辨率的DVS图像,且具有像素级标注——并证明SANet在DET基准上优于当前最先进方法,达到74.21%的平均F1值和60.86%的平均IoU。
Lane marker extraction is a basic yet necessary task for autonomous driving. Although past years have witnessed major advances in lane marker extraction with deep learning models, they all aim at ordinary RGB images generated by frame-based cameras, which limits their performance in extreme cases, like huge illumination change. To tackle this problem, we introduce Dynamic Vision Sensor (DVS), a type of event-based sensor to lane marker extraction task and build a high-resolution DVS dataset for lane marker extraction. We collect the raw event data and generate 5,424 DVS images with a resolution of 1280$ imes$800 pixels, the highest one among all DVS datasets available now. All images are annotated with multi-class semantic segmentation format. We then propose a structure-aware network for lane marker extraction in DVS images. It can capture directional information comprehensively with multidirectional slice convolution. We evaluate our proposed network with other state-of-the-art lane marker extraction models on this dataset. Experimental results demonstrate that our method outperforms other competitors. The dataset is made publicly available, including the raw event data, accumulated images and labels.
研究动机与目标
- 解决RGB相机在极端光照条件下(如快速光照变化)进行车道检测的局限性。
- 通过利用动态视觉传感器(DVS)克服帧式相机在低光照或高动态范围场景下的性能不足。
- 构建一个高分辨率DVS数据集(DET),包含5,424张1280×800分辨率的图像,并为车道标记提取提供多类别语义分割标签。
- 设计一种结构感知网络(SANet),有效捕捉DVS数据中缺乏丰富外观线索的定向与上下文结构信息。
- 通过引入多方向切片卷积,建模长而连续的车道结构,提升车道标记分割的准确性。
提出的方法
- 使用CeleX V DVS相机构建DET数据集,采集5小时原始事件流,并生成5,424张1280×800像素的高分辨率DVS图像。
- 提供两种标注格式:多类别语义分割和二值分割,以支持通用与专用的车道检测模型。
- 提出一种结构感知网络(SANet),采用多方向切片卷积(MSC)模块,捕捉多方向的特征。
- 将不同感受野大小的切片卷积(3至11)结合使用,以建模车道标记的结构连续性,最优性能出现在卷积核大小为9时。
- 采用多尺度跳跃连接设计,在保留空间细节的同时,聚合各层的上下文特征。
- 使用标准指标(平均F1分数和平均交并比IoU)进行模型训练与评估,并与FCN、DeepLabv3、RefineNet和SCNN等模型进行对比。
实验结果
研究问题
- RQ1高分辨率DVS数据集是否能显著提升极端光照条件下车道标记提取的性能?
- RQ2具有多方向切片卷积的结构感知网络在捕捉DVS数据中长而连续的车道结构方面效果如何?
- RQ3通过切片卷积实现的定向特征学习是否优于标准CNN及专用模型(如SCNN)在事件图像车道分割中的表现?
- RQ4在建模DVS图像中车道标记几何结构时,切片卷积的最佳卷积核大小是多少?
- RQ5与现有语义分割模型和专用车道模型相比,所提方法在事件数据上的泛化能力如何?
主要发现
- 所提出的DET数据集是首个用于车道标记提取的高分辨率DVS数据集,包含5,424张1280×800分辨率图像,并具有详细的像素级标注。
- 采用多方向切片卷积的结构感知网络(SANet_MSC)在DET基准上达到74.21%的平均F1值和60.86%的平均IoU,优于SCNN(73.85% F1,60.44% IoU),IoU提升0.42%。
- MSC模块显著优于基线模型,平均F1提升1.78%,平均IoU提升1.91%。
- 切片卷积中核大小为9时性能最佳(74.21% F1,60.86% IoU),优于较小(3–7)和较大(11)的核。
- 该模型在极端光照条件下表现出优越的鲁棒性,例如在隧道过渡场景中,帧式相机因动态范围低而失效,而本方法仍能稳定工作。
- 所提方法优于通用语义分割模型(FCN、DeepLabv3、RefineNet),后者的F1值均低于65%,原因在于缺乏对车道几何结构的结构归纳偏置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。