Skip to main content
QUICK REVIEW

[论文解读] Road Segmentation Using CNN with GRU

Yecheng Lyu, Xinming Huang|arXiv (Cornell University)|Apr 14, 2018
Advanced Neural Network Applications参考文献 27被引用 12
一句话总结

本文提出了一种轻量级CNN-GRU网络,用于自动驾驶车辆中的实时道路分割,结合卷积神经网络进行局部特征提取,并利用门控循环单元高效建模空间上下文。该方法在KITTI基准测试中实现了86.91%的F1分数和81.11%的平均精度,推理速度达50 FPS,优于以往工作在推理速度和参数效率方面的表现,同时保持了较低的误报率。

ABSTRACT

This paper presents an accurate and fast algorithm for road segmentation using convolutional neural network (CNN) and gated recurrent units (GRU). For autonomous vehicles, road segmentation is a fundamental task that can provide the drivable area for path planning. The existing deep neural network based segmentation algorithms usually take a very deep encoder-decoder structure to fuse pixels, which requires heavy computations, large memory and long processing time. Hereby, a CNN-GRU network model is proposed and trained to perform road segmentation using data captured by the front camera of a vehicle. GRU network obtains a long spatial sequence with lower computational complexity, comparing to traditional encoder-decoder architecture. The proposed road detector is evaluated on the KITTI road benchmark and achieves high accuracy for road segmentation at real-time processing speed.

研究动机与目标

  • 开发一种适用于自动驾驶车辆嵌入式系统的快速且准确的道路分割方法。
  • 与常用于语义分割的深层编码器-解码器网络相比,降低计算复杂度和内存使用量。
  • 利用循环神经网络更高效地建模道路图像中的长距离空间依赖关系。
  • 在保持标准基准(如KITTI)高精度的同时,提升实时性能。
  • 在自动驾驶导航中提升安全性,最小化可行驶区域检测中的误报。

提出的方法

  • 网络使用轻量级CNN作为局部特征编码器,从输入图像中提取空间特征。
  • 采用基于GRU的上下文处理模块,对图像列之间的长距离空间依赖关系进行建模,替代深层跳跃连接。
  • 添加坐标输入通道以编码空间位置,提升道路区域的定位精度。
  • 使用平均绝对误差(MAE)损失进行训练,以预测道路区域的边界位置。
  • 数据增强包括随机缩放(0.5–1.0倍)和偏移(水平60像素,垂直20像素),以增加训练多样性。
  • 使用Adam优化器,固定初始学习率为1e-4,批量大小为125,训练共80个周期。

实验结果

研究问题

  • RQ1基于GRU的循环网络是否能以低于深层编码器-解码器网络的计算成本,有效建模道路分割中的空间上下文?
  • RQ2在单目相机图像中,将空间坐标引入输入在多大程度上能提升道路边界定位的准确性?
  • RQ3轻量级CNN-GRU架构在保持KITTI基准高精度的同时,能在多大程度上实现实时推理速度?
  • RQ4与最先进道路分割模型相比,该方法在误报率和模型效率方面表现如何?
  • RQ5在真实驾驶场景中常见的光照变化和遮挡条件下,该模型是否具备良好的泛化能力?

主要发现

  • 所提出的CNN-GRU模型在KITTI测试集上实现了86.91%的F1分数和81.11%的平均精度,表现出强大的分割精度。
  • 模型的误报率低至4.39%,显著提升了自动驾驶路径规划的安全性。
  • 在GTX 950M GPU上,该网络以50帧每秒的速度处理图像,适用于实时部署。
  • 模型仅包含279万个参数和19.7亿次浮点运算(1.97G FLOPs),在模型大小和计算成本方面显著优于以往方法。
  • 与StixelNet和MAP相比,该模型在推理速度和参数数量上表现更优,同时保持了相当或更高的F1分数和精度。
  • 误报主要出现在道路/车辆和道路/人行道交界处,而误报主要出现在人行道上,表明仍需进一步优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。