[论文解读] Full-Resolution Residual Networks for Semantic Segmentation in Street Scenes
本文提出全分辨率残差网络(FRRN),一种新型的类似ResNet的语义分割架构,专为街景场景设计,通过在单一处理流中保持全图像分辨率,实现精确的边界对齐,同时利用独立的池化流进行鲁棒的特征学习。无需预训练或后处理,FRRN在Cityscapes验证集上实现了71.8%的平均交并比(mIoU)的最先进性能。
Semantic image segmentation is an essential component of modern autonomous driving systems, as an accurate understanding of the surrounding scene is crucial to navigation and action planning. Current state-of-the-art approaches in semantic image segmentation rely on pre-trained networks that were initially developed for classifying images as a whole. While these networks exhibit outstanding recognition performance (i.e., what is visible?), they lack localization accuracy (i.e., where precisely is something located?). Therefore, additional processing steps have to be performed in order to obtain pixel-accurate segmentation masks at the full image resolution. To alleviate this problem we propose a novel ResNet-like architecture that exhibits strong localization and recognition performance. We combine multi-scale context with pixel-level accuracy by using two processing streams within our network: One stream carries information at the full image resolution, enabling precise adherence to segment boundaries. The other stream undergoes a sequence of pooling operations to obtain robust features for recognition. The two streams are coupled at the full image resolution using residuals. Without additional processing steps and without pre-training, our approach achieves an intersection-over-union score of 71.8% on the Cityscapes dataset.
研究动机与目标
- 解决自动驾驶中语义分割的定位精度与识别性能之间的权衡问题。
- 克服预训练分类网络因池化和下采样导致定位性能下降的局限性。
- 开发一种轻量级、端到端可训练的架构,保留全分辨率特征以提升边界精度。
- 消除对CRF平滑等后处理步骤的依赖,这些步骤常用于优化分割边界。
- 证明从零开始训练的新型双流架构可达到或超越现有最先进性能基准数据集的表现。
提出的方法
- 设计双流架构:一条流在全图像分辨率下处理特征(高分辨率流),另一条流通过应用池化操作构建分层的高层次表征(池化流)。
- 引入全分辨率残差单元(FRRU),实现在全分辨率下高分辨率流与池化流之间的残差连接,实现无分辨率损失的特征融合。
- 利用池化流的残差连接引导并增强高分辨率流,结合粗粒度语义上下文与细粒度空间精度。
- 仅使用Cityscapes训练数据,从零开始端到端训练整个网络,避免使用ImageNet预训练。
- 在两条流中均使用标准卷积层、批量归一化和ReLU激活函数,通过反池化实现上采样以保持空间对齐。
- 使用随机梯度下降优化,配合权重衰减和余弦退火学习率调度,采用交叉熵损失函数进行多类别分割。
实验结果
研究问题
- RQ1全卷积网络架构是否能在不依赖ImageNet预训练模型的情况下实现最先进语义分割性能?
- RQ2在整个网络中保持全分辨率特征图是否相比标准FCN方法(含池化操作)能显著提升边界对齐能力?
- RQ3双流设计(结合高分辨率与池化特征流)是否能同时提升识别与定位性能?
- RQ4在Cityscapes基准上,该架构在mIoU和边界精度(trimap评估)等定量指标上与现有方法相比表现如何?
- RQ5使用该架构时是否仍需CRF或类似技术进行后处理?还是其本身即可生成高质量、锐利的分割掩码?
主要发现
- FRRN在Cityscapes验证集上实现了71.8%的平均交并比(mIoU)得分,与当前最先进性能持平,且未使用ImageNet预训练。
- 在所有半径(1至80像素)的trimap评估中,该模型均优于所有对比方法,表明其边界对齐能力显著优于LRR和空洞卷积基模型。
- 即使在半分辨率图像上进行训练,FRRN的性能仍可与在全分辨率输入上训练的方法相当,表明其具备强大的归纳偏置和高效的特征学习能力。
- 使用全连接条件随机场(CRF)进行后处理仅使mIoU提升约0.5%,表明网络原生预测结果已高度准确且平滑。
- 该架构泛化能力良好:定性结果表明,即使在细杆、围栏和复杂人行道边界等挑战性场景下,也能生成清晰、准确的预测。
- 消融实验证实,结合FRRU的双流设计对性能至关重要,若移除高分辨率流或FRRU,mIoU将出现显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。