[论文解读] Real-time Fusion Network for RGB-D Semantic Segmentation Incorporating Unexpected Obstacle Detection for Road-driving Images
本文提出RFNet,一种实时RGB-D语义分割网络,通过自适应特征拼接(AFC)模块融合RGB与深度特征,提升对道路上小型、意外障碍物的检测精度。该方法在Cityscapes数据集上实现22 FPS全分辨率推理时mIoU达72.5%,在速度与精度上均优于当前最先进的RGB-D模型,同时通过多数据集训练增强了对意外障碍物检测的鲁棒性。
Semantic segmentation has made striking progress due to the success of deep convolutional neural networks. Considering the demands of autonomous driving, real-time semantic segmentation has become a research hotspot these years. However, few real-time RGB-D fusion semantic segmentation studies are carried out despite readily accessible depth information nowadays. In this paper, we propose a real-time fusion semantic segmentation network termed RFNet that effectively exploits complementary cross-modal information. Building on an efficient network architecture, RFNet is capable of running swiftly, which satisfies autonomous vehicles applications. Multi-dataset training is leveraged to incorporate unexpected small obstacle detection, enriching the recognizable classes required to face unforeseen hazards in the real world. A comprehensive set of experiments demonstrates the effectiveness of our framework. On Cityscapes, Our method outperforms previous state-of-the-art semantic segmenters, with excellent accuracy and 22Hz inference speed at the full 2048x1024 resolution, outperforming most existing RGB-D networks.
研究动机与目标
- 开发一种适用于自动驾驶应用的实时、高精度RGB-D语义分割框架。
- 解决仅依靠RGB难以识别的小型、意外道路障碍物(如碎片、石块、砖块)的检测挑战。
- 有效整合深度信息以提升分割精度,尤其针对无纹理或模糊的物体(如井盖、涂鸦)。
- 通过多源训练扩展语义分割能力,超越预定义类别,实现对意外障碍物的检测。
- 在不损失精度的前提下实现高推理速度(全分辨率下22 FPS),支持实时自动驾驶系统部署。
提出的方法
- RFNet采用双流编码器架构,分别通过RGB与深度分支提取模态特异性特征。
- 自适应特征拼接(AFC)模块在多尺度上动态融合RGB与深度特征,充分利用两种模态的互补信息。
- 通过Cityscapes与Lost and Found数据集的联合训练,实现对标准数据集中未包含的小型意外障碍物的检测。
- 在主干网络中集成深度流,增强轮廓与空间理解能力,提升对纹理模糊物体的分割性能。
- 采用端到端训练,使用交叉熵损失函数,并通过高效卷积模块与轻量化设计优化推理速度。
- 通过模型量化加速推理,并在单张NVIDIA GTX 2080Ti GPU上部署,实现2048×1024分辨率下22 FPS的推理速度。
实验结果
研究问题
- RQ1实时RGB-D融合网络是否能在道路图像上实现优于纯RGB方法的语义分割精度?
- RQ2深度信息在提升对视觉上模糊的小型意外障碍物(如碎片、石块)检测效果方面有多显著?
- RQ3多数据集训练在多大程度上增强了模型对标准数据集中未包含的未知危险的泛化能力?
- RQ4融合网络是否能在保持SOTA精度的同时,实现≥20 FPS的高推理速度(如Cityscapes基准数据集)?
- RQ5所提出的AFC模块是否能有效利用RGB与深度流的互补特征,从而提升分割性能?
主要发现
- RFNet在Cityscapes验证集上达到72.5%的平均交并比(mIoU),优于此前最先进的RGB-D方法。
- 在单张NVIDIA GTX 2080Ti GPU上,RFNet以22.2 FPS的速度处理全分辨率Cityscapes图像(2048×1024),超过大多数现有RGB-D网络的推理速度。
- RFNet显著提升了小型障碍物检测精度,相较于纯RGB模型SwiftNet,对井盖与涂鸦的误报率明显降低。
- AFC模块通过有效结合RGB与深度特征,增强了特征表示能力,可视化结果表明其生成的特征图更清晰、更准确。
- 多数据集训练使模型能够检测标准数据集中未定义的小型意外障碍物,显著增强了其在真实场景中的鲁棒性。
- 定性结果表明,RFNet在道路轮廓与物体边界等对深度敏感的区域,生成的分割掩码更加一致且精确。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。