[论文解读] A Regularized Convolutional Neural Network for Semantic Image Segmentation
本文提出了一种正则化的Softmax层,将总变差(TV)空间正则化整合到卷积神经网络(CNNs)中,用于语义图像分割。通过修改Softmax激活函数以包含TV正则化,该方法提升了边缘保持能力和对噪声的鲁棒性,在WBC、CamVid和SUN-RGBD数据集上显著优于标准CNN(如Unet和Segnet),尤其是在噪声条件下表现更优。
Convolutional neural networks (CNNs) show outstanding performance in many image processing problems, such as image recognition, object detection and image segmentation. Semantic segmentation is a very challenging task that requires recognizing, understanding what's in the image in pixel level. Though the state of the art has been greatly improved by CNNs, there is no explicit connections between prediction of neighbouring pixels. That is, spatial regularity of the segmented objects is still a problem for CNNs. In this paper, we propose a method to add spatial regularization to the segmented objects. In our method, the spatial regularization such as total variation (TV) can be easily integrated into CNN network. It can help CNN find a better local optimum and make the segmentation results more robust to noise. We apply our proposed method to Unet and Segnet, which are well established CNNs for image segmentation, and test them on WBC, CamVid and SUN-RGBD datasets, respectively. The results show that the regularized networks not only could provide better segmentation results with regularization effect than the original ones but also have certain robustness to noise.
研究动机与目标
- 解决标准CNN在语义图像分割中缺乏显式空间正则化的问题,该问题导致预测结果出现碎片化或不规则现象。
- 通过将空间正则化直接嵌入网络架构,提升分割模型对噪声的鲁棒性。
- 通过强制邻近像素间的平滑性,保持预测结果的结构一致性(例如,物体边界)。
- 实现在深度学习框架中无缝集成传统变分正则化(如TV)的方法,而无需对网络架构进行重大修改。
- 在多样化数据集上验证该方法的有效性,包括生物医学数据集(WBC)、城市场景(CamVid)和室内环境(SUN-RGBD)
提出的方法
- 提出一种正则化的Softmax层,将总变差(TV)正则化引入反向传播过程中的损失函数。
- 修改梯度计算方式,引入TV正则化项,使网络能够在保持端到端可微性的前提下学习空间平滑的预测结果。
- 将正则化的Softmax层应用于现有CNN架构(如Unet和Segnet),而无需改变其编码器-解码器结构或其他层。
- 采用邻近梯度法高效计算TV正则化Softmax的梯度,最大限度减少计算开销。
- 使用固定学习率和批量大小的标准优化方法训练改进后的网络(RUnet、RSegnet),同时保留ImageNet预训练权重以实现迁移学习。
- 在干净和噪声测试数据上,使用mIoU、准确率和重建误差(RE)评估性能
实验结果
研究问题
- RQ1将总变差(TV)正则化整合到CNN的Softmax激活中,能否提升语义分割预测的空间一致性?
- RQ2所提出的正则化是否能增强图像分割对噪声的鲁棒性,特别是在噪声或低质量输入数据中?
- RQ3RUnet和RSegnet在复杂度和噪声水平各异的多样化数据集上的表现,与原始模型相比如何?
- RQ4所提出的方法是否可应用于现有CNN架构,且仅需极少的架构修改,无需从头开始训练?
- RQ5该正则化是否能防止在具有精细结构的复杂场景中对物体边界的过度平滑?
主要发现
- 在干净的SUN-RGBD数据集上,RUnet达到27.40 mIoU,优于标准Unet的26.50 mIoU,提升0.9%。
- 在添加σ=0.09高斯噪声的SUN-RGBD数据上,RSegnet2的mIoU为21.90,而Segnet2为21.12,显示出更强的鲁棒性。
- 在盐椒噪声(1%像素受损)条件下,RSegnet2的mIoU为24.42,优于Segnet2的23.36。
- RSegnet2在干净数据上的重建误差(RE)为2.31,在高噪声数据上为3.39,显著低于Segnet2的4.84和5.40。
- RSegnet在CamVid中成功保留了远处电线杆等精细结构,而对Segnet进行后处理TV正则化则导致过度平滑,证明了网络内正则化的优势。
- 在WBC数据集中,RUnet在噪声条件下仍保持高分割质量,而标准Unet性能急剧下降,证实了所提方法的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。