[论文解读] EfficientSeg: An Efficient Semantic Segmentation Network
该论文提出 EfficientSeg,一种基于 U-Net 的可扩展语义分割网络,采用 MobileNetV3 模块以实现在少量数据上从零开始高效训练。通过结合深度缩放与针对性的纹理不变数据增强,其在 Minicity 数据集上达到 58.1% 的 mIoU,较 U-Net 提升 18.1 个百分点,同时保持相近的参数量。
Deep neural network training without pre-trained weights and few data is shown to need more training iterations. It is also known that, deeper models are more successful than their shallow counterparts for semantic segmentation task. Thus, we introduce EfficientSeg architecture, a modified and scalable version of U-Net, which can be efficiently trained despite its depth. We evaluated EfficientSeg architecture on Minicity dataset and outperformed U-Net baseline score (40% mIoU) using the same parameter count (51.5% mIoU). Our most successful model obtained 58.1% mIoU score and got the fourth place in semantic segmentation track of ECCV 2020 VIPriors challenge.
研究动机与目标
- 解决在缺乏预训练权重时,从少量数据中从零开始训练深层语义分割网络的挑战。
- 开发一种可扩展、内存与计算效率高的架构,在监督信息有限的情况下仍保持高性能。
- 探究在低数据环境下,数据增强与网络深度对模型性能的影响。
- 在不依赖 ImageNet 预训练的情况下,实现在 Minicity 数据集上的优异 mIoU 分数。
- 证明在数据稀缺场景下,有效的数据增强可超越简单的深度缩放。
提出的方法
- 设计一种改进的 U-Net 架构,采用 MobileNetV3 模块作为主干网络,以提升效率与表达能力。
- 实现深度缩放机制,生成不同深度的网络变体(如 EfficientSeg-1.5 和 EfficientSeg-6.0)。
- 采用类别特定权重的加权交叉熵损失(常见稀有类别为 2,极稀有类别为 3),以缓解类别不平衡问题。
- 应用全面的数据增强策略,包括随机色调/亮度缩放(0.4–1.6)、JPEG 压缩、非均匀缩放、随机旋转(±20°)及水平翻转。
- 通过平均原始图像与翻转图像的预测结果,应用测试时增强以提升鲁棒性。
- 使用 Adam 优化器配合余弦退火学习率调度,将初始学习率(1e-3)在第 200 和第 400 个周期时分别降低 10 倍。
实验结果
研究问题
- RQ1能否在小规模数据集上从零开始有效训练深层语义分割网络,而无需使用 ImageNet 预训练权重?
- RQ2在低数据分割场景中,数据增强在多大程度上可减少对预训练的依赖?
- RQ3在从零开始训练且数据有限的情况下,增加网络深度对性能的影响如何?
- RQ4与标准 U-Net 模块相比,MobileNetV3 模块是否能提供更好的模型容量与效率权衡?
- RQ5在少样本学习设置中,是否存在数据增强带来的性能增益超过增加模型深度的临界点?
主要发现
- 使用完整增强策略训练的 EfficientSeg (1.5) 在 Minicity 测试集上达到 51.5% 的 mIoU,较基线 U-Net 提升 11.5 个百分点。
- 性能最佳的模型 EfficientSeg (6.0) 达到 58.1% 的 mIoU,在 ECCV 2020 VIPriors 语义分割挑战赛中位列第 4。
- 若无数据增强,即使更深的 EfficientSeg (6.0) 模型也仅达到 47.6% 的 mIoU,表明数据增强的影响大于深度缩放。
- 模型在稀有类别(如 'train')上表现优异(无增强时为 0.002,有增强时也为 0.002),表明类别平衡训练与增强策略具有显著优势。
- 消融实验表明,纹理不变的数据增强(色调、亮度、JPEG 压缩)对性能的提升作用大于增加网络深度。
- 测试时翻转增强了最终预测,平均原始图像与翻转图像的预测结果所得 mIoU 优于单次前向传播。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。