[论文解读] HS3: Learning with Proper Task Complexity in Hierarchically Supervised Semantic Segmentation
HS3 为语义分割提出了一种分层监督方案,通过将语义类别聚类为逐渐缩小的集合,使任务复杂度适应每个中间层的表征能力。通过在这些简化复杂度的任务上进行训练,并利用 HS3-Fuse 融合分层特征,该方法在 Cityscapes 和 NYUD-v2 上实现了最先进性能,且推理无额外开销,优于深度监督和人工聚类方法。
While deeply supervised networks are common in recent literature, they typically impose the same learning objective on all transitional layers despite their varying representation powers. In this paper, we propose Hierarchically Supervised Semantic Segmentation (HS3), a training scheme that supervises intermediate layers in a segmentation network to learn meaningful representations by varying task complexity. To enforce a consistent performance vs. complexity trade-off throughout the network, we derive various sets of class clusters to supervise each transitional layer of the network. Furthermore, we devise a fusion framework, HS3-Fuse, to aggregate the hierarchical features generated by these layers, which can provide rich semantic contexts and further enhance the final segmentation. Extensive experiments show that our proposed HS3 scheme considerably outperforms vanilla deep supervision with no added inference cost. Our proposed HS3-Fuse framework further improves segmentation predictions and achieves state-of-the-art results on two large segmentation benchmarks: NYUD-v2 and Cityscapes.
研究动机与目标
- 为解决深度监督的局限性,即在所有中间层施加相同且高复杂度的任务,尽管其表征能力各不相同。
- 通过将监督任务复杂度与实际学习能力相匹配,使中间层能够学习到更有意义的特征。
- 提出一种系统性方法,基于基线训练阶段的混淆矩阵,自动确定各层最优的类别聚类数量。
- 设计一种特征融合框架 HS3-Fuse,利用受监督层的分层特征来丰富最终预测结果。
- 证明通过合理设置监督任务复杂度,可在不增加推理成本的前提下提升分割精度。
提出的方法
- 该方法采用两步训练流程:首先,训练一个深度监督基线模型以收集混淆矩阵;其次,利用这些矩阵基于相似性对类别进行分层聚类。
- 一个权衡参数 θ 控制性能与复杂度之间的平衡,最优 θ 通过经验分析得出,以匹配每层的实际能力。
- 类别聚类的构建方式为:早期层接受更少、更粗粒度的类别监督,而深层则处理更复杂、更细粒度的分割任务。
- HS3-Fuse 框架采用轻量级 OCR 模块处理每个受监督中间层的特征,然后将它们融合,以引入分层语义上下文信息,丰富最终预测结果。
- 该方法在混淆矩阵上使用谱聚类,避免依赖类别嵌入,因此适用于不包含 OCR 模块的网络。
- 最终模型在训练阶段集成分层监督与特征融合,推理阶段无额外开销,保持高效。
实验结果
研究问题
- RQ1通过将监督任务复杂度适配到中间层的表征能力,是否能使其学习到更有意义的表征?
- RQ2在分割网络的每个中间层中,性能与任务复杂度之间的最优权衡是什么?
- RQ3使用自动推导的类别聚类进行分层监督,与人工聚类或标准深度监督相比表现如何?
- RQ4一种利用多个受监督层分层特征的融合框架,能否进一步提升分割精度?
- RQ5通过自适应监督与特征融合,是否可能在不增加推理成本的前提下实现最先进性能?
主要发现
- 在 NYUD-v2 上,HS3 使用 HRNetv2-w18-OCR 达到 41.8% 的 mIoU,最优权衡参数 θ = 80°,并使用所提出的自动方法达到近似最优的 41.7% mIoU(θ = 76°)。
- 在 Cityscapes 上,HS3 使用谱聚类实现 78.1% mIoU,优于深度监督(77.7%)和人工聚类(77.9%)。
- HS3-Fuse 框架在 Cityscapes 上实现 85.7% mIoU 和 71.7% iIoU,创下实时基准上的新 SOTA 记录。
- 谱聚类优于人工分配,且与 k-means 表现相当,同时仅需混淆矩阵而非类别嵌入,增强了方法的泛化能力。
- 消融实验表明,任务过于复杂(θ = 0°)或过于简单(θ = 90°)均会降低性能,验证了任务复杂度平衡的重要性。
- 该方法在不增加推理成本的前提下提升了分割精度,因为融合与监督仅在训练阶段集成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。