Skip to main content
QUICK REVIEW

[论文解读] Tree Energy Loss: Towards Sparsely Annotated Semantic Segmentation

Zhiyuan Liang, Tiancai Wang|arXiv (Cornell University)|Mar 21, 2022
Advanced Neural Network Applications被引用 4
一句话总结

本文提出树能量损失(Tree Energy Loss, TEL),一种用于稀疏标注语义分割的新损失函数,利用最小生成树(MST)建模低层次(颜色)和高层次(特征)亲和力,实现动态、自粗到精的未标注像素软伪标签生成。TEL 在无需多阶段训练、额外数据或后处理的情况下,在点标注、草图标注和块标注设置下均达到最先进性能,mIoU 最高提升 7.3%。

ABSTRACT

Sparsely annotated semantic segmentation (SASS) aims to train a segmentation network with coarse-grained (i.e., point-, scribble-, and block-wise) supervisions, where only a small proportion of pixels are labeled in each image. In this paper, we propose a novel tree energy loss for SASS by providing semantic guidance for unlabeled pixels. The tree energy loss represents images as minimum spanning trees to model both low-level and high-level pair-wise affinities. By sequentially applying these affinities to the network prediction, soft pseudo labels for unlabeled pixels are generated in a coarse-to-fine manner, achieving dynamic online self-training. The tree energy loss is effective and easy to be incorporated into existing frameworks by combining it with a traditional segmentation loss. Compared with previous SASS methods, our method requires no multistage training strategies, alternating optimization procedures, additional supervised data, or time-consuming post-processing while outperforming them in all SASS settings. Code is available at https://github.com/megvii-research/TreeEnergyLoss.

研究动机与目标

  • 解决使用极少标注(如点、草图或块)训练高精度语义分割模型的挑战。
  • 克服现有SASS方法的局限,包括依赖辅助任务、耗时的提议生成,或不一致的正则化与一致性学习。
  • 提供一个统一的端到端框架,实现无需交替优化或外部监督的未标注像素动态在线自训练。
  • 引入块标注设置,以更好地评估和分级不同标注稀疏程度下的性能表现。

提出的方法

  • 从图像颜色(RGB)和深度CNN特征中分别构建两个最小生成树(MST),以分别建模低层次和高层次像素亲和力。
  • 利用MST结构通过迭代移除高差异性边来保留关键像素关系,确保亲和力矩阵的结构一致性。
  • 通过沿MST路径累积边权重生成亲和力矩阵,捕捉局部与全局上下文关系。
  • 应用级联过滤机制:首先利用低层次亲和力精炼预测,再通过高层次亲和力进一步精炼,生成逐步更准确的软伪标签。
  • 在单阶段训练设置中将树能量损失与标准交叉熵分割损失结合,实现在线自训练。
  • 通过极少修改即可将TEL集成到现有分割网络中,实现即插即用且计算高效。

实验结果

研究问题

  • RQ1最小生成树能否有效建模低层次与高层次亲和力,以指导稀疏语义分割中的伪标签生成?
  • RQ2基于MST亲和力的级联式、自粗到精的伪标签精炼是否优于并行或顺序替代方案,从而提升分割性能?
  • RQ3TEL是否能在无需多阶段训练、额外监督数据或复杂后处理的情况下实现最先进性能?
  • RQ4所提出的块标注设置与点标注和草图标注设置相比,在评估SASS方法时有何优势?

主要发现

  • TEL在所有SASS设置(点标注、草图标注和块标注)下均达到最先进性能,且无需多阶段训练或外部数据。
  • 在Pascal VOC 2012数据集上,TEL在训练过程中使mIoU相比基线提升7.3%,表明从未标注数据中实现了强大的知识蒸馏。
  • 与基于非局部模块的高层次亲和力相比,该方法mIoU高出1.7%,证明其在特征级亲和力建模方面更具优势。
  • 级联聚合策略(LH-C)优于并行及其他级联变体,证实了自粗到精逐步精炼预测的优越性。
  • 超参数敏感性分析表明,λ = 0.4 和 σ = 0.02 时性能最优,且对σ值变化不敏感。
  • 伪标签精度在训练初期即超过网络预测精度,表明自监督机制有效且可靠。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。