[论文解读] Tree Energy Loss: Towards Sparsely Annotated Semantic Segmentation
本文提出树能量损失(Tree Energy Loss, TEL),一种用于稀疏标注语义分割的新损失函数,利用最小生成树(MST)建模低层次(颜色)和高层次(特征)亲和力,实现动态、自粗到精的未标注像素软伪标签生成。TEL 在无需多阶段训练、额外数据或后处理的情况下,在点标注、草图标注和块标注设置下均达到最先进性能,mIoU 最高提升 7.3%。
Sparsely annotated semantic segmentation (SASS) aims to train a segmentation network with coarse-grained (i.e., point-, scribble-, and block-wise) supervisions, where only a small proportion of pixels are labeled in each image. In this paper, we propose a novel tree energy loss for SASS by providing semantic guidance for unlabeled pixels. The tree energy loss represents images as minimum spanning trees to model both low-level and high-level pair-wise affinities. By sequentially applying these affinities to the network prediction, soft pseudo labels for unlabeled pixels are generated in a coarse-to-fine manner, achieving dynamic online self-training. The tree energy loss is effective and easy to be incorporated into existing frameworks by combining it with a traditional segmentation loss. Compared with previous SASS methods, our method requires no multistage training strategies, alternating optimization procedures, additional supervised data, or time-consuming post-processing while outperforming them in all SASS settings. Code is available at https://github.com/megvii-research/TreeEnergyLoss.
研究动机与目标
- 解决使用极少标注(如点、草图或块)训练高精度语义分割模型的挑战。
- 克服现有SASS方法的局限,包括依赖辅助任务、耗时的提议生成,或不一致的正则化与一致性学习。
- 提供一个统一的端到端框架,实现无需交替优化或外部监督的未标注像素动态在线自训练。
- 引入块标注设置,以更好地评估和分级不同标注稀疏程度下的性能表现。
提出的方法
- 从图像颜色(RGB)和深度CNN特征中分别构建两个最小生成树(MST),以分别建模低层次和高层次像素亲和力。
- 利用MST结构通过迭代移除高差异性边来保留关键像素关系,确保亲和力矩阵的结构一致性。
- 通过沿MST路径累积边权重生成亲和力矩阵,捕捉局部与全局上下文关系。
- 应用级联过滤机制:首先利用低层次亲和力精炼预测,再通过高层次亲和力进一步精炼,生成逐步更准确的软伪标签。
- 在单阶段训练设置中将树能量损失与标准交叉熵分割损失结合,实现在线自训练。
- 通过极少修改即可将TEL集成到现有分割网络中,实现即插即用且计算高效。
实验结果
研究问题
- RQ1最小生成树能否有效建模低层次与高层次亲和力,以指导稀疏语义分割中的伪标签生成?
- RQ2基于MST亲和力的级联式、自粗到精的伪标签精炼是否优于并行或顺序替代方案,从而提升分割性能?
- RQ3TEL是否能在无需多阶段训练、额外监督数据或复杂后处理的情况下实现最先进性能?
- RQ4所提出的块标注设置与点标注和草图标注设置相比,在评估SASS方法时有何优势?
主要发现
- TEL在所有SASS设置(点标注、草图标注和块标注)下均达到最先进性能,且无需多阶段训练或外部数据。
- 在Pascal VOC 2012数据集上,TEL在训练过程中使mIoU相比基线提升7.3%,表明从未标注数据中实现了强大的知识蒸馏。
- 与基于非局部模块的高层次亲和力相比,该方法mIoU高出1.7%,证明其在特征级亲和力建模方面更具优势。
- 级联聚合策略(LH-C)优于并行及其他级联变体,证实了自粗到精逐步精炼预测的优越性。
- 超参数敏感性分析表明,λ = 0.4 和 σ = 0.02 时性能最优,且对σ值变化不敏感。
- 伪标签精度在训练初期即超过网络预测精度,表明自监督机制有效且可靠。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。