[论文解读] Semi-supervision semantic segmentation with uncertainty-guided self cross supervision
本文提出了一种基于不确定性的自交叉监督(USCS),这是一种新颖的半监督语义分割方法,采用多输入多输出(MIMO)模型实现高效的自交叉监督,使参数量减少40.5%,乘加操作量(MACs)减少49.1%。通过利用不确定性估计抑制训练过程中的噪声伪标签,进一步提升了性能,在仅使用1/8标注数据的情况下,实现了PASCAL VOC 2012数据集上的最先进mIoU表现。
As a powerful way of realizing semi-supervised segmentation, the cross supervision method learns cross consistency based on independent ensemble models using abundant unlabeled images. However, the wrong pseudo labeling information generated by cross supervision would confuse the training process and negatively affect the effectiveness of the segmentation model. Besides, the training process of ensemble models in such methods also multiplies the cost of computation resources and decreases the training efficiency. To solve these problems, we propose a novel cross supervision method, namely uncertainty-guided self cross supervision (USCS). In addition to ensemble models, we first design a multi-input multi-output (MIMO) segmentation model which can generate multiple outputs with shared model and consequently impose consistency over the outputs, saving the cost on parameters and calculations. On the other hand, we employ uncertainty as guided information to encourage the model to focus on the high confident regions of pseudo labels and mitigate the effects of wrong pseudo labeling in self cross supervision, improving the performance of the segmentation model. Extensive experiments show that our method achieves state-of-the-art performance while saving 40.5% and 49.1% cost on parameters and calculations.
研究动机与目标
- 解决现有自交叉监督方法在半监督语义分割中计算成本高和噪声传播的问题。
- 通过用单一MIMO架构替代多个独立模型,降低自交叉监督中集成模型的训练成本。
- 通过利用预测不确定性作为置信度感知的监督信号,提升模型对噪声伪标签的鲁棒性。
- 在显著降低资源消耗的前提下,实现半监督语义分割的最先进性能。
提出的方法
- 提出一种多输入多输出(MIMO)分割模型,通过一次前向传播生成多个预测结果,实现无需训练多个独立模型的高效自交叉监督。
- 通过强制MIMO模型输出之间的一致性来实现自交叉监督,替代传统中不同集成模型之间的交叉监督。
- 引入基于不确定性的学习机制,利用不确定性图对伪标签监督进行加权,降低低置信度、噪声预测的影响。
- 采用可学习的不确定性阈值γ,在训练过程中动态抑制伪标签中高不确定性区域的影响。
- 采用网格混合与特征融合策略,提升MIMO子网络的多样性与性能。
- 通过输入重复概率ρ平衡模型容量与子网络独立性,优化多样性与性能之间的权衡。
实验结果
研究问题
- RQ1多输入多输出(MIMO)架构能否在半监督语义分割的自交叉监督中有效替代集成模型,同时降低计算成本?
- RQ2不确定性估计如何提升伪标签监督在半监督学习中的鲁棒性?
- RQ3在基于MIMO的自交叉监督框架中,子网络多样性与模型容量之间应如何实现最优平衡?
- RQ4基于不确定性的学习机制如何缓解噪声伪标签对模型收敛的负面影响?
- RQ5所提出方法在多大程度上能降低训练成本,同时保持或提升分割精度?
主要发现
- 在PASCAL VOC 2012数据集的1/8标注数据协议下,该方法实现了74.88%的最先进mIoU,优于先前的SOTA方法。
- 与标准的交叉监督方法相比,该方法将模型参数量减少了40.5%,MACs减少了49.1%,显著提升了训练效率。
- 在使用ResNet-50时,基于不确定性的学习相比基线CPS方法性能提升了1.23% mIoU,且无额外计算成本。
- 最优不确定性阈值γ被确定为0.5,此时性能达到峰值,随后因过度抑制高置信度预测而开始下降。
- 输入重复概率ρ = 0.4在子网络多样性与模型容量之间实现了最佳权衡,带来峰值性能。
- 使用块大小g=1的网格混合特征融合优于求和操作及更大网格尺寸,实现了最高的mIoU与非重叠率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。