[论文解读] Guided Collaborative Training for Pixel-wise Semi-Supervised Learning
本文提出了一种新型的半监督学习框架——引导协同训练(Guided Collaborative Training, GCT),用于像素级视觉任务,有效克服了密集输出预测置信度估计困难和不合适的扰动问题。GCT 通过缺陷检测器估计像素级置信度,并利用动态一致性与缺陷修正约束实现协同学习,在语义分割、图像去噪、图像抠图和夜间图像增强等任务上仅需极少的网络结构修改,即实现了最先进性能。
We investigate the generalization of semi-supervised learning (SSL) to diverse pixel-wise tasks. Although SSL methods have achieved impressive results in image classification, the performances of applying them to pixel-wise tasks are unsatisfactory due to their need for dense outputs. In addition, existing pixel-wise SSL approaches are only suitable for certain tasks as they usually require to use task-specific properties. In this paper, we present a new SSL framework, named Guided Collaborative Training (GCT), for pixel-wise tasks, with two main technical contributions. First, GCT addresses the issues caused by the dense outputs through a novel flaw detector. Second, the modules in GCT learn from unlabeled data collaboratively through two newly proposed constraints that are independent of task-specific properties. As a result, GCT can be applied to a wide range of pixel-wise tasks without structural adaptation. Our extensive experiments on four challenging vision tasks, including semantic segmentation, real image denoising, portrait image matting, and night image enhancement, show that GCT outperforms state-of-the-art SSL methods by a large margin. Our code available at: https://github.com/ZHKKKe/PixelSSL.
研究动机与目标
- 为解决现有半监督学习(SSL)方法在像素级任务中的局限性,其中密集输出导致置信度估计困难,且标准扰动方法效果不佳。
- 开发一种通用的半监督学习框架,适用于多种像素级任务,无需进行任务特定的结构修改或依赖特定属性。
- 克服回归型任务中像素级预测置信度估计困难以及密集预测设置下不可行的扰动问题。
- 通过由学习到的缺陷概率图引导的、与任务无关的约束,实现模型间的协同学习。
- 在仅使用少量标注数据的情况下,于多个具有挑战性的像素级视觉基准上实现优异性能。
提出的方法
- 引入缺陷检测器网络,生成像素级缺陷概率图以近似预测置信度,尤其在分类概率不可用的回归型任务中至关重要。
- 在两个任务模型之间施行动态一致性约束,仅对缺陷概率较低(低于阈值 ξ)的像素进行预测平均,确保可靠的共识。
- 应用缺陷修正约束,在训练过程中最小化缺陷概率图,以鼓励对不可靠预测的修正。
- 通过不同初始化的模型生成多样化预测,利用缺陷检测器的输出对可靠像素进行基于集成的优化。
- 提出一种新型训练策略,通过利用模型权重差异而非输入扰动,将 Dual Student 的扰动方法扩展至像素级任务。
- 使用 Adam 优化整个 GCT 框架,采用任务特定的超参数,包括用于缺陷修正的 λfc 和用于动态一致性的 λdc。
实验结果
研究问题
- RQ1能否设计一种统一的半监督学习框架,适用于多种像素级视觉任务,且无需依赖任务特定的结构或属性?
- RQ2在最大类别概率不可用的回归型像素级任务中,如何实现可靠的像素级预测置信度估计?
- RQ3能否为像素级 SSL 设计有效的扰动方法,以在增强输入间保持标签一致性?
- RQ4如何通过与任务特性无关的约束,使模型能够协同学习未标注数据?
- RQ5所提出的 GCT 框架相较于现有 SSL 方法,在多个像素级视觉基准上的性能增益如何?
主要发现
- GCT 在标准基准上仅使用 1/8 的标注数据,即在语义分割、真实图像去噪、人像抠图和夜间图像增强任务中达到最先进性能。
- 在 PASCAL VOC 数据集上使用 1/8 标注数据时,GCT 显著优于 Mean Teacher、S4L 和 AdvSSL,在语义分割任务中实现了更高的 mIoU。
- 在 SIDD 图像去噪数据集上,GCT 即使仅使用 1/8 的标注数据,也优于现有 SSL 方法,取得了更优的 PSNR 和 SSIM 分数。
- 在人像抠图和夜间图像增强任务中,GCT 分别仅使用 100 张和 200 张标注图像,即展现出强大的泛化能力,在定量指标和视觉质量上均优于基线方法。
- 消融实验证实,动态一致性和缺陷修正约束均不可或缺,缺陷检测器在置信度估计与错误修正中发挥关键作用。
- 该框架在不同任务间具有良好的泛化能力,仅需将任务特定模型替换即可,无需任何结构修改,充分体现了其广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。