Skip to main content
QUICK REVIEW

[论文解读] Learning Noise-Aware Encoder-Decoder from Noisy Labels by Alternating Back-Propagation for Saliency Detection

Jing Zhang, Jianwen Xie|arXiv (Cornell University)|Jul 23, 2020
Visual Attention and Saliency Detection参考文献 57被引用 6
一句话总结

本文提出一种噪声感知的编码器-解码器框架,能够从由无监督手工特征方法生成的噪声标签中解耦出干净的显著性图。通过使用交替反向传播与朗之万动力学进行推理,并引入边缘感知平滑正则化,该模型学习到一个鲁棒的显著性预测器,在基准数据集上的表现优于弱监督和变分推理基线方法。

ABSTRACT

In this paper, we propose a noise-aware encoder-decoder framework to disentangle a clean saliency predictor from noisy training examples, where the noisy labels are generated by unsupervised handcrafted feature-based methods. The proposed model consists of two sub-models parameterized by neural networks: (1) a saliency predictor that maps input images to clean saliency maps, and (2) a noise generator, which is a latent variable model that produces noises from Gaussian latent vectors. The whole model that represents noisy labels is a sum of the two sub-models. The goal of training the model is to estimate the parameters of both sub-models, and simultaneously infer the corresponding latent vector of each noisy label. We propose to train the model by using an alternating back-propagation (ABP) algorithm, which alternates the following two steps: (1) learning back-propagation for estimating the parameters of two sub-models by gradient ascent, and (2) inferential back-propagation for inferring the latent vectors of training noisy examples by Langevin Dynamics. To prevent the network from converging to trivial solutions, we utilize an edge-aware smoothness loss to regularize hidden saliency maps to have similar structures as their corresponding images. Experimental results on several benchmark datasets indicate the effectiveness of the proposed model.

研究动机与目标

  • 解决仅能获得噪声性弱监督标签时,训练高精度显著性检测模型的挑战。
  • 克服现有方法假设噪声为高斯分布或依赖近似后验分布的变分推理所带来的局限性。
  • 构建一种灵活的深度隐变量模型,利用基于神经网络的生成器将干净显著性与结构化噪声分离。
  • 通过引入边缘感知平滑正则化,提升泛化能力与鲁棒性,防止模型收敛至平凡解。
  • 在低资源标注场景下验证方法的有效性,包括每张图像仅有一个噪声标签以及存在不完美人工标注标签的情形。

提出的方法

  • 将每个噪声标签建模为由编码器-解码器网络预测的干净显著性图与通过神经网络从高斯隐向量生成的噪声图之和。
  • 采用交替反向传播(ABP)进行模型训练,该方法在模型参数的梯度上升与隐向量后验推断的朗之万动力学之间交替进行。
  • 利用朗之万动力学从难以计算的后验分布 $ p(Z|Y,X) $ 中进行采样,从而实现无需变分近似的精确最大似然估计。
  • 引入边缘感知平滑损失,以正则化预测的显著性图,使其与输入图像保持结构一致性。
  • 将学习目标表述为最大化观测数据的对数似然,梯度通过马尔可夫链蒙特卡洛(MCMC)采样结果的经验平均计算得出。
  • 通过允许噪声生成器学习零噪声,使模型能够以干净标签作为特殊情况参与训练,从而证明其对标签不完美性的鲁棒性。

实验结果

研究问题

  • RQ1深度隐变量模型能否有效解耦由无监督基于特征的方法生成的噪声标签中的干净显著性?
  • RQ2与变分推理相比,结合朗之万动力学的交替反向传播是否能更优地学习噪声感知的显著性预测器?
  • RQ3所提出方法对每张图像中噪声标签数量与质量变化的鲁棒性如何?
  • RQ4边缘感知平滑正则化在多大程度上可防止模型收敛至平凡解?
  • RQ5即使标注标签不完美,该模型是否仍能泛化至干净标签?

主要发现

  • 所提出的基于ABP的方法在性能上显著优于条件变分自编码器(cVAE),在基准数据集上的F-measure与平均绝对误差指标上均展现出显著差距。
  • 即使仅使用每张图像一个噪声标签进行训练,模型仍保持强劲性能,证明其对标签数量与质量的鲁棒性。
  • 在基于RBD、MR和GS的噪声标签上,结果一致优于原始无监督方法,其中 $ f $-RBD、$ f $-MR 和 $ f $-GS 分别优于 RBD、MR 和 GS。
  • 当在 DUTS 数据集的干净标签上进行训练时,模型($ f^* $)的性能优于标准编码器-解码器模型($ f_1^* $),证明即使在干净标签设置下,噪声建模仍具价值。
  • 边缘感知平滑损失有效防止模型收敛至平凡解,表现为预测显著性图与输入图像之间具有良好的结构一致性。
  • 模型对干净标签具有良好的泛化能力,表明实际中人工标注标签仍存在“噪声”,而本方法的噪声处理机制依然有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。