Skip to main content
QUICK REVIEW

[论文解读] RGB-D Saliency Detection via Cascaded Mutual Information Minimization

Jing Zhang, Deng-Ping Fan|arXiv (Cornell University)|Sep 15, 2021
Visual Attention and Saliency Detection参考文献 50被引用 8
一句话总结

本文提出了一种用于RGB-D显著性检测的级联多阶段学习框架,通过最小化其特征之间的互信息,显式建模RGB与深度模态之间的互补信息。通过在每个阶段应用互信息最小化作为正则化项,该模型减少了冗余并增强了特征多样性,在基准数据集上实现了最先进性能,并引入了最大的RGB-D显著性数据集COME15K,其包含多样化的注释,适用于完全监督、弱监督和无监督学习。

ABSTRACT

Existing RGB-D saliency detection models do not explicitly encourage RGB and depth to achieve effective multi-modal learning. In this paper, we introduce a novel multi-stage cascaded learning framework via mutual information minimization to "explicitly" model the multi-modal information between RGB image and depth data. Specifically, we first map the feature of each mode to a lower dimensional feature vector, and adopt mutual information minimization as a regularizer to reduce the redundancy between appearance features from RGB and geometric features from depth. We then perform multi-stage cascaded learning to impose the mutual information minimization constraint at every stage of the network. Extensive experiments on benchmark RGB-D saliency datasets illustrate the effectiveness of our framework. Further, to prosper the development of this field, we contribute the largest (7x larger than NJU2K) dataset, which contains 15,625 image pairs with high quality polygon-/scribble-/object-/instance-/rank-level annotations. Based on these rich labels, we additionally construct four new benchmarks with strong baselines and observe some interesting phenomena, which can motivate future model design. Source code and dataset are available at "https://github.com/JingZhang617/cascaded_rgbd_sod".

研究动机与目标

  • 为解决现有RGB-D显著性检测模型中对RGB与深度模态之间互补信息缺乏显式建模的问题。
  • 克服隐式融合策略无法约束模态间冗余的局限性。
  • 提供一个大规模、多样化且丰富注释的数据集,以支持RGB-D显著性模型的稳健训练与评估。
  • 为完全监督、弱监督和半监督RGB-D显著性检测建立新基准。

提出的方法

  • 提出一种多阶段级联学习框架,其中在每个阶段应用互信息最小化作为正则化项,以减少RGB与深度特征之间的冗余。
  • 将各模态(RGB与深度)的特征映射到低维向量,并最小化其互信息,以促进互补学习。
  • 采用共享编码器-解码器架构,结合模态特定的编码器与跨注意力融合模块,在保留模态特异性表征的同时整合特征。
  • 通过对比学习目标实现互信息最小化,以促进外观特征与几何特征之间的解耦。
  • 通过从Holo50K重新标注构建新数据集COME15K,包含15,625对图像,具有多边形、涂鸦、实例、物体及排序级别的注释。
  • 为四种新基准建立基准:标准、立体视觉、涂鸦/多边形监督以及半监督学习,每项均设有强基线模型。

实验结果

研究问题

  • RQ1在级联深度学习框架中,互信息最小化能否有效减少RGB与深度特征之间的冗余?
  • RQ2通过互信息最小化显式建模互补信息,相较于隐式融合策略,性能提升程度如何?
  • RQ3像COME15K这样大规模、多样化且多级注释的RGB-D数据集,在多大程度上提升了模型泛化能力与基准评估效果?
  • RQ4所提出的框架是否能在极少架构修改下泛化至弱监督和立体视觉显著性检测任务?

主要发现

  • 所提出的级联互信息最小化框架在标准RGB-D显著性检测基准上实现了最先进性能,在COME15K-Normal与COME15K-Difficult测试集上均优于现有方法。
  • 最先进模型在新COME15K数据集上的性能差距,证明了该数据集在评估模型鲁棒性与泛化能力方面的有效性。
  • 在COME15K上训练的立体视觉显著性检测基线模型在困难测试集上达到$F_{\beta}$为0.812,表明该数据集在隐式几何建模方面的潜力。
  • 涂鸦监督基线模型达到$S_{\alpha}$为0.855,多边形监督基线模型达到0.861,表明更丰富的监督可提升预测结果的结构一致性。
  • COME15K中包含的5,000张未标注图像支持了有效的半监督学习,为未来自监督与弱监督学习研究提供了支持。
  • 分析表明,现有数据集存在多样性低、场景重复等问题,而COME15K通过显著更多样化且高质量的数据缓解了这一问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。