Skip to main content
QUICK REVIEW

[论文解读] CoSformer: Detecting Co-Salient Object with Transformers

Lv Tang, Li, Bo|arXiv (Cornell University)|Apr 30, 2021
Visual Attention and Saliency Detection参考文献 55被引用 13
一句话总结

CoSformer 提出了一种基于 Transformer 的共显著目标检测框架,通过建模对输入顺序不变的图像间关系,并引入对比学习方案以增强图像间的可分性,从而提升了模型的稳定性和性能。通过结合自注意力机制与包含二元交叉熵(BCE)、结构相似性(SSIM)和 F-measure 损失的多损失优化,该方法在 CoCA、CoSOD3k 和 Cosal2015 基准测试中取得了最先进(SOTA)的性能表现。

ABSTRACT

Co-Salient Object Detection (CoSOD) aims at simulating the human visual system to discover the common and salient objects from a group of relevant images. Recent methods typically develop sophisticated deep learning based models have greatly improved the performance of CoSOD task. But there are still two major drawbacks that need to be further addressed, 1) sub-optimal inter-image relationship modeling; 2) lacking consideration of inter-image separability. In this paper, we propose the Co-Salient Object Detection Transformer (CoSformer) network to capture both salient and common visual patterns from multiple images. By leveraging Transformer architecture, the proposed method address the influence of the input orders and greatly improve the stability of the CoSOD task. We also introduce a novel concept of inter-image separability. We construct a contrast learning scheme to modeling the inter-image separability and learn more discriminative embedding space to distinguish true common objects from noisy objects. Extensive experiments on three challenging benchmarks, i.e., CoCA, CoSOD3k, and Cosal2015, demonstrate that our CoSformer outperforms cutting-edge models and achieves the new state-of-the-art. We hope that CoSformer can motivate future research for more visual co-analysis tasks.

研究动机与目标

  • 为解决现有共显著目标检测(CoSOD)方法在序列建模中因输入图像顺序依赖性导致的不稳定性问题。
  • 通过建模图像间的可分性,提升真实共显著目标与噪声干扰物之间的判别能力。
  • 开发一种统一的端到端框架,通过注意力机制联合优化图像内显著性与图像间一致性。
  • 通过多损失优化提升预测显著图的边界精度和结构细节。

提出的方法

  • 采用基于 Transformer 的架构,并引入一种新型的 Token-Guided Learning(TGL)模块,以排列不变的方式建模图像间的相互关系。
  • 提出一种对比学习损失,将共显著区域视为正样本对,非共显著区域视为负样本对,以提升嵌入空间的可分性。
  • 采用双分支设计:一个分支用于图像内显著性(像素级注意力),另一个分支用于图像间一致性(图像级注意力)。
  • 通过 BCE、SSIM 和 F-measure 损失的多任务监督,优化边界细节并提升整体分割质量。
  • 在 TGL 模块中避免使用位置编码,以保持顺序不变性,防止群体表征学习的不稳定性。
  • 利用自注意力机制计算所有图像之间的成对相似性,实现长距离依赖建模与稳定的群体表征学习。

实验结果

研究问题

  • RQ1基于 Transformer 的架构是否能提升 CoSOD 模型在不同输入图像顺序下的稳定性?
  • RQ2通过对比学习建模图像间可分性,是否能有效提升真实共显著目标与噪声干扰物之间的判别能力?
  • RQ3通过自注意力机制联合优化图像内显著性与图像间一致性,是否能带来更优的分割性能?
  • RQ4辅助损失(SSIM、F-measure)在多大程度上提升了共显著目标检测中的边界精度?

主要发现

  • CoSformer 在三个主要基准测试(CoCA、CoSOD3k 和 Cosal2015)中均取得了最先进性能,优于现有方法。
  • 模型在相同图像组的 10 种不同随机输入顺序下均保持一致的性能表现,证明了其强大的顺序不变性。
  • 在 TGL 模块中添加位置编码会显著 destabilize 模型,证实仅当不使用位置编码时,才能保持顺序不变性。
  • 消融实验表明,结合 BCE、SSIM 和 F-measure 损失的性能优于仅使用 BCE 损失。
  • 与基于 RNN 的(RCAN)和基于 CNN 的(ICNet)基线模型相比,CoSformer 在输入重排下表现出显著更稳定的推理性能。
  • 对比学习方案能有效将真实共显著目标与干扰物分离,这在复杂真实场景中表现出了性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。