Skip to main content
QUICK REVIEW

[论文解读] CMA-Net: A Cascaded Mutual Attention Network for Light Field Salient Object Detection

Yi Zhang, Lu Zhang|arXiv (Cornell University)|May 3, 2021
Visual Attention and Saliency Detection参考文献 51被引用 4
一句话总结

CMA-Net 提出了一种级联互注意力网络,通过融合全景致(AiF)图像和深度图中的高层特征,实现光场显著性物体检测,其在两个基准数据集上达到最先进性能,同时保持了 53 fps 的高推理速度,优于 30 种现有的 SOD 方法。

ABSTRACT

In the past few years, numerous deep learning methods have been proposed to address the task of segmenting salient objects from RGB images. However, these approaches depending on single modality fail to achieve the state-of-the-art performance on widely used light field salient object detection (SOD) datasets, which collect large-scale natural images and provide multiple modalities such as multi-view, micro-lens images and depth maps. Most recently proposed light field SOD methods have acquired improving detecting accuracy, yet still predict rough objects' structures and perform slow inference speed. To this end, we propose CMA-Net, which consists of two novel cascaded mutual attention modules aiming at fusing the high level features from the modalities of all-in-focus and depth. Our proposed CMA-Net outperforms 30 SOD methods on two widely applied light field benchmark datasets. Besides, the proposed CMA-Net is able to inference at the speed of 53 fps. Extensive quantitative and qualitative experiments illustrate both the effectiveness and efficiency of our CMA-Net.

研究动机与目标

  • 解决单模态 RGB SOD 方法在处理具有多种模态的复杂光场数据时的局限性。
  • 克服传统注意力机制在融合全景致图像和深度图的多模态特征时的低效性。
  • 开发一种快速且准确的深度学习框架用于光场 SOD,避免处理低层特征和聚焦堆栈。
  • 证明互注意力在高层特征融合中的有效性,以及深度信息在光场 SOD 中的必要性。

提出的方法

  • 提出一种新颖的互注意力机制,实现在高层特征层面全景致(AiF)图像与深度图之间的跨模态特征优化。
  • 设计一种级联结构,包含两个顺序排列的互注意力模块,以逐步融合并解码来自 AiF 和深度模态的特征。
  • 构建一个双分支编码器,使用共享主干网络处理 AiF 和深度输入,并在解码阶段引入级联注意力模块。
  • 避免处理聚焦堆栈或低层特征,降低计算成本,实现高速推理。
  • 将互注意力模块设计为可插拔组件,可嵌入其他网络以实现多模态融合。
  • 采用多尺度监督和损失函数(包括 Fβ、Sα、Eϕ 和 M)进行训练,以优化精确率、召回率和结构对齐。

实验结果

研究问题

  • RQ1互注意力机制能否有效融合全景致图像和深度图的高层特征,从而提升光场 SOD 性能?
  • RQ2互注意力模块的级联设计是否优于单个或并行注意力模块?
  • RQ3所提方法能否在保持高推理速度的同时实现最先进性能,尤其是相较于基于聚焦堆栈的方法?
  • RQ4深度信息是否对实现光场 SOD 的优越性能至关重要?若缺失,检测质量会受到何种影响?
  • RQ5CMA-Net 在 DUT-LF 和 HFUT 等多样化光场数据集上是否具备良好的泛化能力?

主要发现

  • 在 DUT-LF 和 HFUT 两个数据集上,CMA-Net 在四项指标上均优于 30 种最先进 SOD 方法:在 DUT-LF 上,Fβ 为 0.917,Sα 为 0.918,Eϕ 为 0.949,M 为 0.033。
  • 在 HFUT 数据集上,CMA-Net 的 Fβ 为 0.744,Sα 为 0.807,Eϕ 为 0.865,M 为 0.069,全面超越所有基线模型。
  • 模型实现 53 fps 的推理速度,显著快于性能最佳的 ERNetT(14 fps),展现出极高效率。
  • 消融实验证实,深度信息可显著提升性能,其中含深度信息的 Model-2 明显优于无深度信息的 Model-1。
  • 级联两个互注意力模块可获得最佳性能,Model-4(在第 2 和第 3 级使用一个模块)与 CMA-Net(完整级联)均表现出逐步提升。
  • F/E-测量曲线显示,CMA-Net 在所有阈值(τ ∈ [0,255])下均持续优于所有基线,表明其具备强鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。