Skip to main content
QUICK REVIEW

[论文解读] Pyramid Grafting Network for One-Stage High Resolution Saliency Detection

C. Xie, Changqun Xia|arXiv (Cornell University)|Apr 11, 2022
Visual Attention and Saliency Detection被引用 4
一句话总结

本文提出金字塔嫁接网络(PGNet),一种用于高分辨率显著性检测的一阶段框架,通过跨模型嫁接模块(CMGM)融合卷积神经网络(CNN)和视觉变换器主干网络的特征,以同时保留全局上下文和精细细节。该方法在高分辨率基准测试中达到最先进性能,包括一个全新的4K–8K数据集UHRSD,该数据集是迄今为止最大的此类数据集。

ABSTRACT

Recent salient object detection (SOD) methods based on deep neural network have achieved remarkable performance. However, most of existing SOD models designed for low-resolution input perform poorly on high-resolution images due to the contradiction between the sampling depth and the receptive field size. Aiming at resolving this contradiction, we propose a novel one-stage framework called Pyramid Grafting Network (PGNet), using transformer and CNN backbone to extract features from different resolution images independently and then graft the features from transformer branch to CNN branch. An attention-based Cross-Model Grafting Module (CMGM) is proposed to enable CNN branch to combine broken detailed information more holistically, guided by different source feature during decoding process. Moreover, we design an Attention Guided Loss (AGL) to explicitly supervise the attention matrix generated by CMGM to help the network better interact with the attention from different models. We contribute a new Ultra-High-Resolution Saliency Detection dataset UHRSD, containing 5,920 images at 4K-8K resolutions. To our knowledge, it is the largest dataset in both quantity and resolution for high-resolution SOD task, which can be used for training and testing in future research. Sufficient experiments on UHRSD and widely-used SOD datasets demonstrate that our method achieves superior performance compared to the state-of-the-art methods.

研究动机与目标

  • 为解决现有显著性检测模型在高分辨率图像上因感受野受限和细节丢失而导致的性能下降问题。
  • 克服多阶段高分辨率SOD方法的局限性,包括误差传播和高推理成本。
  • 设计一种一阶段、高效且准确的框架,有效融合CNN与视觉变换器特征,用于高分辨率显著性检测。
  • 提供一个新的大规模、高分辨率显著性检测数据集(UHRSD),以支持未来研究。

提出的方法

  • PGNet采用双分支编码器:基于ResNet的CNN分支和基于Swin Transformer的视觉变换器分支,两者独立地以全分辨率处理输入图像。
  • 跨模型嫁接模块(CMGM)通过关注视觉变换器分支的对应特征,并将这些特征在匹配的空间尺度上注入CNN分支,实现特征融合。
  • CMGM采用注意力机制引导嫁接过程,使CNN分支能够整合来自视觉变换器的全局语义线索,同时保持空间细节。
  • 引入注意力引导损失(AGL)以监督CMGM中的注意力矩阵,提升两分支之间的对齐程度和特征交互质量。
  • 网络通过标准损失与AGL的组合进行端到端训练,使用解码器最后一层的特征图进行预测。
  • 该方法在低分辨率和高分辨率基准上均进行了评估,包括新引入的UHRSD数据集,其包含5,920张4K–8K分辨率的图像。

实验结果

研究问题

  • RQ1一阶段深度学习框架能否通过融合CNN与视觉变换器特征,有效处理高分辨率显著性检测?
  • RQ2基于注意力的跨分支特征嫁接在高分辨率SOD中如何提升细节保持能力和全局上下文整合?
  • RQ3在大规模高分辨率数据集(UHRSD)上进行训练,能在多大程度上提升模型在未见高分辨率图像上的泛化能力和性能?
  • RQ4所提出的注意力引导损失是否能增强注意力对齐与跨模型嫁接中的特征融合质量?

主要发现

  • PGNet在低分辨率(DUTS-TE)和高分辨率(UHRSD-TE)基准上均达到最先进性能,在UHRSD-TE上Fβ^Max达到0.949,MAE为0.026。
  • 在UHRSD-TR与HRSOD-TR的混合数据集上进行训练,可在UHRSD-TE上取得更优性能,表明高分辨率标注有助于提升泛化能力。
  • 消融实验表明,在R5-S2特征对(CNN的残差块5与视觉变换器的阶段2)进行嫁接时性能最佳,UHRSD-TE上的Fβ^Max达到0.946。
  • 注意力引导损失(AGL)显著提升性能,相比无AGL的基线模型,UHRSD-TE上的Fβ^Max提升了0.004。
  • 可视化结果表明,PGNet能生成更清晰的边界,并更好地捕捉以往方法常遗漏的小而显著的物体。
  • UHRSD数据集包含5,920张4K–8K分辨率图像,是迄今为止最大且分辨率最高的显著性检测数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。