[论文解读] Agile Amulet: Real-Time Salient Object Detection with Contextual Attention
本文提出 Agile Amulet,一种轻量化、实时显著性目标检测框架,通过上下文注意力模块引导特征学习,并采用新颖的多级特征聚合方法,有效降低模型大小与计算量。该方法实现 30 fps 推理速度、67 MB 模型大小,并在七个基准测试中达到最先进性能,同时在速度与准确率上优于先前方法。
This paper proposes an Agile Aggregating Multi-Level feaTure framework (Agile Amulet) for salient object detection. The Agile Amulet builds on previous works to predict saliency maps using multi-level convolutional features. Compared to previous works, Agile Amulet employs some key innovations to improve training and testing speed while also increase prediction accuracy. More specifically, we first introduce a contextual attention module that can rapidly highlight most salient objects or regions with contextual pyramids. Thus, it effectively guides the learning of low-layer convolutional features and tells the backbone network where to look. The contextual attention module is a fully convolutional mechanism that simultaneously learns complementary features and predicts saliency scores at each pixel. In addition, we propose a novel method to aggregate multi-level deep convolutional features. As a result, we are able to use the integrated side-output features of pre-trained convolutional networks alone, which significantly reduces the model parameters leading to a model size of 67 MB, about half of Amulet. Compared to other deep learning based saliency methods, Agile Amulet is of much lighter-weight, runs faster (30 fps in real-time) and achieves higher performance on seven public benchmarks in terms of both quantitative and qualitative evaluation.
研究动机与目标
- 解决现有基于深度学习的显著性检测方法计算成本高、推理速度慢的问题,尤其是在资源受限设备上的表现。
- 在保持或提升检测准确率的同时,降低模型复杂度与参数数量。
- 通过注意力引导的监督机制加速特征学习,提升训练效率。
- 实现在标准 GPU 上的实时推理(30 fps),甚至在 CPU 上实现 3.51 fps,使方法可部署于真实应用场景。
- 开发一种轻量化框架,在不依赖复杂冗余架构的前提下,保持在多样化基准上的高性能。
提出的方法
- 引入一种上下文注意力模块,从特征图和先前预测结果中生成多尺度上下文金字塔,以突出显著区域。
- 采用自顶向下的注意力机制,通过聚焦于与目标相关的区域,引导低层卷积特征的学习。
- 采用一种新颖的迭代特征聚合方法,仅使用预训练主干网络(如 VGG-16)的侧输出特征,无需额外的融合模块。
- 通过递归预测逐步优化显著性图,提升结果的一致性与性能,优于单步预测。
- 设计一种全卷积、端到端可训练的架构,可在任意 CNN 层之间集成注意力与聚合模块。
- 直接利用预训练特征,减少可学习参数数量,从而实现更快的训练与推理速度。
实验结果
研究问题
- RQ1上下文注意力机制是否能通过引导深层网络中的特征学习,提升显著性目标检测的效率与准确率?
- RQ2能否通过简化多级特征聚合方式,在不损失性能的前提下减少模型大小与计算量?
- RQ3仅使用预训练主干网络的侧输出特征,是否能实现更快的训练与推理速度,同时保持最先进准确率?
- RQ4所提方法是否能在标准硬件上实现实时推理(≥30 fps),并优于现有方法?
- RQ5与自底向上或单尺度注意力相比,自顶向下注意力与上下文金字塔的结合如何影响检测性能?
主要发现
- Agile Amulet 在单张 GPU 上实现 30.2 fps 的推理速度,显著优于 Amulet(15.4 fps)与 DSS(2.1 fps),支持实时部署。
- 模型大小降低至 67 MB——约为 Amulet(126 MB)的一半——主要得益于高效的特征聚合机制,避免引入额外参数。
- 在七个公开基准上,Agile Amulet 达到最先进性能,F-measure 分数分别为:ECSSD 0.887、HKU-IS 0.861、PASCAL-S 0.794,超越先前方法。
- 训练时间从 Amulet 的 107 小时缩短至 22 小时,提速约 5 倍,主要归因于注意力模块加速了与目标相关的特征学习。
- 消融实验表明,结合上下文金字塔的自顶向下注意力使性能相比基线提升 4%,而自底向上注意力则无改善。
- 使用 ResNet-50 作为主干网络可进一步提升准确率(ECSSD 上 F-measure 达 0.912),证明该方法与更强特征的兼容性与可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。