[论文解读] Hierarchical Dynamic Filtering Network for RGB-D Salient Object Detection
本文提出了一种用于RGB-D显著性目标检测的分层动态滤波网络(HDFNet),引入了一种动态空洞金字塔模块,可从融合的RGB-深度特征中自适应生成多尺度滤波器,以增强跨模态特征学习。该方法在八个基准数据集上六项指标中均达到最先进性能,推理速度达52 FPS,模型大小为170 MB,使用VGG16作为骨干网络。
The main purpose of RGB-D salient object detection (SOD) is how to better integrate and utilize cross-modal fusion information. In this paper, we explore these issues from a new perspective. We integrate the features of different modalities through densely connected structures and use their mixed features to generate dynamic filters with receptive fields of different sizes. In the end, we implement a kind of more flexible and efficient multi-scale cross-modal feature processing, i.e. dynamic dilated pyramid module. In order to make the predictions have sharper edges and consistent saliency regions, we design a hybrid enhanced loss function to further optimize the results. This loss function is also validated to be effective in the single-modal RGB SOD task. In terms of six metrics, the proposed method outperforms the existing twelve methods on eight challenging benchmark datasets. A large number of experiments verify the effectiveness of the proposed module and loss function. Our code, model and results are available at \url{https://github.com/lartpang/HDFNet}.
研究动机与目标
- 解决在杂乱或低对比度场景中有效融合跨模态RGB与深度特征的挑战。
- 克服固定参数卷积操作导致泛化能力下降及密集预测任务中梯度更新次优的问题。
- 通过设计一种新型混合增强损失函数,提升边界清晰度与显著区域一致性。
- 通过由融合特征生成的动态、区域感知滤波器,实现灵活的多尺度特征处理。
- 在计算开销极小的前提下实现高性能,支持在标准硬件上实时推理。
提出的方法
- 提出一种分层动态滤波机制,其中混合的RGB-深度特征生成具有不同感受野的动态卷积核。
- 实现动态空洞金字塔模块(DDPM),通过自适应滤波引导多尺度空洞卷积,以提升特征表示能力。
- 采用密集连接聚合不同模态和阶段的特征,增强特征复用与梯度流动。
- 设计一种混合增强损失(HEL),鼓励边缘邻近区域与内部显著区域之间的一致性,从而提升边界精度。
- 采用标准损失与HEL相结合的方式进行网络训练,结果表明该方法在单模态(RGB)和多模态(RGB-D)设置下均有效。
- 采用基于VGG16的编码器-解码器架构,并引入跳跃连接,以保留空间细节并支持高分辨率输出。
实验结果
研究问题
- RQ1如何使RGB与深度特征之间的跨模态融合更加自适应且高效,以提升显著性目标检测性能?
- RQ2由融合特征生成的动态卷积滤波器是否能提升多尺度特征学习能力与预测精度?
- RQ3一种促进边缘一致性与显著区域完整性的混合增强损失函数,是否能在不增加参数量的前提下实现更清晰的预测?
- RQ4所提方法是否能在保持实时推理速度与紧凑模型尺寸的同时实现最先进性能?
- RQ5该混合增强损失在RGB-D设置之外是否同样有效,特别是在单模态RGB显著性目标检测中?
主要发现
- 所提出的HDFNet在八个基准数据集上六项评估指标(包括$F_{max}$、$F_{ada}$、$F^{eta}_{\text{weighted}}$、MAE、$S_{m}$和$E_{m}$)中均达到最优性能。
- 在DUT-OMRON数据集上,HDFNet的$F_{max}$达到0.926,$F_{ada}$为0.892,$E_{m}$为0.937,优于所有12种对比的SOTA方法。
- 模型在NVIDIA GTX 1080 Ti GPU上实现52 FPS的实时推理速度,模型大小约为170 MB。
- 消融实验表明,混合增强损失(HEL)显著提升了边界清晰度与区域一致性,应用HEL后MAE降低0.009,$F_{max}$最高提升0.015。
- 与静态或固定感受野基线相比,动态空洞金字塔模块(DDPM)使$F_{max}$和$E_{m}$提升1.5–2.5%。
- HEL在单模态RGB SOD中也得到验证,证明其在RGB-D设置之外具有良好的泛化能力,在多个数据集上均实现一致性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。