[论文解读] Structured Modeling of Joint Deep Feature and Prediction Refinement for Salient Object Detection
本文提出一种深度统一CRF模型,通过级联条件随机场与端到端反向传播,联合优化多尺度CNN特征与显著性预测。通过在不同尺度间实现特征到特征、特征到预测以及预测到预测的消息传递,该模型实现了最先进性能,在ECSSD数据集上达到0.928的F-measure,优于使用后处理CRF或独立消息传递机制的先前方法。
Recent saliency models extensively explore to incorporate multi-scale contextual information from Convolutional Neural Networks (CNNs). Besides direct fusion strategies, many approaches introduce message-passing to enhance CNN features or predictions. However, the messages are mainly transmitted in two ways, by feature-to-feature passing, and by prediction-to-prediction passing. In this paper, we add message-passing between features and predictions and propose a deep unified CRF saliency model . We design a novel cascade CRFs architecture with CNN to jointly refine deep features and predictions at each scale and progressively compute a final refined saliency map. We formulate the CRF graphical model that involves message-passing of feature-feature, feature-prediction, and prediction-prediction, from the coarse scale to the finer scale, to update the features and the corresponding predictions. Also, we formulate the mean-field updates for joint end-to-end model training with CNN through back propagation. The proposed deep unified CRF saliency model is evaluated over six datasets and shows highly competitive performance among the state of the arts.
研究动机与目标
- 为解决现有显著性模型仅执行特征到特征或预测到预测消息传递的局限性,通过在特征与预测之间引入跨模态消息传递。
- 通过结构化消息传递增强深层特征与预测之间的相互依赖性,以提升模型训练效率与表征质量。
- 开发一种统一的CRF框架,通过平均场近似联合建模特征与预测,实现与CNN端到端联合训练。
- 通过从粗到细的多尺度表征逐步优化,实现显著目标检测的最先进性能。
提出的方法
- 设计级联CRF架构,其中某一尺度的CRF模块将前一尺度的特征与预测作为观测变量,以推断当前尺度的优化特征与预测。
- 引入三种类型的消息传递:特征到特征、特征到预测、预测到预测,均在统一的CRF图模型中形式化。
- 采用平均场近似进行CRF推理,以支持与CNN主干网络联合优化的可微分、端到端反向传播训练。
- 采用分层的、从粗到细的级联流程,逐步优化显著图,从低层特征与预测开始,逐级向上优化。
- 将CRF模块集成到基于CNN的显著性检测框架中,实现CNN与CRF参数的联合优化。
- 在CRF中使用高斯核作为成对势函数,参数在各尺度间共享,并在反向传播过程中进行优化。
实验结果
研究问题
- RQ1特征与预测之间的联合消息传递是否能超越孤立的特征或预测优化,进一步提升显著性检测性能?
- RQ2整合特征-预测交互是否能提升深度显著性模型的训练效率与表征质量?
- RQ3一种能联合建模特征与预测的统一CRF框架,是否能优于后处理CRF或独立优化模块的性能?
- RQ4特征到预测与预测到特征的消息传递的引入,对端到端训练的收敛性与稳定性有何影响?
主要发现
- 所提出的深度统一CRF模型在ECSSD数据集上达到0.928的F-measure,显著优于基线模型(0.884)以及DSS (+) 和MSR等最先进模型。
- 仅添加特征到预测的消息传递,即可使F-measure从0.884提升至0.904,证明其在提升特征质量方面的有效性。
- 通过反向传播联合训练CRF,当仅使用预测到预测消息时,预测图的F-measure从基线+CRF的0.899提升至0.921。
- 包含全部三种消息传递类型(特征-特征、特征-预测、预测-预测)的完整模型达到最高性能,证实跨模态优化的优越性。
- 采用特征-预测消息传递的训练过程能更快速降低训练损失,表明其提升了训练效率与优化动态。
- 该模型每张图像推理时间约为0.48秒,与采用后处理Dense-CRF的DSS模型相当,表明其推理开销极低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。