[论文解读] Top-Down Learning for Structured Labeling with Convolutional Pseudoprior
本文提出卷积伪先验(Convolutional Pseudoprior, ConvPP),一种用于结构化标注的自顶向下学习方法,通过直接从真实标签学习卷积核,以建模短程和长程上下文依赖关系。通过使用伪似然近似的固定点网络结构,ConvPP 实现了端到端训练,并在语义分割和场景标注基准上取得了最先进性能,优于 FCN、CRF-RNN 和 BoxSup 模型。
Current practice in convolutional neural networks (CNN) remains largely bottom-up and the role of top-down process in CNN for pattern analysis and visual inference is not very clear. In this paper, we propose a new method for structured labeling by developing convolutional pseudo-prior (ConvPP) on the ground-truth labels. Our method has several interesting properties: (1) compared with classical machine learning algorithms like CRFs and Structural SVM, ConvPP automatically learns rich convolutional kernels to capture both short- and long- range contexts; (2) compared with cascade classifiers like Auto-Context, ConvPP avoids the iterative steps of learning a series of discriminative classifiers and automatically learns contextual configurations; (3) compared with recent efforts combing CNN models with CRFs and RNNs, ConvPP learns convolution in the labeling space with much improved modeling capability and less manual specification; (4) compared with Bayesian models like MRFs, ConvPP capitalizes on the rich representation power of convolution by automatically learning priors built on convolutional filters. We accomplish our task using pseudo-likelihood approximation to the prior under a novel fixed-point network structure that facilitates an end-to-end learning process. We show state-of-the-art results on sequential labeling and image labeling benchmarks.
研究动机与目标
- 解决自底向上卷积神经网络在建模结构化预测中长程标签依赖关系方面的局限性。
- 克服条件随机场(CRFs)、马尔可夫随机场(MRFs)和循环神经网络(RNNs)在捕捉上下文标签配置时所需的高计算成本和人工指定问题。
- 在标签空间中通过深度卷积网络实现结构化先验的端到端学习,无需迭代分类器级联。
- 通过在真实标签图上使用卷积滤波器学习丰富且数据驱动的先验,提升结构化标注的建模能力。
提出的方法
- 提出一种卷积伪先验(ConvPP),直接从真实标签图学习卷积核,以建模上下文标签依赖关系。
- 采用新颖的固定点网络结构,通过伪似然近似来逼近先验,从而实现端到端训练。
- 使用多尺度特征融合(例如,pool5、pool4、pool3)以捕捉细粒度和全局上下文信息。
- 应用环形滤波器(donut-shaped filters)与稀疏连接,以学习复杂标签上下文模式,如“猫在床上”或“食物-盘子-桌子”。
- 将 ConvPP 集成到全卷积网络(FCN)框架中,实现自底向上特征与自顶向下先验的联合调优。
- 在推理阶段采用迭代推理,利用上下文先验逐步优化预测,模拟人类自顶向下的推理方式。
实验结果
研究问题
- RQ1深度学习模型能否在无需人工指定的情况下,直接从真实标签中学习结构化先验?
- RQ2标签空间中的卷积核在建模短程和长程标签依赖关系方面效果如何?
- RQ3与自底向上的卷积神经网络相比,自顶向下伪先验的端到端学习是否能提升结构化标注任务的性能?
- RQ4所提出的固定点网络结合伪似然近似是否能实现结构化先验的稳定且有效的训练?
- RQ5多尺度上下文融合对 ConvPP 模型在语义分割和场景标注任务上的性能有何影响?
主要发现
- 在 SIFT Flow 数据集上,ConvPP-8s 达到 40.7% 的平均交并比(mIoU),比 FCN-8s 基线高出 1.2%。
- 在 Pascal-Context 数据集上,ConvPP-8s 达到 74.2% 的 mIoU,超过 FCN-8s 基线以及 CRF-RNN 和 BoxSup 等最先进模型。
- 多尺度上下文融合带来一致性能提升,其中 ConvPP-8s(pool5+pool4+pool3)优于 ConvPP-16s(pool5+pool4)和 ConvPP-32s(pool5)。
- 可视化结果表明,学习到的环形滤波器能够检测复杂标签配置,如“猫在草地上”和“食物-盘子-桌子”。
- 推理阶段的迭代推断逐步优化预测结果,证明了模型利用上下文先验抑制错误标签的能力。
- 自底向上与自顶向下组件的联合调优带来微小性能增益,表明 ConvPP 组件是性能提升的主要来源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。