[论文解读] A Projected Gradient Descent Method for CRF Inference allowing End-To-End Training of Arbitrary Pairwise Potentials
本文提出了一种用于CRF推理的投影梯度下降方法,可在深度学习流水线中实现任意非参数化成对势函数的端到端训练。通过将CRF推理集成为可微分层,该框架学习了空间和高维双边滤波器,其性能超越了标准高斯势函数,在NYUv2和Cityscapes基准上实现了最先进水平。
Are we using the right potential functions in the Conditional Random Field models that are popular in the Vision community? Semantic segmentation and other pixel-level labelling tasks have made significant progress recently due to the deep learning paradigm. However, most state-of-the-art structured prediction methods also include a random field model with a hand-crafted Gaussian potential to model spatial priors, label consistencies and feature-based image conditioning. In this paper, we challenge this view by developing a new inference and learning framework which can learn pairwise CRF potentials restricted only by their dependence on the image pixel values and the size of the support. Both standard spatial and high-dimensional bilateral kernels are considered. Our framework is based on the observation that CRF inference can be achieved via projected gradient descent and consequently, can easily be integrated in deep neural networks to allow for end-to-end training. It is empirically demonstrated that such learned potentials can improve segmentation accuracy and that certain label class interactions are indeed better modelled by a non-Gaussian potential. In addition, we compare our inference method to the commonly used mean-field algorithm. Our framework is evaluated on several public benchmarks for semantic segmentation with improved performance compared to previous state-of-the-art CNN+CRF models.
研究动机与目标
- 解决在语义分割中使用的CRF成对势函数依赖手工设计高斯势函数的局限性。
- 实现深度神经网络中任意非参数化成对势函数的端到端训练。
- 开发一种与反向传播兼容的可微分CRF推理方法,以实现联合优化。
- 通过实证验证,所学习的势函数能够比标准高斯势函数更好地建模复杂的标签交互关系。
- 在公开基准数据集上展示所提出框架在分割精度上的提升。
提出的方法
- 该方法将CRF推理形式化为一个约束优化问题,通过投影梯度下降最小化Gibbs能量。
- 将优化过程展开为深度神经网络中的可微分层,从而支持通过推理步骤进行反向传播。
- 成对势函数被参数化为空间滤波器或依赖于图像像素值和相对位置的高维双边滤波器。
- 该框架支持任意势函数形状,包括非高斯和非对称滤波器,通过梯度下降进行学习。
- 与变分推理中通过最小化KL散度不同,该方法通过直接最小化能量避免使用平均场近似。
- 该方法被集成到CNN(如FCN-8s、LRR)中,并使用标准反向传播进行端到端训练。
实验结果
研究问题
- RQ1CRF中的非参数化、学习得到的成对势函数是否能在语义分割中超越标准高斯势函数?
- RQ2通过可微分推理实现CRF势函数的端到端训练是否能提升分割精度?
- RQ3所提出的投影梯度下降方法是否能在推理质量上优于平均场近似?
- RQ4所学习的势函数是否能捕捉复杂的标签交互关系,例如交通标志中的垂直边缘偏好?
- RQ5该框架在大规模数据集(如Cityscapes和NYUv2)上是否具备可扩展性和有效性?
主要发现
- 所提出的CRF-Grad层在NYUv2数据集上提升了平均交并比(mIoU),定性结果表明其在保留形状方面表现更优,尤其在悬挂物体(如画作)上效果显著。
- 在Cityscapes数据集中,CRF-Grad层将“交通灯”类别的IoU从66.8%提升至68.1%,表明其在定位细长垂直结构方面具有改进。
- 所学习的空间滤波器呈现出非高斯形状,例如椭圆形结构更偏好垂直边缘,表明其学习到了几何一致性偏好。
- 该框架在NYUv2和Cityscapes上均达到了最先进性能,与基线LRR模型相比,在19个类别中有14个类别实现了性能提升或持平。
- 在能量最小化和分割质量方面,该方法优于平均场推理,且无需KL散度近似。
- 该框架成功学习了高维双边滤波器和空间滤波器,表明在深度学习流水线中可有效优化任意势函数形状。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。