Skip to main content
QUICK REVIEW

[论文解读] Constrained Structured Regression with Convolutional Neural Networks

Deepak Pathak, Philipp Krähenbühl|arXiv (Cornell University)|Nov 23, 2015
Generative Adversarial Networks and Image Synthesis参考文献 1被引用 8
一句话总结

本文提出了一种使用卷积神经网络的约束结构化回归框架,该框架同时建模输出分布与约束满足概率,从而在结构化回归任务中实现更准确且感知一致的预测。通过同时学习输出与约束的置信度,该方法在MPI Sintel数据集上的固有图像分解任务中显著提升性能,相较最先进方法实现10–20%的相对改进。

ABSTRACT

Convolutional Neural Networks (CNNs) have recently emerged as the dominant model in computer vision. If provided with enough training data, they predict almost any visual quantity. In a discrete setting, such as classification, CNNs are not only able to predict a label but often predict a confidence in the form of a probability distribution over the output space. In continuous regression tasks, such a probability estimate is often lacking. We present a regression framework which models the output distribution of neural networks. This output distribution allows us to infer the most likely labeling following a set of physical or modeling constraints. These constraints capture the intricate interplay between different input and output variables, and complement the output of a CNN. However, they may not hold everywhere. Our setup further allows to learn a confidence with which a constraint holds, in the form of a distribution of the constrain satisfaction. We evaluate our approach on the problem of intrinsic image decomposition, and show that constrained structured regression significantly increases the state-of-the-art.

研究动机与目标

  • 为解决标准CNN在结构化回归任务中的局限性,即独立处理输出而无法建模物理或建模约束。
  • 通过引入基于物理的约束,重新建立反照率与阴影之间的依赖关系,以提升固有图像分解的性能。
  • 不仅学习预测输出的分布,还学习约束成立的置信度,从而实现更鲁棒的推理。
  • 通过在推理过程中利用约束满足情况,而非事后强制约束,实现更好的泛化能力与视觉质量。

提出的方法

  • 该框架训练CNN以预测输出变量(如固有图像分解中的反照率与阴影)的完整概率分布。
  • 同时学习物理约束(如朗伯定律)满足程度的概率分布,以建模约束有效性的不确定性。
  • 在推理阶段,模型从输出分布中采样,同时强制采用最可能满足约束的配置,采用结构化预测方法。
  • 该方法使用可微分损失函数,同时鼓励输出预测的准确性与约束满足的一致性,实现端到端学习。
  • 采用变分近似方法建模输出与约束的联合分布,从而实现高效的训练与推理。
  • 该方法具有通用性,可适用于其他结构化回归任务,如单目深度估计与光流预测。

实验结果

研究问题

  • RQ1同时建模输出预测与约束满足的不确定性,是否能提升计算机视觉任务中结构化回归的性能?
  • RQ2与严格强制约束相比,学习约束满足的概率分布,如何提升预测准确率与视觉质量?
  • RQ3当训练数据有限时,CNN通过可学习的约束置信度引入先验物理知识,其收益程度如何?
  • RQ4所提出的框架是否在固有图像分解任务中优于标准CNN与现有结构化预测方法,特别是在泛化到未见场景时?
  • RQ5该方法是否仅使用RGB输入即可实现最先进性能,而无需深度监督或其他额外监督?

主要发现

  • 在MPI Sintel数据集上,该方法相较先前最先进方法,平均MSE相对提升13.76%,平均LMSE提升12.10%,平均DSSIM提升17.08%。
  • 该模型在场景划分上实现1.89%的平均MSE与1.24%的平均LMSE,优于所有先前方法,包括使用深度监督的方法。
  • 视觉对比显示,该方法在仅使用RGB输入的前提下,仍能产生比Narihira等人(2015a)更细致准确的结果。
  • 框架显著提升了感知质量,DSSIM提升17.08%的相对增益表明与真实值的结构相似性更好。
  • 学习约束满足置信度的性能优于简单强制约束的方法,后者在除DSSIM外的所有指标上均导致性能下降。
  • 该方法在未见场景上泛化能力出色,在独立训练/测试场景划分上表现强劲,证实对分布偏移具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。