Skip to main content
QUICK REVIEW

[论文解读] Generalized Deep Image to Image Regression

Venkataraman Santhanam, Vlad I. Morariu|arXiv (Cornell University)|Dec 10, 2016
Generative Adversarial Networks and Image Synthesis参考文献 55被引用 4
一句话总结

本文提出递归分支去卷积网络(RBDN),一种全卷积、端到端可训练的深度神经网络,用于通用图像到图像回归。通过使用可学习上采样与参数共享的递归分支,RBDN在网络早期阶段构建了低成本、丰富的多上下文表征,从而在无需任务特定修改或后处理的情况下,在重光照、去噪和着色等多样化任务中实现优异性能。

ABSTRACT

We present a Deep Convolutional Neural Network architecture which serves as a generic image-to-image regressor that can be trained end-to-end without any further machinery. Our proposed architecture: the Recursively Branched Deconvolutional Network (RBDN) develops a cheap multi-context image representation very early on using an efficient recursive branching scheme with extensive parameter sharing and learnable upsampling. This multi-context representation is subjected to a highly non-linear locality preserving transformation by the remainder of our network comprising of a series of convolutions/deconvolutions without any spatial downsampling. The RBDN architecture is fully convolutional and can handle variable sized images during inference. We provide qualitative/quantitative results on $3$ diverse tasks: relighting, denoising and colorization and show that our proposed RBDN architecture obtains comparable results to the state-of-the-art on each of these tasks when used off-the-shelf without any post processing or task-specific architectural modifications.

研究动机与目标

  • 解决现有图像到图像回归任务中缺乏一种通用、任务无关的深度学习架构的问题,该架构能在多样化任务中表现良好。
  • 通过构建多尺度、早期上下文表征,克服现有图像到图像网络中固有的局部性-上下文权衡问题。
  • 设计一种全卷积网络,能够处理可变尺寸输入,且在不同任务间无需架构修改。
  • 证明单一、即插即用的架构可在多个独立的图像到图像回归任务中实现具有竞争力的性能。

提出的方法

  • 采用递归分支结构结合可学习上采样,在网络早期生成多尺度特征,实现高效的多上下文表征。
  • 在各分支间广泛共享参数,以降低模型复杂度,同时保持丰富的特征表示能力。
  • 通过在共享池化层处融合所有递归分支的输出,构建复合多上下文特征图。
  • 将复合表征通过9层全卷积层堆叠处理,不进行空间下采样,以保留局部性并施加强非线性变换。
  • 使用标准反向传播方法端到端训练整个网络,损失函数根据任务类型选择(例如,去噪任务使用MSE,着色任务使用交叉熵)。
  • 在所有任务中采用固定深度架构,不使用残差连接,以评估递归分支相对于深度的优越性。

实验结果

研究问题

  • RQ1单一通用深度网络架构是否能在无需任务特定架构修改的情况下,在多样化图像到图像回归任务中实现最先进性能?
  • RQ2通过分支结构与可学习上采样实现的早期递归多上下文特征学习,是否能有效缓解图像到图像网络中的局部性-上下文权衡问题?
  • RQ3全卷积、端到端可训练网络是否能够处理可变尺寸输入,并在不同图像到图像任务间实现良好泛化?
  • RQ4浅层、递归分支网络在去噪和重光照等任务中的性能,与更深的残差网络(如DnCNN)相比如何?
  • RQ5在颜色着色等模糊任务中,损失函数的选择(如MSE与交叉熵)在多大程度上影响输出的感知质量?

主要发现

  • 三分支RBDN在验证集上实现了近乎完美的重光照效果,表现出强大的泛化能力与对光照变化的鲁棒性。
  • 在噪声水平σ=25至σ=55之间,三分支RBDN的去噪性能优于DnCNN,尽管其深度更浅(9层 vs. 18层)且无残差连接。
  • RBDN在高噪声水平(σ=55)下仍表现出色,该水平超出其训练分布,表明其具备强大的泛化能力。
  • 在颜色着色任务中,采用Softmax交叉熵损失的RBDN-Lab模型生成了更饱和、更符合感知的图像结果,有效克服了传统MSE模型的色彩饱和度不足问题。
  • 尽管架构更简单,RBDN-Lab模型在颜色着色任务中的性能与先前工作中的更复杂线性空洞卷积网络相当。
  • 在无需任何后处理或架构调优的情况下,RBDN在所有三项任务——重光照、去噪和颜色着色——中均表现出与最先进模型相当的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。