Skip to main content
QUICK REVIEW

[论文解读] The Devil is in the Decoder: Classification, Regression and GANs

Zbigniew Wojna, Vittorio Ferrari|arXiv (Cornell University)|Jul 18, 2017
Advanced Image Processing Techniques参考文献 42被引用 9
一句话总结

本文研究了在计算机视觉的像素级预测任务中,解码器架构的影响,提出了一种新颖的双线性加性上采样层和残差连接,显著提升了性能并减少了伪影。结果表明,解码器的选择在分类、回归和基于生成对抗网络(GAN)的生成任务中具有决定性影响,其中双线性加性上采样在准确性和伪影减少方面优于其他方法。

ABSTRACT

Many machine vision applications, such as semantic segmentation and depth prediction, require predictions for every pixel of the input image. Models for such problems usually consist of encoders which decrease spatial resolution while learning a high-dimensional representation, followed by decoders who recover the original input resolution and result in low-dimensional predictions. While encoders have been studied rigorously, relatively few studies address the decoder side. This paper presents an extensive comparison of a variety of decoders for a variety of pixel-wise tasks ranging from classification, regression to synthesis. Our contributions are: (1) Decoders matter: we observe significant variance in results between different types of decoders on various problems. (2) We introduce new residual-like connections for decoders. (3) We introduce a novel decoder: bilinear additive upsampling. (4) We explore prediction artifacts.

研究动机与目标

  • 系统评估不同解码器架构在多样化像素级视觉任务中的影响。
  • 识别并解决由不同上采样方法引入的性能差异和预测伪影。
  • 提出一种新型解码器组件——双线性加性上采样,以在参数效率和准确性之间取得平衡。
  • 研究残差连接在多种任务的解码器堆叠中的有效性。
  • 通过在所有实验中固定编码器,实现公平比较,从而隔离解码器设计的影响。

提出的方法

  • 提出一种名为双线性加性上采样的新型上采样层,通过将双线性插值与可学习的残差连接结合,以改善特征重建。
  • 引入专为解码器架构设计的残差连接,以改善梯度流动,并在所有任务中实现性能提升。
  • 在所有实验中使用固定的编码器(ResNet-50),以确保对解码器组件的公平比较。
  • 评估多种解码器变体:转置卷积、深度到空间(depth-to-space)、最近邻、双线性以及不同残差和跳跃连接组合的双线性上采样。
  • 在2700万个像素三元组的深度回归任务中,开展关于伪影生成的消融研究,测量预测误差和视觉伪影。
  • 在七个任务中进行受控实验:语义分割、边缘检测、关键点估计、深度预测、图像着色、超分辨率以及基于GAN的图像生成。

实验结果

研究问题

  • RQ1不同解码器架构如何影响语义分割、回归和图像生成等多样化像素级预测任务的性能?
  • RQ2残差连接对解码器性能和伪影减少的影响是什么?
  • RQ3在准确性和视觉伪影方面,各种上采样方法(如转置卷积、双线性、双三次)如何比较?
  • RQ4像双线性加性上采样这样的新型上采样机制是否能在多个任务中持续优于现有方法?
  • RQ5预测伪影(如棋盘状伪影或模糊)在不同解码器类型之间的差异程度如何?

主要发现

  • 解码器对性能有显著影响:转置卷积和深度到空间解码器产生的伪影更多,性能也劣于双线性变体。
  • 所提出的双线性加性上采样层在引入残差连接后,语义分割的mIoU达到17.5%,深度预测的mIoU达到18.4%,优于其他双线性变体。
  • 残差连接在所有解码器类型中均提升性能,减少伪影,并在某些任务中使mIoU提升高达2.7个百分点。
  • 双线性上采样变体产生的伪影显著少于转置卷积和深度到空间方法,在深度回归中误差率为14.7%至15.2%,而转置变体为19.5%。
  • 最近邻和双三次上采样性能相近,其中双三次在基于GAN的图像生成中略优(FID:28.1 vs. 29.8),但差异较小。
  • 双线性加性上采样方法在准确性和伪影抑制之间实现了最佳平衡,因此推荐用于大多数像素级预测任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。