Skip to main content
QUICK REVIEW

[论文解读] Dense Transformer Networks

Li Jun, Yongjun Chen|arXiv (Cornell University)|May 24, 2017
Advanced Neural Network Applications参考文献 27被引用 15
一句话总结

本文提出了一种新型端到端可训练架构——密集变换器网络(Dense Transformer Networks, DTN),通过在编码器和解码器路径中使用非线性空间变换器,学习数据相关的块状区域形状与大小,用于密集预测任务。通过学习自适应感受野,并利用可微分解码层恢复空间对应关系,DTN 在图像分割基准上实现了最先进性能,仅带来轻微的推理时间增加。

ABSTRACT

The key idea of current deep learning methods for dense prediction is to apply a model on a regular patch centered on each pixel to make pixel-wise predictions. These methods are limited in the sense that the patches are determined by network architecture instead of learned from data. In this work, we propose the dense transformer networks, which can learn the shapes and sizes of patches from data. The dense transformer networks employ an encoder-decoder architecture, and a pair of dense transformer modules are inserted into each of the encoder and decoder paths. The novelty of this work is that we provide technical solutions for learning the shapes and sizes of patches from data and efficiently restoring the spatial correspondence required for dense prediction. The proposed dense transformer modules are differentiable, thus the entire network can be trained. We apply the proposed networks on natural and biological image segmentation tasks and show superior performance is achieved in comparison to baseline methods.

研究动机与目标

  • 解决现有深度学习模型在密集预测任务中固定且规则的感受野所带来的局限性。
  • 实现在推理过程中基于数据驱动的方式学习每个像素上下文的块大小与形状。
  • 在使用非线性空间变换时,保持输入图像与输出标签图之间的空间对应关系。
  • 开发一种可微分的、端到端可训练的框架,将空间变换器整合到编码器-解码器架构中。
  • 与U-Net等基线模型相比,展示在自然图像与生物图像分割任务中的性能提升。

提出的方法

  • 在编码器和解码器路径中引入密集变换器模块,采用非线性空间变换(如薄板样条)以学习不规则且自适应的块状区域形状。
  • 在编码器中应用空间变换器层,将特征图映射到变换空间,使卷积与池化操作在原始空间中的不规则块上进行。
  • 开发一种新型可微分解码层,执行逆变换与插值操作,以恢复输入与输出特征网格之间的空间对应关系。
  • 在解码器中采用基于插值的采样方法,将变换后的特征位置映射回规则的输出网格,确保像素级对齐。
  • 采用端到端训练策略,通过编码器与解码器组件的反向传播进行联合优化。
  • 将密集变换器模块集成到类似U-Net的编码器-解码器框架中,用于分割任务。

实验结果

研究问题

  • RQ1深度学习模型能否学习到最优的、与数据相关的块状区域形状与大小,以替代依赖固定且规则感受野的模式?
  • RQ2在密集预测网络中使用非线性空间变换时,如何保持输入图像与输出标签图之间的空间对应关系?
  • RQ3可微分且可学习的空间变换器模块能否有效集成到编码器与解码器路径中,以实现端到端训练?
  • RQ4使用自适应感受野是否能提升在具有挑战性的自然图像与生物电镜图像数据集上的分割精度?
  • RQ5引入可学习空间变换在训练与推理时间上的计算开销如何?

主要发现

  • 所提出的密集变换器网络(DTN)在SNEMI3D脑电镜图像分割任务中取得了0.8953的AUC,优于基线U-Net模型(0.8676 AUC)。
  • 在PASCAL VOC 2012数据集上,DTN的分割性能优于U-Net,定性结果表明边界预测更加准确。
  • 在PASCAL数据集上,添加DTN模块使训练时间仅增加6.1%,在SNEMI3D上增加10.7%;推理时间分别增加13.2%与9.1%。
  • 该方法通过一种新型基于插值的解码层成功保持了空间对应关系,即使在非线性变换下也能实现精确的像素级预测。
  • 该模型在不同领域间表现出良好的泛化能力,在自然图像与复杂生物电镜图像上均取得了改进结果。
  • 消融实验确认,所学习的感受野具有自适应性与数据依赖性,不同图像区域的块形状各不相同。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。