Skip to main content
QUICK REVIEW

[论文解读] 3D Depthwise Convolution: Reducing Model Parameters in 3D Vision Tasks

Rongtian Ye, Fangyu Liu|arXiv (Cornell University)|Aug 5, 2018
Advanced Vision and Imaging参考文献 18被引用 4
一句话总结

本文提出3D深度可分离卷积,通过将标准3D卷积分解为深度可分离和逐点卷积操作,在3D视觉任务中显著减少模型参数量,实现高达95%的参数压缩,同时在分类和重建任务中保持与标准3D卷积相当的性能,使在资源受限条件下构建更深、更高效的3D神经网络成为可能。

ABSTRACT

Standard 3D convolution operations require much larger amounts of memory and computation cost than 2D convolution operations. The fact has hindered the development of deep neural nets in many 3D vision tasks. In this paper, we investigate the possibility of applying depthwise separable convolutions in 3D scenario and introduce the use of 3D depthwise convolution. A 3D depthwise convolution splits a single standard 3D convolution into two separate steps, which would drastically reduce the number of parameters in 3D convolutions with more than one order of magnitude. We experiment with 3D depthwise convolution on popular CNN architectures and also compare it with a similar structure called pseudo-3D convolution. The results demonstrate that, with 3D depthwise convolutions, 3D vision tasks like classification and reconstruction can be carried out with more light-weighted neural networks while still delivering comparable performances.

研究动机与目标

  • 解决标准3D卷积在3D视觉任务中计算和内存成本过高的问题。
  • 探索资源受限的3D神经网络中标准3D卷积的参数高效替代方法。
  • 提出并评估3D深度可分离卷积作为减少模型尺寸同时保持性能的方法。
  • 在分类和3D重建任务中证明3D深度可分离卷积的有效性。
  • 通过深度可分离分解降低参数数量,使更深的3D ConvNets得以应用。

提出的方法

  • 将标准3D卷积分解为两个阶段:按输入通道进行深度可分离卷积,以及跨通道的1×1×1逐点卷积。
  • 对形状为(l, w, h, c)的3D特征图应用深度可分离操作,对每个通道分别使用c个k×k×k滤波器,再通过1×1×1卷积进行融合。
  • 从数学上分析参数效率,显示相比标准3D卷积,参数量减少超过10倍。
  • 将3D深度可分离卷积与伪3D卷积(将滤波器拆分为空间和时间分量)进行比较,显示其参数量更低且性能相当。
  • 将3D深度可分离卷积集成到VGG和残差模块等标准架构中,并应用于3D重建解码器。
  • 采用基于残差模块的解码器(ResRec),结合深度可分离卷积,构建更深、更小的3D重建模型。

实验结果

研究问题

  • RQ1深度可分离卷积能否有效扩展至3D卷积操作,以减少模型参数?
  • RQ2在参数效率和性能方面,3D深度可分离卷积与伪3D卷积相比如何?
  • RQ33D深度可分离卷积能否在显著减少模型尺寸的同时,保持在3D分类和重建任务中的高性能?
  • RQ4在内存和计算资源受限条件下,使用3D深度可分离卷积是否能实现更深3D ConvNets的训练?
  • RQ5在使用参数高效卷积时,模型深度和架构设计对3D重建性能有何影响?

主要发现

  • 与标准3D卷积相比,3D深度可分离卷积在3D卷积层中将参数数量减少了高达95%,在分类任务中性能损失极小。
  • 在3D重建任务中,一个参数更少的更深3D深度可分离卷积解码器(ResRec-16 dw)优于参数更多但更浅的标准化3D卷积解码器,mIoU达到63.1。
  • ResRec-16 dw模型在使用深度可分离卷积时达到61.5 mIoU,优于标准ResRec-16(63.1 mIoU),表明其在效率与性能之间具有出色的权衡。
  • 定性结果表明,3D深度可分离卷积比伪3D卷积更好地保留了细节,后者倾向于生成更平滑但细节较少的表面。
  • 更深的3D ConvNets(如ResRec-16)显著优于更浅的模型(如3D-R2N2),即使使用相同的编码器,凸显了深度在3D视觉任务中的重要性。
  • 使用3D深度可分离卷积可在严格计算和内存约束下构建更深、更复杂的3D网络,使原本不可行的模型变为可行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。