Skip to main content
QUICK REVIEW

[论文解读] Blurring the Line Between Structure and Learning to Optimize and Adapt Receptive Fields

Evan Shelhamer, Dequan Wang|arXiv (Cornell University)|Apr 25, 2019
Remote Sensing and LiDAR Applications参考文献 45被引用 20
一句话总结

该论文提出了一种半结构化过滤方法,通过将自由形式过滤器与可学习的高斯过滤器组合,端到端地优化和自适应感受野的大小、形状和局部性。通过反向传播高斯协方差参数,该方法实现了高效、可微的感受野搜索,在Cityscapes数据集上将语义分割准确率提升了最高达10个百分点,同时在显著减少参数量和更高效率的前提下,达到了与自由形式形变相当的准确率。

ABSTRACT

The visual world is vast and varied, but its variations divide into structured and unstructured factors. We compose free-form filters and structured Gaussian filters, optimized end-to-end, to factorize deep representations and learn both local features and their degree of locality. Our semi-structured composition is strictly more expressive than free-form filtering, and changes in its structured parameters would require changes in free-form architecture. In effect this optimizes over receptive field size and shape, tuning locality to the data and task. Dynamic inference, in which the Gaussian structure varies with the input, adapts receptive field size to compensate for local scale variation. Optimizing receptive field size improves semantic segmentation accuracy on Cityscapes by 1-2 points for strong dilated and skip architectures and by up to 10 points for suboptimal designs. Adapting receptive fields by dynamic Gaussian structure further improves results, equaling the accuracy of free-form deformation while improving efficiency.

研究动机与目标

  • 通过结合结构的效率与学习的表达能力,弥合结构化与自由形式表征学习之间的差距。
  • 通过可微分的高斯过滤器参数化,实现感受野大小、形状和局部性的端到端优化。
  • 通过学习自适应、动态的感受野,减少对固定感受野的架构依赖,使其能响应输入内容。
  • 在不增加模型复杂度或计算成本的前提下,提升语义分割准确率。
  • 证明结构化参数化可以达到与自由形式形变相当的性能,同时具备更少的参数量和更高的计算效率。

提出的方法

  • 该方法通过卷积 $ * $ 将自由形式过滤器 $ f_{\theta} $ 与结构化高斯过滤器 $ g_{\Sigma} $ 组合,形成一个半结构化过滤器族,其表达能力优于任一单独组件。
  • 高斯过滤器由协方差矩阵 $ \Sigma $ 参数化,以低维、可微的方式控制感受野的尺度、长宽比和方向。
  • 联合优化 $ \theta $ 和 $ \Sigma $ 实现端到端训练,使感受野特性从数据中学习,而非人工设计。
  • 通过在每个空间位置回归 $ \Sigma $ 实现动态推理,使感受野能够适应输入中的局部尺度变化。
  • 该方法支持静态和动态高斯结构,提供球形、对角和完整协方差选项,以适应不同程度的自由度。
  • 该方法在尺度空间理论和信号处理方面具有理论基础,确保平滑性并避免因高斯函数固有特性导致的混叠现象。

实验结果

研究问题

  • RQ1结合自由形式与结构化过滤器的混合过滤框架,是否能比单独使用任一类型具有更强的表达能力?
  • RQ2在深度神经网络中,高斯过滤器的可微参数在多大程度上可优化感受野的大小和形状?
  • RQ3对具有局部尺度变化的任务(如语义分割)而言,高斯协方差的动态适应是否能提升性能?
  • RQ4结构化参数化是否能在减少参数量和计算成本的同时,达到与自由形式形变相当的准确率?
  • RQ5当架构感受场性能不佳或受限时,该方法表现如何?

主要发现

  • 通过可学习的高斯参数优化感受野大小,在Cityscapes数据集上,对强扩张和跳跃连接架构的语义分割准确率提升了1–2个百分点。
  • 对于性能不佳的网络设计,该方法通过学习合适的感受野大小和形状,最高可实现10个百分点的准确率增益。
  • 采用单尺度参数的动态高斯形变在Cityscapes测试集上达到74.3%的mIoU,与自由形式形变的73.6%相当,但参数量显著更少。
  • 即使仅使用球形协方差(一个自由度),该方法也几乎完全匹配自由形式形变的准确率,表明仅建模尺度即可实现主要性能提升。
  • 该方法对架构约束具有鲁棒性:当感受野减小或输入分辨率提高时,学习到的协方差可通过扩大有效感受野进行补偿。
  • 该组合稳定且具有泛化能力:恒等操作(无变化)可被学习,且该方法从不降低性能,始终能提升或保持准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。