[论文解读] Resolution learning in deep convolutional networks using scale-space theory
该论文提出N-Jet层,一种基于尺度空间的可微分卷积层,通过学习高斯尺度参数σ来在训练过程中自动调整滤波器的分辨率,从而替代CNN中固定的滤波器尺寸。通过将滤波器参数化为学习得到的高斯导数基函数的组合,该方法可自动适应输入尺度的滤波器大小和感受野,在分类与分割任务中实现最先进性能,且无需手动调整分辨率超参数。
Resolution in deep convolutional neural networks (CNNs) is typically bounded by the receptive field size through filter sizes, and subsampling layers or strided convolutions on feature maps. The optimal resolution may vary significantly depending on the dataset. Modern CNNs hard-code their resolution hyper-parameters in the network architecture which makes tuning such hyper-parameters cumbersome. We propose to do away with hard-coded resolution hyper-parameters and aim to learn the appropriate resolution from data. We use scale-space theory to obtain a self-similar parametrization of filters and make use of the N-Jet: a truncated Taylor series to approximate a filter by a learned combination of Gaussian derivative filters. The parameter sigma of the Gaussian basis controls both the amount of detail the filter encodes and the spatial extent of the filter. Since sigma is a continuous parameter, we can optimize it with respect to the loss. The proposed N-Jet layer achieves comparable performance when used in state-of-the art architectures, while learning the correct resolution in each layer automatically. We evaluate our N-Jet layer on both classification and segmentation, and we show that learning sigma is especially beneficial for inputs at multiple sizes.
研究动机与目标
- 消除CNN中依赖数据集和网络架构的硬编码分辨率超参数(如滤波器大小、下采样层)。
- 使深度网络能够从数据中学习最优分辨率(通过尺度参数σ),而非依赖人工调参。
- 开发一种可微分的、连续的卷积滤波器参数化方法,支持分辨率的端到端优化。
- 证明学习σ可提升多尺度输入下的性能,且不损失准确性。
- 在不同架构和数据集上保持竞争力的同时实现良好泛化能力。
提出的方法
- N-Jet层将卷积滤波器表示为高斯导数基函数的线性组合,由系数α和尺度σ参数化。
- 尺度σ同时控制滤波器的空间范围和编码的细节层次,实现连续的分辨率学习。
- 该方法使用截断泰勒级数(N-Jet)近似滤波器,通过明确定义的梯度实现对σ的反向传播。
- 滤波器具有自相似性:改变σ可缩放滤波器大小,同时保持其形状,从而实现分辨率自适应。
- 网络通过标准反向传播端到端优化α(滤波器形状)和σ(分辨率)。
- 该方法将标准卷积层替换为N-Jet层,使感受野大小能自动适应输入尺度。

实验结果
研究问题
- RQ1深度CNN能否在不使用硬编码滤波器尺寸或下采样层的情况下,从数据中学习最优分辨率(即感受野大小)?
- RQ2以连续且可微分的方式学习尺度参数σ是否能提升多尺度输入下的性能?
- RQ3N-Jet层是否能在不同架构和数据集上泛化,且不造成性能下降?
- RQ4与标准CNN相比,N-Jet模型的有效感受野(eRF)大小如何随输入图像尺寸变化?
- RQ5与标准卷积相比,学习σ的计算成本如何?其带来的自动分辨率自适应优势是否足以抵消计算开销?
主要发现
- N-Jet层在ImageNet和Cityscapes上的性能与标准CNN相当,证明分辨率可被学习而不会造成精度损失。
- 该方法在浅层自动学习较小的σ值(例如约5×5等效核大小),在深层则学习较大的σ值(例如约11×11等效),适应特征层次结构。
- 在多尺度Fashion-MNIST上,N-Jet模型的有效感受野(eRF)随输入尺寸成比例扩展,而使用固定3×3核的基线模型则保持恒定eRF。
- 由于计算高斯基函数和埃尔米特多项式带来的开销,N-Jet模型的推理速度约为基线NiN模型的2倍慢。
- 尽管计算量增加,但该方法消除了对滤波器尺寸和下采样策略进行耗时超参数搜索的需求。
- 该方法泛化良好:在不同架构和数据集上均保持性能,包括在预训练主干网络(如DeepLab)中使用时。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。