[论文解读] From Discrete to Continuous Convolution Layers
本文提出了连续卷积(Continuous Convolution, CC)层,这是一种可微分的、对标准离散卷积的推广,其滤波器被建模为子像素坐标上的连续函数。与传统层受限于整数步长和固定缩放因子不同,CC层可实现可学习的、动态的特征图重采样,支持任意空间尺寸——包括非整数缩放因子和各向不同的缩放因子——从而在不同尺度下实现更优的平移等变性与泛化能力。
A basic operation in Convolutional Neural Networks (CNNs) is spatial resizing of feature maps. This is done either by strided convolution (donwscaling) or transposed convolution (upscaling). Such operations are limited to a fixed filter moving at predetermined integer steps (strides). Spatial sizes of consecutive layers are related by integer scale factors, predetermined at architectural design, and remain fixed throughout training and inference time. We propose a generalization of the common Conv-layer, from a discrete layer to a Continuous Convolution (CC) Layer. CC Layers naturally extend Conv-layers by representing the filter as a learned continuous function over sub-pixel coordinates. This allows learnable and principled resizing of feature maps, to any size, dynamically and consistently across scales. Once trained, the CC layer can be used to output any scale/size chosen at inference time. The scale can be non-integer and differ between the axes. CC gives rise to new freedoms for architectural design, such as dynamic layer shapes at inference time, or gradual architectures where the size changes by a small factor at each layer. This gives rise to many desired CNN properties, new architectural design capabilities, and useful applications. We further show that current Conv-layers suffer from inherent misalignments, which are ameliorated by CC layers.
研究动机与目标
- 解决标准卷积层在空间重采样方面的局限性,其受限于整数缩放因子和固定步长。
- 克服步长大卷积中固有的错位与混叠效应,这些效应会降低平移等变性。
- 实现在推理时可学习、动态的特征图重采样,包括非整数和各向不同的缩放因子。
- 将现有的连续卷积方法从不规则点云推广到规则网格,实现有原则的、端到端可训练的重采样。
- 证明CC层可支持新型网络架构设计,如渐进式架构和动态缩放集成。
提出的方法
- 将卷积滤波器表示为在子像素坐标上的可学习连续函数,从而实现对非整数位置的插值滤波。
- 将连续滤波器应用于离散输入,生成连续的中间特征表示。
- 通过可微分的重采样网格对连续表示进行重采样,生成任意期望尺寸的离散输出特征图。
- 通过梯度下降端到端训练连续滤波器,输出尺寸在推理时通过重采样网格指定。
- 使用三次插值进行重采样,并对连续滤波器和重采样过程进行反向传播。
- 通过在推理时对同一训练好的CC网络应用不同的缩放序列,引入动态缩放集成,通过平均logits提升鲁棒性。
实验结果
研究问题
- RQ1卷积层能否被推广以支持对任意空间尺寸(包括非整数缩放因子)的可微分、可学习的特征图重采样?
- RQ2将卷积建模为子像素坐标上的连续函数,是否相比标准步长大卷积能提升平移等变性?
- RQ3单个CC层是否能在推理时泛化到多个缩放因子,即使仅在单一缩放因子上进行训练?
- RQ4CC层在多大程度上缓解了标准卷积中固有的输入输出错位问题?
- RQ5CC层能否支持新型网络架构范式,如渐进式缩放或动态缩放集成?
主要发现
- CC层在平移等变性方面显著优于标准卷积:在CIFAR-10图像上,±4像素平移的特征图与对齐特征图之间的余弦相似度从基线的0.78提升至0.85。
- 在单一缩放因子(1/2)上训练的CC网络在其他缩放因子上泛化能力差,100个未见缩放因子上的测试误差高出100倍,表明泛化能力需要显式的尺度鲁棒性训练。
- 通过在内部使用非整数缩放因子进行训练的CC网络,可在推理时实现动态缩放集成,使CIFAR-10准确率分别提升+1.7%(2个模型)和+2.4%(3个模型)。
- 第一个实验中学习到的连续滤波器(在1/2缩放因子上训练)与真实核非常接近,而第二个实验(在单一缩放因子上训练)产生的核发生畸变,证实了尺度鲁棒性学习的必要性。
- CC层通过避免离散步长引起的混叠效应,消除了标准卷积中的固有错位,实现了真正的平移等变性。
- 基于CC的超分辨率网络有望通过单一训练模型支持任意缩放因子(包括非整数和各向不同),而无需为每个缩放因子单独训练模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。