[论文解读] Towards a General Purpose CNN for Long Range Dependencies in $N$D
本文提出连续卷积神经网络(CCNN),一种通用的CNN架构,通过使用由小型神经网络参数化的连续卷积核,在无需架构更改的情况下,对任意长度、分辨率和维度(1D、2D、3D+)的数据建模长程依赖关系。CCNN在语音、图像和序列数据等多样化任务中实现了最先进或具有竞争力的性能,在Long Range Arena和Pathfinder等基准测试中,准确率最高提升达10个百分点。
The use of Convolutional Neural Networks (CNNs) is widespread in Deep Learning due to a range of desirable model properties which result in an efficient and effective machine learning framework. However, performant CNN architectures must be tailored to specific tasks in order to incorporate considerations such as the input length, resolution, and dimentionality. In this work, we overcome the need for problem-specific CNN architectures with our Continuous Convolutional Neural Network (CCNN): a single CNN architecture equipped with continuous convolutional kernels that can be used for tasks on data of arbitrary resolution, dimensionality and length without structural changes. Continuous convolutional kernels model long range dependencies at every layer, and remove the need for downsampling layers and task-dependent depths needed in current CNN architectures. We show the generality of our approach by applying the same CCNN to a wide set of tasks on sequential (1$\mathrm{D}$) and visual data (2$\mathrm{D}$). Our CCNN performs competitively and often outperforms the current state-of-the-art across all tasks considered.
研究动机与目标
- 解决标准CNN在不同数据长度、分辨率和维度下需要特定任务架构的局限性。
- 克服离散卷积核在高效建模长程依赖关系方面的能力不足,以及无法实现分辨率无关性的问题。
- 开发一种单一、统一的CNN架构,无需结构修改即可在序列、视觉和高维数据中有效运行。
- 通过连续核参数化实现参数高效的全局上下文建模,使核大小与参数数量解耦。
提出的方法
- 用由小型神经网络参数化的连续卷积核替代离散卷积核,该网络将输入坐标映射为核值。
- 在核生成网络中使用基于坐标的输入,实现对不同输入尺度的分辨率无关操作。
- 通过改变坐标输入的维度,为1D、2D和更高维数据复用相同的核生成网络。
- 消除对下采样、池化和任务特定深度的依赖,通过连续核参数化实现长程建模。
- 在不改变架构的前提下,对多种不同模态和分辨率的数据任务进行单一CCNN架构的训练。
- 利用连续核高效建模长程依赖关系,避免大尺寸离散核带来的参数爆炸问题。
实验结果
研究问题
- RQ1单一CNN架构是否能有效建模任意长度、分辨率和维度的数据中的长程依赖关系?
- RQ2与离散核相比,连续核参数化在长程序列和图像任务中的性能提升程度如何?
- RQ3统一的CCNN架构在包括语音、图像和序列数据在内的多样化基准测试中,能否显著优于特定任务的CNN?
- RQ4连续核公式是否能提升不同数据模态下的泛化能力并实现更快收敛?
- RQ5相同的核生成网络是否可在无需架构更改的情况下用于1D、2D和3D+数据?
主要发现
- 参数量为200万的CCNN在Pathfinder 2D图像分类基准上达到96.00%的准确率,比之前最先进方法高出近10个百分点。
- 在Long Range Arena基准上,CCNN在六个任务上的平均得分为77.02,比之前最先进方法(S4)高出16.54分。
- 在2D图像分类任务中,参数量为200万的CCNN在CIFAR-100上达到95.20%的准确率,显著优于ResNet-18及其他先前模型。
- 在原始语音分类任务(MFCC 0.5x)中,CCNN达到98.44%的准确率,优于S4及其他最先进方法。
- 在2D数据(如图像)上训练的模型比其1D展平形式收敛更快,表明保留空间结构具有优势。
- CCNN在sMNIST上达到99.72%的准确率,在pMNIST上达到98.84%,与专用架构(如S4和LSSL)相当或更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。