[论文解读] Approximation and Learning with Deep Convolutional Models: a Kernel Perspective
本文从核方法的角度研究深度卷积核模型,表明层级卷积与池化层在空间块之间诱导出一个加法交互模型的再生核希尔伯特空间(RKHS),其范数偏好空间上相似的交互项。该研究建立了泛化界,证明当目标函数表现出基于块的空间正则性时,样本复杂度可提高多项式因子。
The empirical success of deep convolutional networks on tasks involving high-dimensional data such as images or audio suggests that they can efficiently approximate certain functions that are well-suited for such tasks. In this paper, we study this through the lens of kernel methods, by considering simple hierarchical kernels with two or three convolution and pooling layers, inspired by convolutional kernel networks. These achieve good empirical performance on standard vision datasets, while providing a precise description of their functional space that yields new insights on their inductive bias. We show that the RKHS consists of additive models of interaction terms between patches, and that its norm encourages spatial similarities between these terms through pooling layers. We then provide generalization bounds which illustrate how pooling and patches yield improved sample complexity guarantees when the target function presents such regularities.
研究动机与目标
- 通过核方法理解深度卷积网络的归纳偏置,重点关注池化和卷积等架构选择。
- 填补卷积网络为何在高维数据(如图像)上泛化良好这一理论理解的空白。
- 精确刻画由多层卷积与池化层构成的深度结构化核所诱导出的再生核希尔伯特空间(RKHS)结构。
- 证明池化和基于块的交互等架构组件可提升学习的样本复杂度。
- 建立可量化分层核结构对具有空间正则交互模式函数之优势的泛化界。
提出的方法
- 形式化一类受卷积核网络启发的深度结构化核,采用两层或三层结构,结合高斯池化与二至四次多项式核。
- 将这些核的RKHS表征为不同空间块之间交互项的加法模型,其范数鼓励交互项之间的空间相似性。
- 利用球谐分解与核逼近理论,推导出RKHS范数与自由度的精确表达式。
- 应用统计学习中的泛化理论(Cucker-Smale框架),推导出过剩风险的界,其表达式与目标函数的正则性及核结构相关。
- 通过源条件与特征值衰减,界定向近似误差与估计误差,从而得出依赖于块维度d而非完整输入维度的样本复杂度率。
- 通过自由度的界比较全局池化与局部池化的差异,表明局部池化具有更优的缩放性能。
实验结果
研究问题
- RQ1多个卷积与池化层如何塑造深度核模型的功能空间?
- RQ2具有池化的深度卷积核所诱导出的RKHS的确切结构是什么?
- RQ3与非分层模型相比,池化和基于块的交互如何提升泛化性能?
- RQ4使用此类核学习具有空间正则交互模式的函数时,样本复杂度是多少?
- RQ5能否通过核方法精确捕捉并量化深度卷积网络的归纳偏置?
主要发现
- 所提出的深度核模型的RKHS由空间块之间交互项的加法模型构成,其范数对空间上不相似的交互施加惩罚。
- 池化层强制交互项之间的空间相似性,从而有效正则化函数空间,使其偏好结构化、平移不变的模式。
- 泛化界表明,当目标函数具有空间正则交互项时,样本复杂度在输入规模上可提高多项式因子。
- 过剩风险界的形式为 $ \left( \frac{\|h\|_{2}^{2/\alpha}}{n} \right)^{\frac{2\alpha r}{2\alpha r + 1}} $,其指数依赖于目标函数的光滑度与核的特征值衰减速率。
- 对于全局池化,界的形式为 $ (|\Omega|^{-1/\alpha}/n)^{\frac{2\alpha r}{2\alpha r + 1}} $,但局部池化可将其改进为 $ (1/|\Omega|n)^{\frac{2\alpha r}{2\alpha r + 1}} $,表明架构上的优势。
- 近似误差与池化滤波器 $ h $ 无关,但估计误差依赖于 $ \|h\|_{2}^{2/\alpha} $,凸显了池化在控制泛化中的作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。