[论文解读] Stacked Kernel Network
本文提出堆叠核网络(Stacked Kernel Network, SKN),一种深度核方法,通过堆叠多层再生核希尔伯特空间(Reproducing Kernel Hilbert Space, RKHS)函数并穿插线性投影,学习分层非线性表征。SKN采用三种表征——非参数化、参数化和随机傅里叶特征(Random Fourier Features, RFF)——使无限维RKHS函数可计算,实现在多个数据集上的最先进性能,包括在CIFAR-10上优于卷积神经网络(CNN)的精度表现,使用RFF-SKCN。
Kernel methods are powerful tools to capture nonlinear patterns behind data. They implicitly learn high (even infinite) dimensional nonlinear features in the Reproducing Kernel Hilbert Space (RKHS) while making the computation tractable by leveraging the kernel trick. Classic kernel methods learn a single layer of nonlinear features, whose representational power may be limited. Motivated by recent success of deep neural networks (DNNs) that learn multi-layer hierarchical representations, we propose a Stacked Kernel Network (SKN) that learns a hierarchy of RKHS-based nonlinear features. SKN interleaves several layers of nonlinear transformations (from a linear space to a RKHS) and linear transformations (from a RKHS to a linear space). Similar to DNNs, a SKN is composed of multiple layers of hidden units, but each parameterized by a RKHS function rather than a finite-dimensional vector. We propose three ways to represent the RKHS functions in SKN: (1)nonparametric representation, (2)parametric representation and (3)random Fourier feature representation. Furthermore, we expand SKN into CNN architecture called Stacked Kernel Convolutional Network (SKCN). SKCN learning a hierarchy of RKHS-based nonlinear features by convolutional operation with each filter also parameterized by a RKHS function rather than a finite-dimensional matrix in CNN, which is suitable for image inputs. Experiments on various datasets demonstrate the effectiveness of SKN and SKCN, which outperform the competitive methods.
研究动机与目标
- 通过实现深度、分层的特征学习,克服经典单层核方法的表征能力有限问题。
- 开发一种框架,将多个非线性变换堆叠于RKHS中,同时保持计算可操作性。
- 探索RKHS函数的三种不同表征——非参数化、参数化和随机傅里叶特征——以实现有效学习。
- 将SKN扩展为卷积架构(SKCN),用于视觉识别任务。
- 在多样化数据集上,通过实证验证SKN与SKCN相较于先进深度学习和核方法的性能。
提出的方法
- SKN构建具有L个隐藏层的深度架构,每个层关联一个RKHS与一个非线性特征映射φ(l),以及从RKHS到有限维空间的线性投影W(l)。
- 每个隐藏单元由函数f_k^(l) ∈ H^(l)参数化,其中f_k^(l)(x) = w_k^T φ^(l)(x),通过核技巧计算。
- 提出三种表征:(1) 通过再生定理实现的非参数化,(2) 使用锚点向量a的参数化,(3) 随机傅里叶特征(RFF)近似f(x) = w^T z(x)。
- 使用反向传播训练模型,适用于所有三种表征,实现RKHS函数的端到端学习。
- 提出一种卷积变体——堆叠核卷积网络(Stacked Kernel Convolutional Network, SKCN),用RKHS基滤波器替代有限维滤波器,实现在视觉任务中的分层特征学习。
- 模型使用核函数(如RBF)隐式将输入映射到无限维RKHS,线性投影控制模型规模。
实验结果
研究问题
- RQ1通过堆叠多层基于RKHS的非线性特征,是否能提升表征能力,超越单层核方法?
- RQ2如何在深度网络架构中有效参数化并学习无限维RKHS函数?
- RQ3所提出的SKN架构是否在多样化的数据集上,于准确率和泛化能力方面优于标准DNN和CNN?
- RQ4RKHS函数的不同表征方式(非参数化、参数化、RFF)如何影响SKN的性能与训练效率?
- RQ5SKN框架能否成功扩展至卷积架构,用于图像识别任务?
主要发现
- RFF-SKCN在CIFAR-10上使用Dropout时达到79.06%的测试准确率,不使用时为77.77%,优于使用相同层数的基线CNN(分别为74.79%和73.24%)。
- SKN在≥2个隐藏层时始终优于单层SKN,证明了深度分层特征学习的优势。
- SKN在隐藏单元数K从10到2500变化时表现稳定,表明对K的敏感度较低,而DNN对K高度敏感,且在大K时易过拟合。
- RFF-SKCN的准确率高于CNN,但每轮迭代耗时接近两倍,因参数矩阵更大,表明表达能力与效率之间存在权衡。
- 非参数化与参数化表征的RKHS函数实现了有效学习,而RFF为大规模任务提供了可扩展的近似方法。
- 实验结果证实,无限维RKHS函数的表达能力优于CNN中有限维滤波器,验证了SKCN中架构创新的合理性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。