[论文解读] Layer-wise training of deep networks using kernel similarity
本文提出一种基于核相似性优化的逐层训练方法,用于提升深度网络的特征表示。通过迭代学习变换矩阵,使各层的核矩阵逐渐逼近理想核矩阵(类内相似度为1,类间相似度为0),该方法在实现与反向传播训练的深度神经网络相当的分类准确率的同时,通过小规模、渐进式的参数调优减少了过拟合现象。
Deep learning has shown promising results in many machine learning applications. The hierarchical feature representation built by deep networks enable compact and precise encoding of the data. A kernel analysis of the trained deep networks demonstrated that with deeper layers, more simple and more accurate data representations are obtained. In this paper, we propose an approach for layer-wise training of a deep network for the supervised classification task. A transformation matrix of each layer is obtained by solving an optimization aimed at a better representation where a subsequent layer builds its representation on the top of the features produced by a previous layer. We compared the performance of our approach with a DNN trained using back-propagation which has same architecture as ours. Experimental results on the real image datasets demonstrate efficacy of our approach. We also performed kernel analysis of layer representations to validate the claim of better feature encoding.
研究动机与目标
- 开发一种新型的逐层训练方法,用于深度网络,以在无需端到端反向传播的情况下提升层次化特征表示。
- 通过逐层训练并减少参数数量,利用核相似性作为优化目标,以最小化过拟合。
- 通过核主成分分析(kernel PCA)验证深层网络产生的表示更加简洁且准确。
- 证明所提出方法在标准图像数据集上的分类性能与使用标准反向传播训练的DNN相当。
提出的方法
- 对于每一层,该方法建立一个优化问题,以学习一个变换矩阵,使该层的核矩阵逐渐逼近理想核矩阵。
- 理想核矩阵为所有同类别样本对分配值1,为不同类别样本对分配值0,作为核相似性优化的目标。
- 通过优化过程学习变换矩阵,以最小化当前层核矩阵与理想核矩阵之间的差异,使用RBF核进行相似度计算。
- 在学习完某一层的变换矩阵后,将特征传递至下一层,下一层使用相同的核相似性优化目标独立训练。
- 使用核主成分分析(kernel PCA)分析每层表示的复杂度与准确性,通过测量主特征向量中的能量集中程度进行评估。
- 通过在最后一层特征上训练一个全连接层(FC100)和Softmax,评估分类性能,并与标准DNN的结果进行比较。
实验结果
研究问题
- RQ1基于核相似性优化的逐层训练能否产生与端到端反向传播方法相当的特征表示?
- RQ2随着网络深度增加,所提出方法是否能产生越来越简洁且准确的表示,如核主成分分析中能量集中度所衡量的那样?
- RQ3与标准DNN训练相比,该逐层方法是否能更有效地减少过拟合,尤其是在训练数据有限的情况下?
- RQ4在标准图像基准数据集上,该方法的分类准确率与具有相同架构的DNN相比如何?
主要发现
- 所提出的逐层训练方法在MNIST和CIFAR-10数据集上均达到了与反向传播训练DNN相当的测试分类准确率。
- 在CIFAR-10数据集上使用有限训练数据时,所提出方法优于DNN基线模型,表明由于每层参数调优规模较小,过拟合现象更少。
- 核主成分分析结果表明,随着网络深度增加,更多能量集中于更少的主特征向量中,证实了表示更加简洁且准确。
- 对学习到的卷积核进行可视化观察发现,第一层学习到了丰富且具有判别性的特征,与预训练模型(如PMLP)的特征相似。
- 该方法展示了模块化深度学习方法的可行性,允许选择性地逐层添加网络层,并保证性能的持续提升。
- 优化过程成功地使每一层的核矩阵趋近于理想核矩阵,验证了表示学习改进的核心假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。