Skip to main content
QUICK REVIEW

[论文解读] Dichotomize and Generalize: PAC-Bayesian Binary Activated Deep Neural Networks

Gaël Letarte, Pascal Germain|arXiv (Cornell University)|May 24, 2019
Machine Learning and ELM被引用 11
一句话总结

该论文提出PBGMNet,一种用于训练具有符号激活函数的二值化激活深度神经网络(BAM网络)的PAC-Bayesian框架,可在无需网络结构或边缘假设的前提下实现非平凡的一般化界。通过最小化一种聚合权重分布的界感知损失,该方法在真实数据集上实现了具有竞争力的准确率,同时在独立同分布数据假设下提供了紧密且非平凡的一般化保证。

ABSTRACT

We present a comprehensive study of multilayer neural networks with binary activation, relying on the PAC-Bayesian theory. Our contributions are twofold: (i) we develop an end-to-end framework to train a binary activated deep neural network, (ii) we provide nonvacuous PAC-Bayesian generalization bounds for binary activated deep neural networks. Our results are obtained by minimizing the expected loss of an architecture-dependent aggregation of binary activated deep neural networks. Our analysis inherently overcomes the fact that binary activation function is non-differentiable. The performance of our approach is assessed on a thorough numerical experiment protocol on real-life datasets.

研究动机与目标

  • 开发一种理论基础坚实的深度神经网络训练框架,其激活函数为二值化(符号)函数。
  • 在最小假设条件下(仅独立同分布训练数据),为BAM网络推导出非平凡的PAC-Bayesian一般化界。
  • 通过PAC-Bayesian框架中对网络的连续聚合,解决符号激活函数的不可微性问题。
  • 在真实世界二分类数据集上对方法进行实证验证,实现具有竞争力的准确率和紧密的一般化界。
  • 探索使用预训练和基于界的选择方法以提升模型的鲁棒性和泛化能力。

提出的方法

  • 该方法采用PAC-Bayesian框架,最小化权重分布上BAM网络的期望损失,将网络权重视为随机变量。
  • 利用后验与先验权重分布之间的Kullback-Leibler散度以及经验风险,对期望一般化误差建立界。
  • 学习目标结合了经验风险与正则化界项,即使在符号函数不可微的情况下,仍可实现端到端训练。
  • 引入一种采样方案以降低计算成本,使方法在保持理论保证的同时具备可扩展性。
  • 该方法借鉴了PAC-Bayesian界在线性分类器上的前期工作,并将其扩展至具有二值激活的深度架构。
  • 模型选择将一般化界值作为标准,促进选择误差低且理论保证紧密的模型。

实验结果

研究问题

  • RQ1在最小假设条件下(仅独立同分布训练数据),能否为具有二值化(符号)激活函数的深度神经网络推导出非平凡的PAC-Bayesian一般化界?
  • RQ2在PAC-Bayesian优化框架中,如何处理符号激活函数的不可微性?
  • RQ3能否设计一种训练算法,同时最小化经验风险与一般化界,从而提升模型鲁棒性?
  • RQ4将一般化界用作模型选择标准,对测试误差和一般化差距有何影响?
  • RQ5预训练是否能提升该方法在小数据集上的性能和一般化保证?

主要发现

  • PBGNet在真实数据集上实现了具有竞争力的测试误差率,包括MNIST和Adult,MNIST17的误差率低至0.004,Adult的误差率低至0.149。
  • 该方法在高置信度(95%)下提供了非平凡的一般化界,MNIST17的界值低至0.010,Adult的界值低至0.164。
  • 将界用作损失函数(PBGNet ℓ-bnd)可获得更紧密的一般化界(如Ads数据集上为0.060),同时保持具有竞争力的测试准确率。
  • 包含界值的模型选择过程减少了训练-测试误差差距,表明对过拟合的鲁棒性有所提升。
  • 在小数据集Ads上,预训练显著提升了性能,界值降至0.060,测试误差保持在低水平0.033。
  • 该方法在一般化性能与计算成本之间表现出有利的权衡,采样方案有效降低了训练时间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。