Skip to main content
QUICK REVIEW

[论文解读] The HSIC Bottleneck: Deep Learning without Back-Propagation

Wan-Duo Kurt Ma, J. P. Lewis|arXiv (Cornell University)|Aug 5, 2019
Neural Networks and Applications被引用 4
一句话总结

该论文提出HSIC瓶颈方法,一种无需反向传播的深度神经网络训练方法,利用希尔伯特-施密特独立性准则(HSIC)近似信息瓶颈原理。通过最大化层激活与标签之间的HSIC,同时最小化与输入之间的依赖性,该方法在无需反向传播的情况下实现逐层训练,分类准确率与标准反向传播方法相当,尤其在结合最终由SGD训练的分类层后表现更优。

ABSTRACT

We introduce the HSIC (Hilbert-Schmidt independence criterion) bottleneck for training deep neural networks. The HSIC bottleneck is an alternative to the conventional cross-entropy loss and backpropagation that has a number of distinct advantages. It mitigates exploding and vanishing gradients, resulting in the ability to learn very deep networks without skip connections. There is no requirement for symmetric feedback or update locking. We find that the HSIC bottleneck provides performance on MNIST/FashionMNIST/CIFAR10 classification comparable to backpropagation with a cross-entropy target, even when the system is not encouraged to make the output resemble the classification labels. Appending a single layer trained with SGD (without backpropagation) to reformat the information further improves performance.

研究动机与目标

  • 开发一种避免反向传播及其相关问题(如梯度消失/爆炸、权重传输)的深度学习训练方法。
  • 探索使用互信息作为训练目标的信息论替代方案,替代交叉熵损失。
  • 通过使用HSIC作为非参数替代量,解决深度网络中互信息计算的实际挑战。
  • 证明深度网络可在无需反向传播的情况下实现有效训练,且在标准基准测试中保持竞争力。
  • 评估基于HSIC的逐层优化在训练深度网络中的可行性,实现潜在的并行化与生物合理性。

提出的方法

  • 该方法使用希尔伯特-施密特独立性准则(HSIC)衡量层激活与标签之间的统计依赖性,以及激活与输入之间的依赖性。
  • 对于每一层,目标是最大化激活与标签之间的HSIC,同时最小化激活与输入之间的HSIC,从而有效近似信息瓶颈。
  • 训练以块坐标下降的方式逐层进行,避免了对反向传播和链式法则的需求。
  • 最终网络输出通常接近独热编码,经过固定排列后可直接分类,无需额外训练。
  • 通过在最后添加一个使用SGD训练的单一分类层(无需反向传播)来进一步提升性能,以优化表示。
  • 多个具有不同核带宽(σ)的网络并行训练并聚合,以捕捉多尺度依赖关系。

实验结果

研究问题

  • RQ1能否使用信息论目标在无需反向传播的情况下有效训练深度神经网络?
  • RQ2HSIC能否作为深度学习中互信息的实用替代量,避免分箱或参数假设?
  • RQ3HSIC瓶颈是否能缓解深度反向传播中常见的梯度消失与梯度爆炸问题?
  • RQ4HSIC瓶颈训练的网络能否在图像分类任务中实现与标准反向传播相当的性能?
  • RQ5该方法是否支持并行或逐层训练,从而减少对顺序反向传播的依赖?

主要发现

  • HSIC瓶颈可实现非常深的网络训练,无需跳跃连接,即使在反向传播因梯度消失而失败时仍有效。
  • 在MNIST、FashionMNIST和CIFAR10上,未经格式化的HSIC训练网络分别达到98.2%、87.9%和58.7%的测试准确率,与反向传播基线相当。
  • 在MNIST、FashionMNIST和CIFAR10上,添加一个使用SGD训练的分类层(无需反向传播)后,测试准确率分别提升至98.8%、88.3%和59.4%。
  • 具有三个并行HSIC网络(σ = 1, 5, 10)的多尺度网络优于单σ模型,表明多尺度表征学习可提升性能。
  • ResNet实验表明,使用最终层进行格式训练的收敛速度优于标准反向传播,在更少的训练轮次内达到更高准确率。
  • 该方法消除了对反向传播扫描、更新锁定和对称反馈的需求,提供更简单且潜在更易并行化的训练范式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。