Skip to main content
QUICK REVIEW

[论文解读] Variance Networks: When Expectation Does Not Meet Your Expectations

Kirill Neklyudov, Dmitry Molchanov|arXiv (Cornell University)|Mar 10, 2018
Adversarial Robustness in Machine Learning参考文献 36被引用 13
一句话总结

本文提出方差网络(variance networks),一种新颖的随机神经网络架构,其中权重仅通过其方差参数化,且均值固定为零。尽管舍弃了权重期望值,这些网络仍实现了具有竞争力的性能,提升了对对抗攻击的鲁棒性,并在强化学习中实现了有效的探索,挑战了深度学习中对权重期望的传统依赖。

ABSTRACT

Ordinary stochastic neural networks mostly rely on the expected values of their weights to make predictions, whereas the induced noise is mostly used to capture the uncertainty, prevent overfitting and slightly boost the performance through test-time averaging. In this paper, we introduce variance layers, a different kind of stochastic layers. Each weight of a variance layer follows a zero-mean distribution and is only parameterized by its variance. We show that such layers can learn surprisingly well, can serve as an efficient exploration tool in reinforcement learning tasks and provide a decent defense against adversarial attacks. We also show that a number of conventional Bayesian neural networks naturally converge to such zero-mean posteriors. We observe that in these cases such zero-mean parameterization leads to a much better training objective than conventional parameterizations where the mean is being learned.

研究动机与目标

  • 探索仅通过权重方差存储信息、且均值固定为零的深度神经网络的可行性与性能。
  • 研究仅通过方差参数化是否能在训练目标与泛化能力方面优于传统的贝叶斯神经网络方法。
  • 评估方差网络在对抗攻击下的鲁棒性及其在强化学习探索中的有效性。
  • 研究一种反直觉现象:更简单的后验近似(零均值)反而比更灵活的近似获得更好的变分推断目标。

提出的方法

  • 引入方差层,其中每个权重服从零均值高斯分布 $\mathcal{N}(0, \sigma_{ij}^2)$,仅方差 $\sigma_{ij}^2$ 可训练。
  • 使用标准随机优化进行网络训练,通过正则化最小化期望负对数似然,采用单样本梯度估计。
  • 推理时将期望权重值替换为其均值(即权重缩放规则),此做法在实践中常见。
  • 使用测试时平均($K$ 个样本)来近似预测分布,尽管论文表明这通常并非必需。
  • 在监督分类、强化学习(带参数噪声的策略梯度)和对抗鲁棒性实验中应用方差网络。
  • 将方差网络与标准贝叶斯模型(如变分 dropout、MC-dropout)、确定性网络及深度集成模型在 CIFAR-10 和 OpenAI Gym 环境中进行比较。

实验结果

研究问题

  • RQ1当所有权重均值固定为零、仅学习方差时,深度神经网络是否仍能实现具有竞争力的性能?
  • RQ2更简单的后验近似(零均值)是否能带来比更灵活参数化更好的变分推断目标(ELBO)?
  • RQ3方差网络在对抗鲁棒性方面与标准贝叶斯模型和集成模型相比表现如何?
  • RQ4方差网络是否能在不依赖权重期望的情况下,作为强化学习中的有效探索机制?

主要发现

  • 方差网络在 CIFAR-10 上实现了具有竞争力的分类准确率,尽管权重均值被固定为零,其性能仍与标准贝叶斯基线相当或更优。
  • 方差网络在对抗目标攻击下的鲁棒性优于标准 dropout 和确定性网络,且方差网络的深度集成模型展现出更优的防御能力。
  • 在强化学习中,采用参数噪声的方差网络在最终性能上优于标准参数噪声策略,表现出更优的探索能力与稳定性。
  • 传统贝叶斯模型(如变分 dropout 和 MC-dropout)在训练过程中自然收敛至零均值后验,表明仅通过方差参数化并非偶然现象,而是训练的常见结果。
  • 使用零均值后验时,变分推断目标(ELBO)显著提升,这与‘更灵活的参数化总是带来更好近似’的假设相矛盾。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。