Skip to main content
QUICK REVIEW

[论文解读] Deep Neural Network Training with Frank-Wolfe

Sebastian Pokutta, Christoph Spiegel|arXiv (Cornell University)|Oct 14, 2020
Stochastic Gradient Optimization Techniques参考文献 44被引用 4
一句话总结

本文提出使用随机Frank-Wolfe算法训练具有约束权重参数的深度神经网络,通过利用线性最小化预言机避免昂贵的投影步骤。结果表明,在适当的凸可行区域(如L2-或L∞-范数球)下,Frank-Wolfe训练的测试准确率超过标准SGD,并与使用L2正则化的最先进结果相当,同时还能控制模型稀疏性和学习到的表征。

ABSTRACT

This paper studies the empirical efficacy and benefits of using projection-free first-order methods in the form of Conditional Gradients, a.k.a. Frank-Wolfe methods, for training Neural Networks with constrained parameters. We draw comparisons both to current state-of-the-art stochastic Gradient Descent methods as well as across different variants of stochastic Conditional Gradients. In particular, we show the general feasibility of training Neural Networks whose parameters are constrained by a convex feasible region using Frank-Wolfe algorithms and compare different stochastic variants. We then show that, by choosing an appropriate region, one can achieve performance exceeding that of unconstrained stochastic Gradient Descent and matching state-of-the-art results relying on $L^2$-regularization. Lastly, we also demonstrate that, besides impacting performance, the particular choice of constraints can have a drastic impact on the learned representations.

研究动机与目标

  • 研究使用无投影随机Frank-Wolfe方法训练具有约束参数的深度神经网络的可行性和有效性。
  • 比较随机Frank-Wolfe变体与标准随机梯度下降(SGD)及自适应方法在泛化能力和性能方面的表现。
  • 研究可行区域的选择对模型泛化、稀疏性和学习表征的影响。
  • 证明约束Frank-Wolfe训练可以达到或超过使用L2正则化的SGD性能。
  • 提供TensorFlow和PyTorch中的开源实现,以支持可复现性和进一步研究。

提出的方法

  • 该方法采用带动量的随机Frank-Wolfe(SFW),用线性最小化预言机(LMO)调用替代约束优化中的投影步骤。
  • 在每次迭代中,LMO求解 $ v_t = \arg\min_{v \in \mathcal{C}} \langle \tilde{\nabla}L(\theta_t), v \rangle $,其中 $ \mathcal{C} $ 是一个凸且紧致的可行区域。
  • 通过 $ \theta_{t+1} = \theta_t + \alpha (v_t - \theta_t) $ 更新参数,利用凸组合确保可行性。
  • 该方法通过依赖高效的LMO避免昂贵的投影,尤其在 $ \mathcal{C} $ 具有结构时(如L2球、L∞球、K-稀疏多面体)效果显著。
  • 该方法应用于MNIST、CIFAR-10、CIFAR-100和ImageNet上的全连接网络和卷积网络,超参数经调优以实现公平比较。
  • 作者采用受ORGFW和SPIDER-FW启发的动量和方差减少技术,以提升实际收敛性。

实验结果

研究问题

  • RQ1当参数被约束在凸可行区域时,随机Frank-Wolfe算法能否有效训练深度神经网络?
  • RQ2Frank-Wolfe训练的性能与标准SGD及带权重衰减的SGD在标准基准上的比较如何?
  • RQ3可行区域的选择在多大程度上影响模型稀疏性和学习表征的结构?
  • RQ4Frank-Wolfe训练能否在不显式使用L2正则化的情况下达到最先进测试准确率?
  • RQ5不同LMO(如L2、L∞或稀疏多面体)对训练动态和泛化能力有何影响?

主要发现

  • 在L2-范数约束参数下,Frank-Wolfe训练在CIFAR-10和ImageNet上的测试准确率超过标准SGD,并与使用L2正则化的SGD性能相当。
  • 当参数被约束在L∞-范数球时,SFW仍优于无权重衰减的标准SGD,表明约束本身具有正则化效果。
  • 约束在K-稀疏多面体的网络在训练过程中表现出显著减少的活跃参数数量,证明了通过选择可行区域可有效诱导稀疏性。
  • 对学习权重的可视化显示,不同的可行区域(如L2球或稀疏多面体)会导致截然不同的学习表征,特征激活模式各异。
  • 由于高效的LMO,SFW的运行时间与SGD相当,尤其在L2-和L∞-范数约束下,使该方法在计算上具有可行性。
  • 作者发布了TensorFlow和PyTorch中的开源实现,支持可复现性和约束深度学习的进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。