Skip to main content
QUICK REVIEW

[论文解读] Delta-STN: Efficient Bilevel Optimization for Neural Networks using Structured Response Jacobians

Juhan Bae, Roger Grosse|arXiv (Cornell University)|Oct 26, 2020
Advanced Neural Network Applications参考文献 59被引用 9
一句话总结

本文提出Δ-STN,一种新型超网络架构,通过重新参数化与线性化,实现对最优响应雅可比矩阵的精确近似,从而改进神经网络中的双层优化。通过稳定训练过程并降低方差,Δ-STN在调节正则化超参数(如权重衰减、dropout)方面,相比STN等先前方法,实现了更快的收敛速度、更高的准确率以及更好的泛化性能。

ABSTRACT

Hyperparameter optimization of neural networks can be elegantly formulated as a bilevel optimization problem. While research on bilevel optimization of neural networks has been dominated by implicit differentiation and unrolling, hypernetworks such as Self-Tuning Networks (STNs) have recently gained traction due to their ability to amortize the optimization of the inner objective. In this paper, we diagnose several subtle pathologies in the training of STNs. Based on these observations, we propose the $Δ$-STN, an improved hypernetwork architecture which stabilizes training and optimizes hyperparameters much more efficiently than STNs. The key idea is to focus on accurately approximating the best-response Jacobian rather than the full best-response function; we achieve this by reparameterizing the hypernetwork and linearizing the network around the current parameters. We demonstrate empirically that our $Δ$-STN can tune regularization hyperparameters (e.g. weight decay, dropout, number of cutout holes) with higher accuracy, faster convergence, and improved stability compared to existing approaches.

研究动机与目标

  • 解决自调优网络(STNs)在双层优化中出现的训练不稳定性与病态问题,STN是双层优化的领先超网络方法。
  • 改善高斯-牛顿海森矩阵的条件性,以稳定双层优化动力学。
  • 降低超网络参数更新中的方差,并消除超网络扰动带来的偏差。
  • 提升对最优响应雅可比矩阵的近似精度,而非对完整最优响应函数的近似。
  • 实现对正则化超参数(如权重衰减、dropout、cutout孔洞)更高效且更稳定的调优。

提出的方法

  • 对超网络进行重参数化,以改善高斯-牛顿海森矩阵的条件性,从而稳定双层优化动力学。
  • 引入一种改进的训练方案,以降低超网络更新中的方差,并消除扰动带来的偏差。
  • 对最优响应超网络进行线性化,以生成最优响应函数的仿射近似。
  • 通过线性化网络参数与预测之间的依赖关系,专注于精确近似最优响应函数的雅可比矩阵。
  • 在每层使用结构化超网络,以保持可扩展性与效率,类似于STN但训练稳定性更优。
  • 对超网络参数使用固定学习率的Adam优化,并采用学习率预热阶段以稳定初期训练。

实验结果

研究问题

  • RQ1STNs中的训练不稳定性是如何产生的?其参数化中的哪些结构性问题导致了收敛性差?
  • RQ2对超网络进行重参数化是否能改善高斯-牛顿海森矩阵的条件性,并稳定双层优化?
  • RQ3仅对最优响应函数的雅可比矩阵进行近似,而非对完整函数进行近似,是否能带来更稳定、更准确的超参数调优?
  • RQ4对最优响应超网络进行线性化如何影响收敛速度与泛化性能?
  • RQ5Δ-STN在多种任务中对正则化超参数的调优性能,相较于STN及其他基线方法,优势有多大?

主要发现

  • 在CIFAR-10与CIFAR-100上,Δ-STN在VGG16与ResNet18上均实现了高于STN的验证准确率,且在多次运行中保持一致的性能提升。
  • 在图像分类任务中,Δ-STN相比STN将验证损失降低了最多0.005,表明其泛化能力更强。
  • 在LSTM语言建模任务中,Δ-STN实现了0.054的测试损失,优于STN(0.058),并与最佳基线(0.054)持平,且训练调度更稳定。
  • 在MLP上,Δ-STN找到的输入dropout调度比STN更鲁棒、更准确,尤其在不同权重初始化条件下表现更优。
  • Δ-STN对扰动尺度与更新间隔变化的鲁棒性更强,在SimpleCNN与AlexNet上均优于STN。
  • 在MLP上,Δ-STN最终获得的超参数调度与最优网格搜索结果(p=0.43)完全匹配,而STN未能收敛至相同最优值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。