Skip to main content
QUICK REVIEW

[论文解读] Breaking the Activation Function Bottleneck through Adaptive Parameterization

Sebastian Flennerhag, Hujun Yin|arXiv (Cornell University)|May 22, 2018
Topic Modeling参考文献 47被引用 8
一句话总结

本文提出自适应参数化方法,通过学习输入相关的仿射变换参数,提升神经网络的灵活性,打破激活函数的瓶颈。所提出的自适应LSTM在Penn Treebank和WikiText-2数据集上实现了最先进性能,参数量减少20–30%,且收敛所需迭代次数不足标准LSTM的一半。

ABSTRACT

Standard neural network architectures are non-linear only by virtue of a simple element-wise activation function, making them both brittle and excessively large. In this paper, we consider methods for making the feed-forward layer more flexible while preserving its basic structure. We develop simple drop-in replacements that learn to adapt their parameterization conditional on the input, thereby increasing statistical efficiency significantly. We present an adaptive LSTM that advances the state of the art for the Penn Treebank and WikiText-2 word-modeling tasks while using fewer parameters and converging in less than half as many iterations.

研究动机与目标

  • 解决标准神经网络因激活函数在大输入范围内近似线性而导致的脆弱性和低效性问题。
  • 克服‘激活函数瓶颈’问题,即非线性被限制在固定且非自适应的函数中,从而限制模型容量。
  • 开发一种通用、可训练且高效的前馈层自适应参数化方法,以提升统计效率。
  • 将自适应参数化扩展至RNN,特别是构建一种自适应LSTM,以提升收敛速度和泛化能力。
  • 证明自适应参数化可使模型更具鲁棒性,减少对超参数调优的敏感性。

提出的方法

  • 提出一种通用的自适应前馈层,通过可学习的变换网络将固定的权重矩阵替换为输入自适应的参数。
  • 采用一种参数化方式,使权重矩阵W基于输入x通过独立网络进行条件化,从而实现输入相关的仿射变换。
  • 引入两种自适应策略:输出自适应(仅调整输出权重)和输入-输出自适应(同时调整输入和输出权重),后者显著提升性能。
  • 采用基于RNN的递归自适应模型生成自适应参数,实现在序列建模中上下文感知的参数化。
  • 使用RNN-HyperNetwork(RHN)混合结构生成自适应权重,结合RNN与HyperNetwork的优势,实现更好的泛化能力。
  • 采用标准反向传播端到端训练整个模型,计算开销极低。

实验结果

研究问题

  • RQ1自适应参数化能否显著提升前馈网络的统计效率,从而减少实现相当性能所需的参数数量?
  • RQ2学习输入相关的仿射变换是否能打破激活函数瓶颈,并使模型容量超越固定激活函数的限制?
  • RQ3自适应参数化能否有效扩展至RNN,特别是LSTM,以提升序列建模任务中的收敛速度和泛化能力?
  • RQ4在超参数变化下,自适应LSTM与标准LSTM相比,其鲁棒性如何?
  • RQ5自适应参数化在多大程度上减少了语言建模任务中对大模型尺寸的依赖?

主要发现

  • 自适应LSTM在Penn Treebank上达到最先进性能,测试困惑度降至56.5,参数量约为1700万,优于标准LSTM及其他SOTA模型。
  • 在WikiText-2上,自适应LSTM的测试困惑度为64.5,参数量为3200万,优于3300万参数的awd-lstm和2400万参数的tg-sc-lstm。
  • 自适应LSTM的收敛迭代次数不足标准LSTM的一半,表明其训练动态更快。
  • 自适应LSTM对超参数变化的鲁棒性显著更强:0%的采样配置无法收敛,而标准LSTM的失败率为25%。
  • 自适应LSTM性能分布的第90百分位数与标准LSTM的第10百分位数相当,表明其可靠性更高。
  • 消融实验证实,自适应模型的选择(如递归模型与前馈模型)以及自适应策略(如io自适应)均显著提升性能,验证了自适应参数化的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。