Skip to main content
QUICK REVIEW

[论文解读] Auto-Sizing Neural Networks: With Applications to n-gram Language Models

Kenton Murray, David Chiang|arXiv (Cornell University)|Aug 20, 2015
Topic Modeling参考文献 19被引用 16
一句话总结

本文提出了一种用于前馈神经网络的自动尺寸调节方法,通过使用 ∞,1 和 2,1 正则化,在训练过程中自动剪枝冗余的隐藏单元。通过鼓励整个单元通过将所有输入权重驱动至零而停用,该方法生成了紧凑且高性能的语言模型,在困惑度损失最小化的同时,在机器翻译任务中实现了稳定提升,且在各种设置下仅需单一正则化超参数。

ABSTRACT

Neural networks have been shown to improve performance across a range of natural-language tasks. However, designing and training them can be complicated. Frequently, researchers resort to repeated experimentation to pick optimal settings. In this paper, we address the issue of choosing the correct number of units in hidden layers. We introduce a method for automatically adjusting network size by pruning out hidden units through $\ell_{\infty,1}$ and $\ell_{2,1}$ regularization. We apply this method to language modeling and demonstrate its ability to correctly choose the number of hidden units while maintaining perplexity. We also include these models in a machine translation decoder and show that these smaller neural models maintain the significant improvements of their unpruned versions.

研究动机与目标

  • 为解决在神经网络中手动调节隐藏层大小所面临的挑战,该过程耗时且易出错。
  • 开发一种在训练过程中自动确定最优网络尺寸的方法,从而消除对大规模网格搜索的依赖。
  • 在降低模型复杂度和推理成本的同时,保持语言建模和机器翻译任务中的高性能。
  • 证明基于正则化的剪枝可生成更小、更高效的模型,而不会牺牲准确性。

提出的方法

  • 将 ∞,1 和 2,1 正则化应用于目标函数,通过将所有输入权重驱动至零,促使整个隐藏单元停用。
  • 使用一种凸正则化器,作用于每个单元的权重组,促进单元级别的稀疏性,而非单个参数的稀疏性。
  • 使用初始过大的网络架构进行训练,并在训练后剪枝不活跃的单元,从而得到紧凑且优化的模型。
  • 采用随机梯度下降最小化正则化后的损失函数,将剪枝过程整合到训练过程中。
  • 依赖 ReLU 或 tanh 等激活函数,当所有输入为零时输出也为零,从而确保被剪枝单元的安全移除。
  • 在不同网络大小、词汇表大小、n-gram 阶数和训练数据大小下,仅使用单一正则化系数(λ = 0.1)进行调优。

实验结果

研究问题

  • RQ1基于正则化的剪枝能否在无需手动调参的情况下自动确定神经网络中隐藏单元的最优数量?
  • RQ2使用 ∞,1 和 2,1 范数是否能有效在单元级别诱导组稀疏性,从而实现对冗余神经元的清晰移除?
  • RQ3尽管模型尺寸减小,该方法生成的自动尺寸调节模型在语言建模任务中是否仍能保持低困惑度?
  • RQ4该方法是否能在使用单一超参数设置的情况下,泛化于不同数据大小、词汇表大小和 n-gram 阶数?
  • RQ5当集成到解码器中时,自动尺寸调节的神经语言模型能否提升机器翻译性能?

主要发现

  • 该方法成功剪枝了冗余的隐藏单元,生成了尺寸更小的模型,与未正则化的模型相比,困惑度增加极小。
  • 单一正则化系数(λ = 0.1)在不同配置下均保持一致性能,包括不同词汇表大小、训练数据大小和 n-gram 阶数。
  • 自动尺寸调节模型的困惑度几乎与完整模型相当,仅出现微小但具有统计显著性的增加。
  • 当集成到机器翻译解码器中时,剪枝后的模型实现了显著的 BLEU 分点提升,性能与完整模型相当。
  • 该方法通过将层大小超参数调优替换为单一正则化参数,显著减少了对昂贵的多维网格搜索的需求。
  • 权重矩阵的可视化显示,整个行(即单元)清晰收敛至零,证实了有效的单元级别剪枝。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。