Skip to main content
QUICK REVIEW

[论文解读] Training Language Models Using Target-Propagation

Sam Wiseman, Sumit Chopra|arXiv (Cornell University)|Feb 15, 2017
Topic Modeling参考文献 21被引用 8
一句话总结

本文研究使用目标反向传播(TPROP)训练循环神经网络语言模型,该方法将隐藏状态视为显式优化变量,以实现并行化并避免在时间反向传播(BPTT)中的梯度截断。尽管理论上具有优势,但实验表明TPROP在泛化性能上普遍劣于BPTT,性能下降与隐藏状态优化缺乏约束有关,表明TPROP在序列建模中成功可能需要额外约束。

ABSTRACT

While Truncated Back-Propagation through Time (BPTT) is the most popular approach to training Recurrent Neural Networks (RNNs), it suffers from being inherently sequential (making parallelization difficult) and from truncating gradient flow between distant time-steps. We investigate whether Target Propagation (TPROP) style approaches can address these shortcomings. Unfortunately, extensive experiments suggest that TPROP generally underperforms BPTT, and we end with an analysis of this phenomenon, and suggestions for future work.

研究动机与目标

  • 解决使用截断BPTT训练RNN进行语言建模时的序列依赖性和梯度截断问题。
  • 评估目标反向传播(TPROP)是否能实现并行训练,并改善RNN中的长期依赖学习。
  • 探究TPROP是否能通过避免梯度流截断,在泛化能力上优于BPTT。
  • 分析TPROP在实践中为何劣于BPTT,并识别可改善其性能的潜在约束。

提出的方法

  • 将RNN训练表述为将隐藏状态 $ h_t $ 视为需优化的显式变量,而非通过递推计算得出。
  • 引入一个损失函数,包含预测损失 $ \ell(f(\hat{h}_t), y_t) $ 和重建惩罚 $ C(\hat{h}_t, h_t) $,以确保与递推关系 $ \hat{h}_t = g(x_t, h_{t-1}) $ 的一致性。
  • 采用交替优化策略:固定 $ h_t $ 时更新参数 $ \theta $,再固定 $ \theta $ 时更新 $ h_t $,其中 $ \mathcal{H} $-steps 控制此类更新的次数。
  • 应用TPROP的批量和小批量变体,每个小批量中将 $ h_t $ 初始化为前一个 $ \hat{h}_t $,以保持一致性。
  • 在损失函数中引入 $ L_2 $ 正则化项 $ \lambda \| \hat{h}_t - h_t \|_2^2 $,以正则化隐藏状态优化并提升泛化能力。
  • 在多个语言建模基准(包括Penn Treebank,PTB和Text8)上,以困惑度为指标,对比TPROP与BPTT的性能。

实验结果

研究问题

  • RQ1目标反向传播(TPROP)能否在避免BPTT序列依赖性的前提下,有效训练RNN进行语言建模?
  • RQ2TPROP是否通过实现更长范围的梯度传播,相比截断BPTT,提升了泛化能力?
  • RQ3尽管TPROP在并行化和梯度传播方面具有理论优势,为何其在实践中仍劣于BPTT?
  • RQ4对隐藏状态优化施加额外约束,能否提升TPROP性能并缩小与BPTT的差距?

主要发现

  • 批量TPROP的训练损失与批量BPTT相当,但泛化性能显著更差,表明尽管训练损失优化程度相似,但泛化能力差。
  • 当 $ \mathcal{H} $-steps 设置为1时,小批量TPROP的泛化性能才与BPTT相当,此时TPROP实质上退化为BPTT。
  • TPROP性能下降的原因在于隐藏状态优化缺乏约束,导致模型可找到低损失但泛化能力差的隐藏状态。
  • 实验表明,损失函数中的 $ L_2 $ 正则化项在小批量TPROP中带来微小性能提升,表明其作用主要为正则化,而非促进长程依赖学习。
  • 随着隐藏状态维度增加,BPTT相对于TPROP的性能优势增强,支持了TPROP在高维空间中因缺乏正则化而优化困难的假设。
  • 图3显示,BPTT在小隐藏状态时优于TPROP,但随着维度增加,差距缩小,暗示TPROP在更大模型中可能需要更强的约束。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。