Skip to main content
QUICK REVIEW

[论文解读] Surprisal-Driven Feedback in Recurrent Networks

Kamil Rocki|arXiv (Cornell University)|Aug 22, 2016
Topic Modeling参考文献 4被引用 6
一句话总结

本文提出在循环网络中引入基于意外度(surprisal)的反馈机制,利用过去预测与实际观测之间的预测误差(即意外度)作为反馈信号,以改进未来的预测。通过在推理过程中将该误差信号整合进长短期记忆(LSTM)网络,模型在 enwik8 字符级预测任务上实现了 1.37 比特每字符(BPC)的性能,优于无需显式正则化的最先进确定性和随机方法。

ABSTRACT

Recurrent neural nets are widely used for predicting temporal data. Their inherent deep feedforward structure allows learning complex sequential patterns. It is believed that top-down feedback might be an important missing ingredient which in theory could help disambiguate similar patterns depending on broader context. In this paper we introduce surprisal-driven recurrent networks, which take into account past error information when making new predictions. This is achieved by continuously monitoring the discrepancy between most recent predictions and the actual observations. Furthermore, we show that it outperforms other stochastic and fully deterministic approaches on enwik8 character level prediction task achieving 1.37 BPC on the test portion of the text.

研究动机与目标

  • 探究过去预测与实际观测之间的预测误差(意外度)是否可在循环网络推理过程中作为有意义的反馈信号。
  • 通过将时间上的误差信息整合到LSTM隐藏状态更新中,提升序列建模的泛化能力。
  • 证明基于预测-观测差异的反馈机制可超越标准RNN及最先进架构在字符级语言建模任务中的表现。
  • 探索一种基于仅本地误差信号的、具有生物学合理性的循环网络自上而下反馈机制。

提出的方法

  • 模型引入一个反馈信号 $ s_t $,定义为在时间 $ t-1 $ 时,基于预测分布下真实标记的负对数概率,代表预测的意外度。
  • 该 $ s_t $ 经可学习的权重矩阵 $ V $ 处理后,作为输入加入LSTM隐藏状态更新中,与标准输入和循环连接并列。
  • 该架构在标准LSTM基础上增加了一条额外的反馈路径:$ h_t = \tanh(W x_t + U h_{t-1} + V s_t + b) $,实现基于误差的信息状态转移。
  • 反向传播时间(BPTT)被调整以反向传播通过意外度信号 $ s_t $,从而实现反馈权重 $ V $ 的端到端训练。
  • 方法采用截断BPTT,序列长度为100,批量大小为128,使用学习率为0.001的Adagrad优化。
  • 该反馈机制在训练和推理过程中均运行,与标准RNN不同,后者在训练后丢弃误差信号。

实验结果

研究问题

  • RQ1过去预测与实际观测之间的预测误差(意外度)是否可在循环网络推理过程中作为有效的反馈信号?
  • RQ2将意外度作为反馈信号是否能提升序列建模任务中的泛化能力和预测准确性?
  • RQ3基于意外度的反馈机制与基于高层表示的其他自上而下反馈机制相比表现如何?
  • RQ4仅基于局部预测误差的反馈机制是否能超越无需显式正则化的最先进模型?

主要发现

  • 所提出的Feedback LSTM模型在enwik8字符级预测任务上实现了1.37比特每字符(BPC)的性能,创下新的最先进结果。
  • 该模型优于所有其他确定性和随机方法,包括Grid LSTM(1.47 BPC)、标准LSTM(1.45 BPC)和Hypernetworks(1.38 BPC)。
  • 即使没有显式正则化,反馈机制仍能提升泛化能力,这从模型在测试数据上的优异表现中得到验证。
  • 该反馈机制在单个LSTM层内即有效,无需堆叠或分层架构。
  • 该方法表明,通常在训练后被丢弃的预测误差,若适当地整合,可在推理过程中成为有价值的信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。