Skip to main content
QUICK REVIEW

[論文レビュー] Surprisal-Driven Feedback in Recurrent Networks

Kamil Rocki|arXiv (Cornell University)|Aug 22, 2016
Topic Modeling参考文献 4被引用数 6
ひとこと要約

この論文では、過去の予測と実際の観測値の間の予測誤差(驚異度)をフィードバック信号として用いる、驚異度駆動型フィードバックを再帰的ネットワークに導入する。推論中に長短期記憶(LSTM)ネットワークにこの誤差信号を統合することで、正則化を明示的に用いずに、1文字レベルの予測タスクである enwik8 で 1.37 ビット/文字(BPC)を達成し、従来の決定的および確率的手法を上回る性能を発揮した。

ABSTRACT

Recurrent neural nets are widely used for predicting temporal data. Their inherent deep feedforward structure allows learning complex sequential patterns. It is believed that top-down feedback might be an important missing ingredient which in theory could help disambiguate similar patterns depending on broader context. In this paper we introduce surprisal-driven recurrent networks, which take into account past error information when making new predictions. This is achieved by continuously monitoring the discrepancy between most recent predictions and the actual observations. Furthermore, we show that it outperforms other stochastic and fully deterministic approaches on enwik8 character level prediction task achieving 1.37 BPC on the test portion of the text.

研究の動機と目的

  • 過去の予測と実際の観測値の間の予測誤差(驚異度)が、再帰的ネットワークにおける推論中に意味のあるフィードバック信号として機能するかを調査すること。
  • LSTMの隠れ状態更新に時間的誤差情報を組み込むことで、系列モデルにおける一般化性能を向上させること。
  • 予測と観測の乖離に基づくフィードバックが、標準的なRNNや最先端のアーキテクチャを上回ることを示すこと。
  • 局所的な誤差信号のみを用いて、生物学的に妥当なトップダウンフィードバックのメカニズムを検討すること。

提案手法

  • モデルは、時刻 $ t-1 $ における予測分布に基づく真のトークンの負の対数尤度として定義されるフィードバック信号 $ s_t $ を導入し、これにより予測の驚異度を表す。
  • この $ s_t $ は学習可能な重み行列 $ V $ を通じて処理され、標準的な入力および再帰的接続に加えて、LSTMの隠れ状態更新に追加される。
  • 標準的なLSTMに加えて、追加のフィードバック経路を導入する:$ h_t = \tanh(W x_t + U h_{t-1} + V s_t + b) $ により、誤差を考慮した状態遷移を可能にする。
  • 誤差信号 $ s_t $ を通じた誤差逆伝播を可能にするために、時間遡及誤差逆伝播(BPTT)を変更し、フィードバック重み $ V $ のエンドツーエンド学習を可能にする。
  • シーケンス長 100、バッチサイズ 128、学習率 0.001 のAdagrad最適化を用い、切り捨てられたBPTTを適用する。
  • 従来のRNNとは異なり、誤差信号は学習後にもフィードバックとして利用可能であり、学習時および推論時にこのフィードバック機構が動作する。

実験結果

リサーチクエスチョン

  • RQ1過去の予測と実際の観測値の間の予測誤差(驚異度)が、再帰的ネットワークにおける推論中に有用なフィードバック信号として機能するか?
  • RQ2驚異度をフィードバック信号として組み込むことで、系列モデルタスクにおける一般化性能と予測精度が向上するか?
  • RQ3予測誤差に基づくフィードバック機構は、高層層の表現に基づく他のトップダウンフィードバック機構と比較してどのように異なるか?
  • RQ4局所的予測誤差に基づくフィードバック機構が、明示的な正則化を用いずに、最先端のモデルを上回る性能を発揮できるか?

主な発見

  • 提案されたフィードバックLSTMモデルは、enwik8 における文字レベル予測タスクで 1.37 ビット/文字(BPC)を達成し、新たな最先端の結果を樹立した。
  • グリッドLSTM(1.47 BPC)、標準LSTM(1.45 BPC)、ハイパーネットワーク(1.38 BPC)を含む、他のすべての決定的および確率的アプローチを上回った。
  • 明示的な正則化を用いなくても、フィードバック機構が一般化性能を向上させることを示しており、テストデータに対する優れた性能が裏付けられた。
  • スタックドまたは階層的なアーキテクチャを必要とせず、単一のLSTM層内でもフィードバック機構が有効に機能することが確認された。
  • 学習後に捨てられがちな予測誤差が、適切に統合されれば、推論時に貴重な信号となり得ることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。