Skip to main content
QUICK REVIEW

[論文レビュー] Learning to update Auto-associative Memory in Recurrent Neural Networks for Improving Sequence Memorization

Wei Zhang, Bowen Zhou|arXiv (Cornell University)|Sep 19, 2017
Topic Modeling参考文献 27被引用数 8
ひとこと要約

この論文は、タスクの目的関数と同時に学習するメモリ更新ルールを統合することで、長文脈の記憶を向上させる、再帰的ニューラルネットワーク(RNN)内での学習可能で自己関連記憶メカニズムを提案する。情報的なグリムプスを個別のメモリセルに導くルーターネットワークを統合することで、複数の自己関連記憶を用いたモデルはMNISTで0.45%のテスト誤差を達成し、単一メモリベースライン比で8%の相対的改善を示した。これは、複雑なシーケンス符号化における能力と耐障害性の向上を示している。

ABSTRACT

Learning to remember long sequences remains a challenging task for recurrent neural networks. Register memory and attention mechanisms were both proposed to resolve the issue with either high computational cost to retain memory differentiability, or by discounting the RNN representation learning towards encoding shorter local contexts than encouraging long sequence encoding. Associative memory, which studies the compression of multiple patterns in a fixed size memory, were rarely considered in recent years. Although some recent work tries to introduce associative memory in RNN and mimic the energy decay process in Hopfield nets, it inherits the shortcoming of rule-based memory updates, and the memory capacity is limited. This paper proposes a method to learn the memory update rule jointly with task objective to improve memory capacity for remembering long sequences. Also, we propose an architecture that uses multiple such associative memory for more complex input encoding. We observed some interesting facts when compared to other RNN architectures on some well-studied sequence learning tasks.

研究の動機と目的

  • 標準的なアーキテクチャが隠れ状態の圧縮と勾配消失のため、RNNにおける長文脈記憶に困難を抱えることに対処する。
  • 固定された更新ルールと限界のある容量を抱える、関連記憶モデルにおけるルールベースのメモリ更新の制限を克服する。
  • タスクの目的関数とエンドツーエンドで学習可能なメモリ更新ルールを用いることで、RNNの長文脈タスクにおける性能を向上させる。
  • 入力パターンの非線形的かつタイプ特異的処理を可能にするために、ルーティング機構を備えた複数の自己関連記憶の使用を検討する。
  • 学習可能なメモリ更新ルールとマルチメモリアーキテクチャが、標準的なRNNおよびアテンション機構よりも、シーケンス学習タスクで優れた性能を示すかどうかを評価する。

提案手法

  • ルールベースのエネルギー最小化に代わって勾配ベース最適化を用いる、微分可能で学習可能な自己関連記憶用のメモリ更新ルールを提案する。
  • ヒューリスティック(例:非黒ピクセル数>10)を用いてグリムプスを情報的か非情報的かに分類し、別々のメモリセルにルーティングするルーターネットワークを導入する。
  • 各メモリセルが異なるガウス分布で初期化された別個の重み行列を用いる二重メモリアーキテクチャを採用し、コンテンツの差別化を強化する。
  • RNNの隠れ状態に条件づけられたグリムプスネットワークを用い、動的な視覚的グリムプスを生成し、その後メモリおよびルーターコンponentが処理する。
  • 修正されたメモリ更新式を適用:$ g(A_t, \mathbf{w} \odot \mathbf{h}_t + \mathbf{V} \mathbf{g}_t) $、ここで$ \mathbf{g}_t $はグリムプスベクトル、$ \mathbf{V} $は学習可能な投影行列である。
  • バックプロパゲーションを用いてエンドツーエンドで全モデルを訓練し、RNN、メモリ更新、ルーティングコンponentを同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1学習可能なメモリ更新ルールを自己関連記憶に適用することで、固定されたルールベースの更新機構と比較して、RNNにおける長文脈記憶が向上するか?
  • RQ2ルーティング機構を備えた複数の自己関連記憶セルを用いることで、モデルの複雑で多様な入力パターンの符号化能力が向上するか?
  • RQ3単純なヒューリスティック(例:非黒ピクセル数)を用いたルーターネットワークが、情報的グリムプスと非情報的グリムプスを効果的に分離できるか、シーケンスタスクの分類精度が向上するか?
  • RQ4提案手法(WeiNet)の性能は、標準的なRNN、Fast Weights、およびアテンションベースのモデルと比較して、長文脈シーケンス学習タスクで優れているか?
  • RQ5最適なメモリセル数は何か?2つを超えるセル数の増加は、トレーニングの不安定性やリターンの逓減を引き起こすか?

主な発見

  • 単一の自己関連記憶を用いたWeiNetは、MNISTの数字分類タスクで0.45%のテスト誤差を達成し、単一メモリベースライン比で誤差率が8%相対的に低下した。
  • ヒューリスティックベースのルーターを用いた2つのメモリセルは、単一メモリモデルを上回る性能を示し、タイプ特異的メモリ処理が表現学習を強化していることを示した。
  • 2つを超えるメモリセルの増加はテスト精度の向上をもたらさず、追加の容量がトレーニングの不安定性とリターンの逓減を引き起こす可能性を示唆した。
  • 動的アテンションと複数のメモリを備えたモデルは、固定アテンションベースラインを上回った。これは、適応的なグリムプス選択が情報保持を改善することを確認した。
  • 非黒ピクセル数の閾値(p=10)を用いたルーターは、ノイズを効果的にフィルタリングし、分類の耐障害性を向上させた。
  • 学習可能なメモリ更新ルールは、ルールベースの関連記憶よりも優れた長文脈符号化を可能にした。これは、シーケンス学習ベンチマークでの優れた性能によって裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。