Skip to main content
QUICK REVIEW

[論文レビュー] Frustratingly Short Attention Spans in Neural Language Modeling

Michał Daniluk, Tim Rocktäschel|arXiv (Cornell University)|Feb 15, 2017
Topic Modeling被引用数 10
ひとこと要約

この論文は、予測、メモリのキー設定、値の取得のための出力表現を分離することで、ベースラインのLSTMよりも著しく誤り度(perplexity)を改善する、キーバリュープレディクト注意メカニズムを提案する。驚くべきことに、モデルは主に最近の5つのトークン表現に依存しており、単純なベースラインとして最後の3つの出力を連結する手法が、複雑な注意メカニズムを上回るか同等の性能を発揮する。

ABSTRACT

Neural language models predict the next token using a latent representation of the immediate token history. Recently, various methods for augmenting neural language models with an attention mechanism over a differentiable memory have been proposed. For predicting the next token, these models query information from a memory of the recent history which can facilitate learning mid- and long-range dependencies. However, conventional attention mechanisms used in memory-augmented neural language models produce a single output vector per time step. This vector is used both for predicting the next token as well as for the key and value of a differentiable memory of a token history. In this paper, we propose a neural language model with a key-value attention mechanism that outputs separate representations for the key and value of a differentiable memory, as well as for encoding the next-word distribution. This model outperforms existing memory-augmented neural language models on two corpora. Yet, we found that our method mainly utilizes a memory of the five most recent output representations. This led to the unexpected main finding that a much simpler model based only on the concatenation of recent output representations from previous time steps is on par with more sophisticated memory-augmented neural language models.

研究の動機と目的

  • 出力表現の役割を明示的に分離することで、長距離依存性を活用するのを困難にしているニューラル言語モデルの訓練を改善すること。
  • 注意メカニズムにおける予測、キー、値の機能を分離することで、標準的な注意メカニズムよりも性能が向上するかどうかを調査すること。
  • 最近の出力表現を連結する単純なモデルが、より複雑なメモリ拡張アーキテクチャを上回る性能を発揮するかどうかを評価すること。
  • 実際の状況において、メモリ拡張ニューラル言語モデルの有効な注意スパンは何かを特定すること。

提案手法

  • 各時刻ステップで、次の単語を予測するためのベクトル、注意のためのキー、メモリの取得のための値の3つの異なるベクトルが出力される。
  • 注意メカニズムは、現在の隠れ状態と過去のメモリキー間の学習された適合関数を用いて、注意スコアで重み付けされたコンテキストベクトルを計算する。
  • 最後のL個の出力表現のスライディングウインドウが微分可能なメモリとして維持され、このウインドウ上で注意が計算される。
  • キーバリュープレディクトメカニズムは、出力を3つのコンponent(予測、キー、値)に分離することで、個々のベクトルへの機能的過負荷を軽減する。
  • 注意やメモリコンponentsを含まない、最後の3つの出力表現を連結して次の単語を予測する単純なベースラインモデルが導入される。
  • WikipediaおよびChildren’s Book Test(CBT)コーパスを用いて、モデル間の誤り度と正答率を比較する実験が実施される。

実験結果

リサーチクエスチョン

  • RQ1注意メカニズムにおける予測、キー、値の機能を分離することで、ニューラル言語モデルの性能が向上するか?
  • RQ2実際の状況において、メモリ拡張ニューラル言語モデルは長距離依存性をどれほど効果的に捉えられるか?
  • RQ3最近の出力表現を連結する単純なモデルが、より複雑な注意ベースのアーキテクチャを上回る性能を発揮するか?
  • RQ4最先端のメモリ拡張言語モデルの有効な注意スパンは何か?

主な発見

  • Wikipediaコーパスにおいて、キーバリュープレディクトモデルは、バニラLSTMに対して9.4ポイント、RM(+tM-g)モデルに対して4.3ポイントの誤り度の低減を達成した。
  • CBTデータセットでは、キーバリュープレディクトモデルは動詞の正答率で1.0ポイント、前置詞の正答率で1.7ポイント向上した。
  • メモリウインドウ上で注意を計算しているにもかかわらず、すべての注意モデルは主に最近の5つの表現に注目しており、有効な注意スパンが短いことが示された。
  • 単純な$4$-gram RNNモデル(最後の3つの出力表現を連結)は、より複雑なキーバリュープレディクトモデルと同等またはそれ以上の誤り度を達成した。
  • 注意ウインドウのサイズを拡大しても性能は顕著に向上せず、現在のアーキテクチャでは長距離メモリの有用性が限定的であることが示唆された。
  • 結果から、注意メカニズムを用いても、長距離依存性を活用するのを訓練することが、依然として著しく困難であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。