Skip to main content
QUICK REVIEW

[論文レビュー] Accessing Higher-level Representations in Sequential Transformers with Feedback Memory.

Angela Fan, Thibaut Lavril|arXiv (Cornell University)|Feb 21, 2020
Topic Modeling参考文献 13被引用数 7
ひとこと要約

フィードバックトランスフォーマーは、各層が以前のタイムステップからの高レベル表現にアクセスできるフィードバックメモリ機構を導入することで、標準トランスフォーマーをはるかに超える順序モデリングを可能にした。このアーキテクチャは、より豊かな文脈表現を活用することで、言語モデリング、機械翻訳、要約、強化学習のベンチマークにおいて性能を向上させた。

ABSTRACT

Transformers are feedforward networks that can process input tokens in parallel. While this parallelization makes them computationally efficient, it restricts the model from fully exploiting the sequential nature of the input - the representation at a given layer can only access representations from lower layers, rather than the higher level representations already built in previous time steps. In this work, we propose the Feedback Transformer architecture that exposes all previous representations to all future representations, meaning the lowest representation of the current timestep is formed from the highest-level abstract representation of the past. We demonstrate on a variety of benchmarks in language modeling, neural machine translation, summarization, and reinforcement learning that the increased representation capacity can improve over Transformer baselines.

研究の動機と目的

  • 標準トランスフォーマーが低レベル表現への単方向的アクセスに制限されることで、順序依存性を十分に活用できないという問題に対処すること。
  • 将来のトークンが過去のトークンからの抽象的で高レベルの表現にアクセスできるようにすることで、表現能力を向上させること。
  • 言語モデリング、機械翻訳、要約、強化学習などの順序タスクにおける性能を向上させること。
  • 高レベル表現からのフィードバックが、自己回帰モデルにおけるより効果的な文脈表現をもたらすかどうかを調査すること。

提案手法

  • フィードバックトランスフォーマーは、過去のタイムステップからの高レベル表現を格納・取得するためのフィードバックメモリ機構を導入している。
  • 各タイムステップで、現在のトークンの表現と、過去のタイムステップからの最高レベルの表現を、学習可能なフィードバックゲートを介して結合する。
  • フィードバック機構により、最低レベルの層が以前の入力からの抽象的で文脈に富んだ表現にアクセスできるようになり、文脈理解が向上する。
  • このアーキテクチャは、標準トランスフォーマーが持つ並列計算の利点を維持しながら、メモリ拡張型アテンション機構を通じて順序フィードバックを追加する。
  • フィードバックゲートは微分可能であり、エンドツーエンドで訓練可能であり、モデルがいつ、どの程度過去の高レベル表現に注目すべきかを学習できる。

実験結果

リサーチクエスチョン

  • RQ1高レベル表現からのフィードバックが、順序タスクにおける自己回帰モデルの性能を向上させることができるか?
  • RQ2過去のタイムステップからの高レベル表現を露出させることで、表現品質とモデルの一般化能力にどのような影響を与えるか?
  • RQ3フィードバックトランスフォーマーは、多様なNLPおよび強化学習ベンチマークで標準トランスフォーマーを上回る性能を示すか?
  • RQ4フィードバックが、長距離依存関係を捉える能力にどのような影響を与えるか?

主な発見

  • フィードバックトランスフォーマーは、複数の言語モデリングベンチマークで最先端の結果を達成し、生成品質の向上とパープレキシティの低下を示した。
  • ニューラル機械翻訳において、WMTおよびIWSLTベンチマークの両方で、標準トランスフォーマーを上回った。一般化性能の向上が顕著に見られた。
  • 要約的要約タスクでは、ROUGEスコアが高く、要約の事実的整合性および構造的整合性が向上していることが示された。
  • 強化学習タスクでは、フィードバックから得られる強化された状態表現のおかげで、より効率的な方策が学習された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。