Skip to main content
QUICK REVIEW

[論文レビュー] Adding Recurrence to Pretrained Transformers for Improved Efficiency and Context Size

Davis Yoshida, Allyson Ettinger|arXiv (Cornell University)|Aug 16, 2020
Topic Modeling参考文献 20被引用数 4
ひとこと要約

この論文では、メモリや計算量を増加させずに、長期間のコンテキスト処理と効率性を向上させるために、軽量な再帰モジュールを事前学習済みトランスフォーマー言語モデルに追加する手法を提案する。1つのウィンドウから次のウィンドウに固定サイズの表現を伝えることで、モデルは長距離依存関係を維持し、同じ計算およびメモリ予算のもとで、標準の微調整済みGPT-2よりもPG-19およびWikiText-103でより良いパープレキシティを達成する。

ABSTRACT

Fine-tuning a pretrained transformer for a downstream task has become a standard method in NLP in the last few years. While the results from these models are impressive, applying them can be extremely computationally expensive, as is pretraining new models with the latest architectures. We present a novel method for applying pretrained transformer language models which lowers their memory requirement both at training and inference time. An additional benefit is that our method removes the fixed context size constraint that most transformer models have, allowing for more flexible use. When applied to the GPT-2 language model, we find that our method attains better perplexity than an unmodified GPT-2 model on the PG-19 and WikiText-103 corpora, for a given amount of computation or memory.

研究の動機と目的

  • 事前学習済みトランスフォーマーの微調整におけるメモリおよび計算コストを削減しながら、性能を維持または向上させること。
  • 標準トランスフォーマーの固定コンテキストサイズの制限を克服し、より長いシーケンスの処理を可能にすること。
  • 既存の事前学習済みモデル(例:GPT-2)を、多様なドメインや言語においてより効率的かつ柔軟に使用できることを可能にすること。
  • 学習可能な再帰メカニズムを介して、重複しないテキストウィンドウ間で長距離の文脈情報を伝達できること。
  • 再トレーニングを必要とせず、すでに訓練済みのモデルと即座に統合可能なプラグアンドプレイな手法を提供すること。

提案手法

  • 事前学習済みトランスフォーマーの微調整プロセスに再帰モジュールを追加し、各入力ウィンドウの隠れ状態から固定サイズのコンテキスト表現を計算する。
  • この表現が次なるウィンドウの処理中に保持され、メモリ状態として使用されることで、ウィンドウ間での情報伝達が可能になる。
  • 再帰メカニズムはアテンションメカニズムとは独立して動作し、元のモデルのインダクティブバイアスを保ちつつ、有効なコンテキスト長を拡張する。
  • 推論時には重複しないウィンドウ(非重複ウィンドウ)が使用されるが、再帰により過去のウィンドウからの情報が現在の予測に影響を与える。
  • 再帰モジュールは、標準的な微調整と同様に、モデル全体とエンドツーエンドで訓練され、元のトランスフォーマーのアーキテクチャに変更を加える必要がない。
  • このアプローチは、標準的な微調整と同等のメモリフットプリントを維持し、計算量とパープレキシティの間で制御可能なトレードオフを可能にする。

実験結果

リサーチクエスチョン

  • RQ1軽量な再帰モジュールは、メモリや計算量の増加なしに、事前学習済みトランスフォーマーの性能を向上させることができるか?
  • RQ2再帰メカニズムは、事前学習済みトランスフォーマーにおいて、重複しないテキストウィンドウ間で長距離依存関係をどの程度効果的に伝達できるか?
  • RQ3この手法は、固定入力サイズを超えて、標準トランスフォーマーの有効コンテキスト長をどの程度まで拡張できるか?
  • RQ4再帰メカニズムは、長文生成タスクにおける一貫性および参照解決をどの程度向上させるか?
  • RQ5この手法は、再トレーニングを必要とせず、既存の事前学習済みモデル(例:GPT-2)を用いて長コンテキストタスクの性能を向上させることができるか?

主な発見

  • 提案手法は、同じ計算およびメモリ予算のもとで、PG-19およびWikiText-103ベンチマークにおいて、標準の微調整済みGPT-2よりも優れたパープレキシティを達成した。
  • 再帰モジュールは、トピックの高レベルな情報や代名詞の参照を、ウィンドウ間で効果的に伝達しており、生成サンプルにおける適切な代名詞の使用がその証拠である。
  • 学習された再帰メカニズムのおかげで、ウィンドウが非重複であっても、長距離依存関係の処理が改善された。
  • 定性的な分析から、再帰メカニズムがボトルネックとして機能し、キャラクタの識別子や物語の構造といった重要な情報を保持していることが示された。
  • この手法により、元のアーキテクチャが許容する範囲を超えて、事前学習済みモデルをより長いコンテキストで効果的に使用できるようになり、柔軟性と適用範囲が拡大された。
  • このアプローチは、既存のアーキテクチャ的変更と直交しており、スパースアテンションやウィンドウドアテンションなどの手法と組み合わせることでさらなる向上が得られる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。