Skip to main content
QUICK REVIEW

[論文レビュー] Transformer Grammars: Augmenting Transformer Language Models with Syntactic Inductive Biases at Scale

Laurent Sartran, Samuel Barrett|arXiv (Cornell University)|Mar 1, 2022
Topic Modeling被引用数 4
ひとこと要約

この論文は、特殊なアテンションマスクと決定的で再帰的な木構造の線形化を用いて再帰的構文的合成を統合する、新しい種類のトランスフォーマーランゲージモデル、Transformerグラマー(TGs)を紹介する。この手法により、構文に敏感な言語モデルの性能が著しく向上する。TGsは、GPT-2-small、Gopher、Chinchillaといった強力なベースラインを上回り、構文一般化およびパース再ランク付けのタスクで優れた性能を発揮しているが、モデルサイズがはるかに小さく、トレーニングもはるかに速い。

ABSTRACT

We introduce Transformer Grammars (TGs), a novel class of Transformer language models that combine (i) the expressive power, scalability, and strong performance of Transformers and (ii) recursive syntactic compositions, which here are implemented through a special attention mask and deterministic transformation of the linearized tree. We find that TGs outperform various strong baselines on sentence-level language modeling perplexity, as well as on multiple syntax-sensitive language modeling evaluation metrics. Additionally, we find that the recursive syntactic composition bottleneck which represents each sentence as a single vector harms perplexity on document-level language modeling, providing evidence that a different kind of memory mechanism -- one that is independent of composed syntactic representations -- plays an important role in current successful models of long text.

研究の動機と目的

  • 再帰的構文的合成——小規模モデル(例:RNNGs)の主要なインダクティブバイアスであるが——が、現代のトランスフォーマーランゲージモデルにおいてもスケーリングされた環境で依然として有益であるかどうかを調査すること。
  • 再帰的ニューラルネットワークグラマー(RNNGs)のスケーラビリティの制限を克服するため、効率的なトランスフォーマー-XLアーキテクチャに構文的インダクティブバイアスを統合すること。
  • 構文的構造が文レベルのタスクにとどまらず、ドキュメントレベルの言語モデリングにおいても性能向上に寄与するかどうかを評価すること。
  • 構文一般化とパープレキシティのトレードオフ、特にモデルの語彙的コピー能力との関係を解明すること。
  • 構文的構造で制限されたアテンションメカニズムが、効率を損なわず構造的一般化を向上させることの可能性を検討すること。

提案手法

  • 線形化されたパースツリー内の構文的成分境界にのみアテンションを制限するタイプ付きで再帰的なアテンションマスクを、トランスフォーマー-XLアーキテクチャに追加し、構文的合成を強制する。
  • 各フレーズを非終端記号の決定的で階層的な合成として表現し、再帰的アテンションパターンを可能にするために、閉じる非終端記号を複製する。
  • 自己回帰的生成中に端末語と非終端記号のツリー構成要素を同時にモデリングし、モデルが文字列と構文的構造の両方を予測できるようにする。
  • ペン・ツリー・バンクとBLLIP-lgデータセットを用いて、文字列とそれに対応するフレーズ構造ツリーの同時確率分布を学習する。
  • 構文的整合性を維持しながらも、標準トランスフォーマーの効率性を保つように、構造化アテンションを活用した修正された自己回帰的デコードプロセスを実装する。
  • パープレキシティと構文一般化メトリクスにおける性能向上に寄与する構文的合成の寄与度を分離するために回帰分析を実施する。

実験結果

リサーチクエスチョン

  • RQ1構造化アテンションマスクを用いた再帰的構文的合成を導入することで、トランスフォーマーモデルにおけるスケーリングされた環境下でも言語モデリング性能が向上するか?
  • RQ2構文に依存しないトランスフォーマーと構文拡張モデルと比較して、Transformerグラマーの性能は、構文に敏感な評価ベンチマークでどうなるか?
  • RQ3再帰的構文的合成のインダクティブバイアスが、低パープレキシティに寄与する語彙的コピー能力に、どの程度悪影響を及ぼすか?
  • RQ4文単位のモデリングからドキュメント全体への拡張において、構文的インダクティブバイアスは依然として有益であるか?
  • RQ5明示的な構文的合成を持つモデルが、はるかに大きな事前学習済み言語モデルを上回る性能を、構文一般化タスクで示せるか?

主な発見

  • Transformerグラマーは、Huら(2020)が提唱した構文一般化ベンチマークで最先端の性能を達成し、GPT-2-small、Gopher、Chinchillaですらも、モデルサイズが250〜1000倍も小さく、学習データ量もはるかに少ないにもかかわらずそれを上回った。
  • TGsは、構文に依存しないトランスフォーマー-XL(terminals)ベースラインおよびより強力なTXL(trees)モデルよりも、構文一般化およびパース再ランク付けタスクで顕著に優れた性能を発揮した。
  • アテンションに制限のない、端末と非終端記号の両方を予測するTXL(trees)モデルは、文単位のパープレキシティにおいてTGsをわずかに上回った。これは、TGsにおけるアテンション制限が語彙的コピー能力に悪影響を及ぼしている可能性を示唆している。
  • ドキュメントレベルの言語モデリングでは、TGsは端末のみを扱うTXL(terminals)およびTXL(trees)モデルの両方と比べて著しく性能を発揮できなかった。これは、1つの統合された構文的表現だけでは長距離文脈モデリングには不十分であることを示している。
  • 回帰分析により、再帰的構文的合成が構文一般化を向上させる一方で、語彙的コピー能力が低下することを確認した。これは、構文的モデリングと語彙的モデリングの目的の間で部分的な分離が生じていることを示している。
  • TGsはバッチ処理されたRNNGsよりもはるかに高速にトレーニング可能であり、トランスフォーマー枠組み内での構文的インダクティブバイアスの効率的スケーリングが可能であることを実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。