Skip to main content
QUICK REVIEW

[論文レビュー] Tree Transformer: Integrating Tree Structures into Self-Attention

Yau-Shian Wang, Hung-yi Lee|arXiv (Cornell University)|Sep 14, 2019
Topic Modeling参考文献 29被引用数 11
ひとこと要約

この論文では、自己注意機構に階層的な木構造を統合する新しい手法であるTree Transformerを提案する。自己注意を用いて生テキストから構文的構成木を誘導する「構成子注意(Constituent Attention)」モジュールを導入することで、標準的なBERTスタイルのTransformerよりも解釈可能で人間の直感に沿った注意パターンを生成し、言語モデリングの困惑度を低下させる。

ABSTRACT

Pre-training Transformer from large-scale raw texts and fine-tuning on the desired task have achieved state-of-the-art results on diverse NLP tasks. However, it is unclear what the learned attention captures. The attention computed by attention heads seems not to match human intuitions about hierarchical structures. This paper proposes Tree Transformer, which adds an extra constraint to attention heads of the bidirectional Transformer encoder in order to encourage the attention heads to follow tree structures. The tree structures can be automatically induced from raw texts by our proposed "Constituent Attention" module, which is simply implemented by self-attention between two adjacent words. With the same training procedure identical to BERT, the experiments demonstrate the effectiveness of Tree Transformer in terms of inducing tree structures, better language modeling, and further learning more explainable attention scores.

研究の動機と目的

  • 標準的なTransformerの自己注意機構には階層的構造への認識が欠けているため、人間の文法的階層構造の直感と一致しない点を是正すること。
  • 教師ありパースツリーを必要とせず、生で未注釈なテキストから自動的に構成子木構造を誘導する手法を開発すること。
  • 注意ヘッドを文法的構成子内に限定することで、自己注意機構の解釈可能性とパフォーマンスを向上させること。
  • 木構造的注意機構が標準的なTransformerと比較して、言語モデリング性能と説明可能な注意パターンを向上させるかどうかを評価すること。

提案手法

  • 隣接する語を接続し、下位から上位へと階層的構成子を構築する自己注意を用いた「構成子注意(Constituent Attention)」モジュールを導入する。
  • 各Transformer層の注意ヘッドに木構造の制約を適用し、同じ文法的構成子内でのみ注目を向けるように強制する。
  • 構成子注意モジュールを追加する以外は、BERTと同一の事前学習および微調整手順を採用する。
  • 木構造と文脈表現を同時に学習できる微分可能でエンドツーエンドの訓練プロセスを採用する。
  • 位置エンコーディングと誘導された木構造を併用し、モデルに階層的位置情報の提供を行う。
  • 各ヘッドが誘導された木構造で定義された同じ構成子内でのみ注目を向けるように制約された、マルチヘッド自己注意機構を採用する。

実験結果

リサーチクエスチョン

  • RQ1人間が注釈したパースツリーに依存せずに、自己注意機構を階層的文法的構造に従わせることが可能か?
  • RQ2誘導された木構造を自己注意に統合することで、標準的なTransformerと比較して言語モデリング性能が向上するか?
  • RQ3Tree Transformerの注意ヘッドは、標準的なBERTスタイルのモデルと比較して、どの程度解釈可能で人間の直感に沿った注意パターンを示すか?
  • RQ4構成子注意モジュールは、弱教師ありの設定で、生テキストから一貫性があり人間の注釈に類似した構成子木を効果的に誘導できるか?
  • RQ5モデルサイズと学習手順を同一にした場合、Tree Transformerのパフォーランスは標準的なTransformerと比較してどの程度優れているか?

主な発見

  • 12層、58MパラメータでWSJテストセットにおいて45.6のテスト困惑度を達成し、同程度またはより高いパラメータ数を持つ標準Transformerモデルを上回った。
  • 標準Transformerよりも10%多くのパラメータを有するが、同じタスクで45.6 vs. 48.1の困惑度を記録し、構造的誘導バイアスによるパフォーマンス向上を示した。
  • 人間が注釈したパースと整合性のある構成子木が誘導されており、非教師ありパース評価で妥当性が確認された。
  • Tree Transformerの注意行列は、標準的なTransformerと比較して、より構造的で階層的なパターンを示し、文法的構成の直感に適合している。
  • 事前学習されたBERTから初期化しても性能を維持できるが、誘導された木構造はやや一貫性に欠け、BERTの注意ヘッドが異なる誘導バイアスを学習していることが示唆された。
  • 構成子注意モジュールの追加により、計算コストが20%増加し、パラメータが約10%増加したが、解釈可能性とモデリング品質の顕著な向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。