Skip to main content
QUICK REVIEW

[論文レビュー] StructFormer: Joint Unsupervised Induction of Dependency and Constituency Structure from Masked Language Modeling

Yikang Shen, Yi Tay|arXiv (Cornell University)|Dec 1, 2020
Natural Language Processing Techniques参考文献 40被引用数 7
ひとこと要約

StructFormer は、Transformer アーキテクチャ内での距離ベースのパーサー機構と依存関係制約付き自己注意機構を用いて、一括して依存構造と構成構造を誘導する、エンド・ツー・エンドの教師なしフレームワークを提案する。この手法は、学資源語態素(POS)タグや外部の監視信号を一切使用せずに、教師なし依存構造パーサー(46.2 UAS)およびマスクされた言語モデル化の最先端性能を達成する。

ABSTRACT

There are two major classes of natural language grammar -- the dependency grammar that models one-to-one correspondences between words and the constituency grammar that models the assembly of one or several corresponded words. While previous unsupervised parsing methods mostly focus on only inducing one class of grammars, we introduce a novel model, StructFormer, that can simultaneously induce dependency and constituency structure. To achieve this, we propose a new parsing framework that can jointly generate a constituency tree and dependency graph. Then we integrate the induced dependency relations into the transformer, in a differentiable manner, through a novel dependency-constrained self-attention mechanism. Experimental results show that our model can achieve strong results on unsupervised constituency parsing, unsupervised dependency parsing, and masked language modeling at the same time.

研究の動機と目的

  • 生のテキストから一括して依存構造と構成構造を誘導する統合的でエンド・ツー・エンドの教師なしフレームワークの開発。
  • 教師なしパーサーにおける学資源語態素タグや外部言語的監視信号への依存を排除すること。
  • 構文構造誘導を Transformer の自己注意機構に直接統合すること。
  • 誘導された依存構造がマスク言語モデル化の性能を向上させるかどうかを評価すること。
  • 1つのモデルが同時に教師なしパーサーと事前学習タスクの両方で優れた性能を達成できることを示すこと。

提案手法

  • モデルは、各トークンの構文的距離(T)と構文的高さ(Δ)を予測する距離ベースのパーサー機構を用い、依存関係と構成構造を一括で表現する。
  • T と Δ から、微分可能に親と従属関係の注意分布を計算し、有向依存関係を定義する。
  • 独自の依存関係制約付き自己注意機構により、各注意ヘッドが親または従属トークンにのみ注目するように制限し、標準的なフル注意機構を置き換える。
  • 注意機構は、親関係と従属関係の重み付き和を組み合わせることで、事前学習中に構造的インダクティブバイアスを学習可能にする。
  • モデルはマスク言語モデル化のタスク上でエンド・ツー・エンドに訓練され、勾配降下法によって構文構造が自然に出現する。
  • 最終的な依存グラフは、各トークンの予測された依存関係分布に対して argmax を適用することで抽出される。

実験結果

リサーチクエスチョン

  • RQ11つの教師なしモデルが、生のテキストから一括して依存構造と構成構造を誘導できるか?
  • RQ2微分可能な依存関係制約付き注意機構は、学資源語態素タグなしで、有向構文グラフを効果的に学習できるか?
  • RQ3誘導された構文構造は、マスク言語モデル化タスクの性能を向上させるか?
  • RQ4親関係と従属関係の注意関係の相対的寄与度は、パーサーと事前学習の性能にどのように影響するか?
  • RQ5提案されたフレームワークは、学資源語態素タグや事前学習済み埋め込みに依存する既存の教師なしパーサー手法と同等か、それ以上に競争力を持つか?

主な発見

  • StructFormer は、学資源語態素タグを使用せずに WSJ テストセットで UAS 46.2 を達成し、同条件下で多数の既存教師なしモデルを上回る性能を示した。
  • 無向依存関係の 61.6% を回復(UUAS)しており、構文的接続の強力な回復を示している。
  • 親関係または従属関係のいずれか一方のみを用いた場合、性能が著しく低下し、両方の関係がバランスの取れたパーサー性能を達成するために不可欠であることが示された。
  • モデルは初期層で親関係を優先的に処理し、深層に進むにつれて段階的に従属関係を統合する傾向を示しており、階層的注意学習が行われていると考えられる。
  • 誘導された依存構造はマスク言語モデル化の性能を向上させ、構文的インダクティブバイアスが事前学習を改善することを示している。
  • 本フレームワークは、1つの微分可能でエンド・ツー・エンドのアーキテクチャ内で、依存構造と構成構造の誘導を効果的に統合できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。