Skip to main content
QUICK REVIEW

[論文レビュー] Fine-Grained Prediction of Syntactic Typology: Discovering Latent Structure with Supervised Learning

Dingquan Wang, Jason Eisner|arXiv (Cornell University)|Oct 11, 2017
Natural Language Processing Techniques参考文献 30被引用数 6
ひとこと要約

本稿では、語の品詞(POS)列のみを用いて、言語内の57種類の依存構造的関係の方向性(右被節語型か左被節語型か)を予測する教師あり学習手法を提案する。実言語と合成言語の混合データで学習することで、dobj や amod のような関係がどれだけ右被節語型であるかの頻度を高い精度で推定でき、文法誘導のベースラインを上回り、品詞タグのノイズがある状況でも頑健に一般化する。

ABSTRACT

We show how to predict the basic word-order facts of a novel language given only a corpus of part-of-speech (POS) sequences. We predict how often direct objects follow their verbs, how often adjectives follow their nouns, and in general the directionalities of all dependency relations. Such typological properties could be helpful in grammar induction. While such a problem is usually regarded as unsupervised learning, our innovation is to treat it as supervised learning, using a large collection of realistic synthetic languages as training data. The supervised learner must identify surface features of a language's POS sequence (hand-engineered or neural features) that correlate with the language's deeper structure (latent trees). In the experiment, we show: 1) Given a small set of real languages, it helps to add many synthetic languages to the training data. 2) Our system is robust even when the POS sequences include noise. 3) Our system on this task outperforms a grammar induction baseline by a large margin.

研究の動機と目的

  • 構文木ではなく、POSタグ付きコーパスのみを用いて、言語内の依存関係の方向性(例:dobj, amod)を予測すること。
  • 合成言語を用いた教師あり学習が、未観測の実言語への一般化性能を向上させるかどうかを調査すること。
  • 表面的なPOS列から潜在的な構文構造を抽出する手法を開発し、多言語NLPにおける言語埋め込みを可能にすること。
  • WALSのような手動で構築されたタイプロジー・データベースが不完全または一貫性に欠ける可能性があるのに対し、データ駆動型の代替手段を提供すること。
  • 基本的な語順傾向に関する事前知識を提供することで、文法誘導を支援すること。

提案手法

  • モデルは、各依存関係の方向性スコア([0,1]の範囲)をラベルとして用いる教師あり学習タスクとして構文的タイプロジー予測を定式化する。
  • 学習データには、確率的文法により生成された1,000種類の合成言語に加え、Universal Dependenciesプロジェクトの100種類の実言語が含まれる。
  • 特徴量はPOS列から抽出され、手動で設計されたもの(例:POSビグラム、トリグラム)またはニューラルネットワークによって学習されるものがある。
  • マルチアウトプット回帰器が、57種類のUD依存タイプの方向性を同時に予測し、関係の頻度に応じて損失を重み付ける。
  • ホールドアウトされた実言語を用いて評価し、平均絶対誤差(MAE)と方向性スペクトルの順序付け精度を測定する。
  • 実世界のアノテーション誤りを模倣するために、POS列にノイズを導入し、耐性をテストする。

実験結果

リサーチクエスチョン

  • RQ1実言語の未観測言語における構文的方向性予測において、合成言語を用いた教師あり学習が、非教師学習またはゼロショット手法に比べて性能を向上させるか?
  • RQ2合成言語の導入が、実言語データのみで学習したモデルの一般化性能に与える影響はいかほどか?
  • RQ3入力がノイズを含んでも、POS列のみで学習したモデルが微細な依存関係の方向性をどれほど正確に予測できるか?
  • RQ4予測された方向性ベクトルが、言語埋め込みや文法誘導の事前知識として有効に機能するか?
  • RQ5本モデルは、既存の文法誘導ベースラインを上回り、基本的な語順傾向を捉えられるか?

主な発見

  • 学習データに合成言語を追加することで、ホールドアウトされた実言語における性能が顕著に向上し、タイプロジー予測におけるデータ拡張の有効性が示された。
  • 新しい言語において57種類のすべての依存タイプの方向性を同時に予測する際、総合誤差(MAE < 0.1)が低く抑えられ、ゴールスタンダードのアノテーションに近い結果が得られた。
  • POS列にノイズを加えてもモデルは頑健に保たれ、タグの20%までが損傷していても高い予測精度を維持した。
  • 文法誘導ベースラインに比べ、方向性予測において大幅に優れた性能を示し、タイプロジー事前知識が文法誘導を支援できることを示唆した。
  • モデルは方向性のスケールに沿って言語を順序付けでき、タイプロジーの多様性にわたって一貫性があり意味のある一般化を示した。
  • この設定ではニューラル特徴量が手動特徴量を上回らなかったが、今後は語の分散表現と組み合わせることでより効果的になる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。