Skip to main content
QUICK REVIEW

[論文レビュー] The Galactic Dependencies Treebanks: Getting More Data by Synthesizing New Languages

Dingquan Wang, Jason Eisner|arXiv (Cornell University)|Oct 10, 2017
Natural Language Processing Techniques参考文献 25被引用数 4
ひとこと要約

本稿では、実際のUniversal Dependencies treebankの依存関係を確率的に再順序化することで生成された約50,000の人工言語からなる合成treebank「Galactic Dependencies 1.0」を紹介する。これらの合成言語でパーサーを訓練することで、単一ソースの転移学習が多様なターゲット言語においてUASを顕著に向上させることを示し、実言語固有の特徴に過剰適合することなく、低資源言語への一般化を向上させることを示している。

ABSTRACT

We release Galactic Dependencies 1.0---a large set of synthetic languages not found on Earth, but annotated in Universal Dependencies format. This new resource aims to provide training and development data for NLP methods that aim to adapt to unfamiliar languages. Each synthetic treebank is produced from a real treebank by stochastically permuting the dependents of nouns and/or verbs to match the word order of other real languages. We discuss the usefulness, realism, parsability, perplexity, and diversity of the synthetic languages. As a simple demonstration of the use of Galactic Dependencies, we consider single-source transfer, which attempts to parse a real target language using a parser trained on a "nearby" source language. We find that including synthetic source languages somewhat increases the diversity of the source pool, which significantly improves results for most target languages.

研究の動機と目的

  • 低資源または未知の言語における非教師あり言語構造発見のための訓練データ不足に対処すること。
  • 文法的・屈折的現実性を保ちつつ、多様で高リソースな合成言語を生成するスケーラブルな手法を開発すること。
  • 合成言語が、特に実際のソース言語が限られている状況において、構文解析における転移学習性能を向上させられるかどうかを評価すること。
  • 未知の言語的構造においてNLPシステムの訓練と評価に再利用可能で拡張可能なリソースを提供すること。

提案手法

  • 実際のUniversal Dependencies treebankの名詞および動詞の従属語を確率的に並べ替えることで、他の実際の言語の語順を模倣する合成treebankを生成する。
  • 言語的現実性を維持し、特徴学習を可能にするために、品詞タグ、屈折的特徴、語の共起パターンを保持する。
  • 任意の既存のアノテート済みコーパスを、合成言語の語順に従って語を再配置することで、合成言語に変換するためのパイプラインを提供する。
  • 依存関係構造を維持しながら線形順序を変更する制御された再配置プロセスを用いることで、語順に系統的な変異をもたらす。
  • モデルが人間の言語全体に一般化することを目的として、多様で解析可能で十分に現実的な合成言語を設計する。
  • 勾配上昇などの最適化技術を用いて、合成言語をターゲット言語の表面統計に適合させることが可能となる。

実験結果

リサーチクエスチョン

  • RQ1実際のtreebankから派生した合成言語は、低資源ターゲット言語における構文解析の転移学習性能を向上させることができるか?
  • RQ2合成ソース言語の導入が、単一ソース転移学習の多様性と性能に与える影響は何か?
  • RQ3実言語と比較して、合成言語はどの程度言語的現実性、解析可能性、周辺度(perplexity)を保持しているか?
  • RQ4合成データは、多言語NLPモデルにおける特定の語彙的項目への過剰適合を軽減できるか?
  • RQ5合成言語で訓練されたパーサーの性能は、多数の実際のターゲット言語に一般化するか?

主な発見

  • 合成ソース言語を単一ソース転移学習に組み込むことで、大多数のターゲット言語でUASが顕著に向上し、平均UASは実際のソースのみの場合の42.03%から、合成ソースを追加した場合の44.55%に上昇した。
  • 特にエストニア語(ET)のような低資源言語においてその改善が顕著で、UASは54.81%から56.07%に上昇した。
  • この手法によりソースプールの多様性が向上し、モデルパラメータの分散が低減され、未知の言語への一般化が向上した。
  • 品詞タグが粗い(正確度約50%)状態でも、合成ソースの導入によりUASが向上したため、弱教師付き学習に対しても頑健であることが示された。
  • 合成言語は十分に現実的かつ解析可能で、周辺度が低く構造的多様性が高いため、訓練および評価に適している。
  • このフレームワークにより、任意の既存のアノテート済みコーパスから合成言語のラベル付きデータを生成可能であり、分野を越えたデータ拡張が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。