Skip to main content
QUICK REVIEW

[論文レビュー] Data Augmentation via Dependency Tree Morphing for Low-Resource Languages

Gözde Gül Şahin, Mark Steedman|arXiv (Cornell University)|Mar 22, 2019
Natural Language Processing Techniques参考文献 13被引用数 5
ひとこと要約

本稿では、低資源ニューラルNLPモデルの性能向上を目的として、従属木に基づくデータ拡張技術—'crop'および'rotate'—を提案する。従属木の根を中心に文の断片を単純化または再順序化することで、学習データのばらつきを増加させ、特にウーラル語族、スラブ語族、トゥルク語族に属する語彙が豊富に屈曲する言語において、品詞タグ付けの精度が顕著に向上する。

ABSTRACT

Neural NLP systems achieve high scores in the presence of sizable training dataset. Lack of such datasets leads to poor system performances in the case low-resource languages. We present two simple text augmentation techniques using dependency trees, inspired from image processing. We crop sentences by removing dependency links, and we rotate sentences by moving the tree fragments around the root. We apply these techniques to augment the training sets of low-resource languages in Universal Dependencies project. We implement a character-level sequence tagging model and evaluate the augmented datasets on part-of-speech tagging task. We show that crop and rotate provides improvements over the models trained with non-augmented data for majority of the languages, especially for languages with rich case marking systems.

研究の動機と目的

  • 限定された学習データのため、低資源言語におけるニューラルNLPモデルの性能が低いという問題に対処すること。
  • 文法的・形態的に複雑な言語に適したラベルを保持するデータ拡張技術を探ること。
  • 従属木に基づく拡張が、語順や格助詞の有無に差がある多様な言語系統に一般化可能かどうかを検討すること。
  • 低資源環境下における品詞タグ付けの精度に、'crop'および'rotate'操作が与える有効性を評価すること。
  • 将来のマルチリンガルNLPシステム設計を支援するため、拡張効果の言語固有のパターンを同定すること。

提案手法

  • 特定の焦点(例:主語、目的語)に関連する依存関係のリンク以外を削除することで'crop'拡張を実行し、より短く意味のある文を形成する。
  • 根ノードの周囲で柔軟な木断片(例:主語、目的語)を再順序することで'rotate'拡張を実行し、文法的・意味的構造を保持する。
  • 両方の拡張操作の構造的基盤として、Universal Dependenciesプロジェクトの従属木を使用する。
  • 言語間での一貫性ある評価を確保するため、統一された文字レベルの系列タグ付けモデルを実装する。
  • 低資源言語の学習データセットに拡張を適用し、拡張済みデータでモデルを微調整した後、元のテストデータセットで評価する。
  • 意味の保持が期待される、豊富な格助詞と柔軟な語順を持つ言語(例:トルコ語、フィンランド語、ロシア語)を優先する。

実験結果

リサーチクエスチョン

  • RQ1従属木の'crop'および'rotate'処理が、低資源言語における品詞タグ付け性能にどの程度向上効果をもたらすか。
  • RQ2どの言語系統がこれらの拡張技術から最も恩恵を受けるか、その理由は何か。
  • RQ3拡張の有効性が、特に格助詞システムを含む形態的豊かさと相関しているか。
  • RQ4回転処理によって学習データのばらつきがどの程度変化し、それが性能向上と相関しているか。
  • RQ5意味のずれを引き起こさずに、多様な言語系統に一般化可能か。

主な発見

  • 'crop'および'rotate'の両拡張手法は、ほとんどの低資源言語において品詞タグ付け精度を顕著に向上させる。特に、格助詞が豊富な言語で顕著な向上が見られた。
  • バルト語族、スラブ語族、ウーラル語族、トゥルク語族に属する言語が最も一貫した向上を示し、回転処理がより高いデータばらつきを生じたため、わずかに優れた結果を示した。
  • ゲルマン語族(例:ゴート語、アフリカーンス語、デンマーク語)では一貫した向上が観察されず、形態的マークが限定的で語順が固定されていることが原因と考えられる。
  • タミル語のようなドゥラヴィダ語族言語は、8つの異なる格助詞を持つことから顕著な向上を示した。これは、形態的豊かさが拡張の有効性を高めることを示している。
  • テルグ語は格助詞システムを持つにもかかわらず、限定的な向上を示した。これは、文法書の文から構成された木バンクの多様性が低く、表現力に欠けることが原因と考えられる。
  • 大多数のケースで文の意味が保持されたため、意味役割ラベリングやセンチメント分析などの下流タスクにも適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。