Skip to main content
QUICK REVIEW

[論文レビュー] Towards Deep Learning in Hindi NER: An approach to tackle the Labelled Data Scarcity

Vinayak Athavale, Shreenivas Bharadwaj|arXiv (Cornell University)|Oct 31, 2016
Topic Modeling参考文献 8被引用数 18
ひとこと要約

本稿では、ヒンディー語 Named Entity Recognition (NER) のための双方向LSTMベースのニューラルモデルを提案する。このモデルは、手作業による特徴量、地名帳、語彙解析を回避し、無教師で事前学習された単語埋め込みを活用することで、ラベル付きデータが限られた状況でも高い性能を発揮する。本研究では、3,199文のラベル付きデータのみを用いて、ICON 2013 ヒンディー語 NER データセットで77.48%のF1スコアを達成し、深層学習が事前学習された埋め込みと組み合わせることで、限られたアノテーションデータでも有効であることを示している。

ABSTRACT

In this paper we describe an end to end Neural Model for Named Entity Recognition NER) which is based on Bi-Directional RNN-LSTM. Almost all NER systems for Hindi use Language Specific features and handcrafted rules with gazetteers. Our model is language independent and uses no domain specific features or any handcrafted rules. Our models rely on semantic information in the form of word vectors which are learnt by an unsupervised learning algorithm on an unannotated corpus. Our model attained state of the art performance in both English and Hindi without the use of any morphological analysis or without using gazetteers of any sort.

研究の動機と目的

  • ヒンディー語 NER におけるラベル付きデータの不足が深層学習モデルの利用を制限するという問題に取り組む。
  • 言語固有の特徴量、地名帳、ルールベースのコンponents に依存しない、言語に依存しない NER システムの開発を目的とする。
  • 事前学習された単語埋め込みが、ヒンディー語のような低リソースのインド諸言語における NER 性能向上にどの程度有効であるかを評価する。
  • RNNベースのモデル、特に双方向LSTMが、文法的変形や自由語順言語であるヒンディー語に対して、言語処理の前処理なしで良好に一般化できるかどうかを検証する。
  • 最小限の監視情報で利用可能なスケーラブルで移行可能なフレームワークを、低リソースのインド諸言語の NER に確立する。

提案手法

  • モデルは、各トークンの左および右の文脈からの文脈的依存関係を捉えるために、双方向LSTMアーキテクチャを用いる。
  • 単語埋め込みは、大規模なアノテーションなしのヒンディー語コーパス上で無教師スキップグラムモデルを用いて事前学習される。これにより、意味的および句読点的関係が捉えられる。
  • 事前学習された埋め込みは、LSTMの入力層の初期化に使用され、大規模なラベル付きデータセットの必要性が低減される。
  • モデルは、交差エントロピー損失と確率的勾配降下法を用いて、小規模なラベル付きデータセット上でエンドツーエンドで訓練される。
  • アーキテクチャは、手作業による特徴量、地名帳、語彙解析のいずれの処理も避けるもので、学習された表現にのみ依存する。
  • 性能評価は、テストセットにおける標準的な NER メトリクス(精度、再現率、F1スコア)を用いて実施される。

実験結果

リサーチクエスチョン

  • RQ1言語固有の特徴量や地名帳に依存せずに、深層学習モデルがヒンディー語 NER で優れた性能を発揮できるか?
  • RQ2無教師で事前学習された単語埋め込みは、低リソースのインド諸言語における NER 性能向上にどの程度有効か?
  • RQ3双方向LSTMアーキテクチャは、ヒンディー語の自由語順および語形変化の複雑さを扱う際に、一方向RNN や通常のLSTM よりも優れているか?
  • RQ4限られたラベル付きデータの下で、モデルの深さ(1層対2層)が性能にどの程度影響を及ぼすか?
  • RQ51つのモデルアーキテクチャが、特徴量の再設計なしに英語やヒンディー語といった複数の言語に一般化できるか?

主な発見

  • GloVe-300埋め込みを用いた提案されたBi-LSTMモデルは、地名帳や手作業による特徴量なしで、CoNLL 2003 英語データセットで90.32%のF1スコアを達成した。
  • ICON 2013 ヒンディー語 NER データセットでは、3,199文のラベル付きデータのみを用いて、77.48%のF1スコアを達成し、地名帳なしの先行手法を上回った。
  • GloVe-300埋め込みと1層のBi-LSTMを用いたモデルが最高の性能(開発セットで78.60%、テストセットで77.48%のF1スコア)を示し、深層ネットワークが限られたデータでは過学習を引き起こす可能性があることを示唆した。
  • 双方向LSTMは、一方向RNN やLSTM よりも顕著に優れた性能を示し、前向きおよび後向きの文脈をモデル化することがNERにおいて極めて重要であることを示した。
  • 事前学習された単語埋め込みで初期化されたモデルは、ランダム初期化のモデルよりも著しく優れた性能を示し、データが少ない環境下での意味的事前学習の重要性を強調した。
  • ルールベースのコンponents や地名帳、語彙解析を一切使用せず、英語およびヒンディー語 NER で最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。