Skip to main content
QUICK REVIEW

[論文レビュー] An HMM Based Named Entity Recognition System for Indian Languages: The JU System at ICON 2013

Vivekananda Gayen, Kamal Sarkar|arXiv (Cornell University)|May 28, 2014
Natural Language Processing Techniques参考文献 10被引用数 19
ひとこと要約

本論文は、インド語向けに開発された隠れマルコフモデル(HMM)に基づく名前付きエンティティ抽出(NER)システムを、ICON 2013 NLPツールコンテストで評価したものである。このシステムは、ベンガル語で0.8599、英語で0.7704、ヒンディ語で0.7520のFスコアを達成し、マラタ語、パンジャブ語、タミル語、テルグ語ではそれより低いスコアを示した。これは、最小限の言語資源で利用可能なHMMが、低リソースのインド語のNERに有効であることを示している。

ABSTRACT

This paper reports about our work in the ICON 2013 NLP TOOLS CONTEST on Named Entity Recognition. We submitted runs for Bengali, English, Hindi, Marathi, Punjabi, Tamil and Telugu. A statistical HMM (Hidden Markov Models) based model has been used to implement our system. The system has been trained and tested on the NLP TOOLS CONTEST: ICON 2013 datasets. Our system obtains F-measures of 0.8599, 0.7704, 0.7520, 0.4289, 0.5455, 0.4466, and 0.4003 for Bengali, English, Hindi, Marathi, Punjabi, Tamil and Telugu respectively.

研究の動機と目的

  • 統計的モデリングを用いて、言語に依存しないインド語向けの堅牢なNERシステムを開発すること。
  • 言語的リソースが乏しく、屈曲が複雑なインド語におけるNERの課題に対処すること。
  • 多様なインド語(異なる文法的構造を有する)に対してHMMベースのアプローチの性能を評価すること。
  • ICON 2013のNLPツールコンテストに、7つのインド語で統一されたHMMベースのNERシステムを提出すること。

提案手法

  • システムは、テキスト内の名前付きエンティティの順序的構造をモデル化するために、隠れマルコフモデル(HMM)を採用している。
  • 左から右へのHMMアーキテクチャを用い、状態は名前付きエンティティタグ(例:PERSON、ORG、LOC)を表す。
  • 最大尤度推定を用いて、各言語のICON 2013 NLPツールコンテストデータセット上でモデルを学習している。
  • 観測確率は、文字レベルおよび語彙レベルの特徴から導出され、状態遷移確率はタグ列に基づく。
  • 各トークンの最も確率の高い名前付きエンティティタグを予測するために、ビタビアルゴリズムを適用している。
  • 複雑な言語学的特徴や外部リソースは使用せず、HMM構造と学習データにのみ依存している。

実験結果

リサーチクエスチョン

  • RQ1低リソースのインド語における基本的なHMMベースのアプローチは、名前付きエンティティ抽出においてどの程度有効であるか?
  • RQ2多様なスクリプトと文法的複雑さを持つインド語の多様な言語に、単一のHMMフレームワークが一般化可能か?
  • RQ3豊富な言語学的前処理や外部知識を一切使用しない統計的モデリングのみで、どの程度の性能が達成可能か?
  • RQ4形態素の豊富さやデータの可用性の違いを示すインド語間で、Fスコアはどのように変動するか?

主な発見

  • HMMベースのシステムはベンガル語でFスコア0.8599を達成し、全言語の中で最高となった。これは、この言語における優れた性能を示している。
  • 英語とヒンディ語は、それぞれFスコア0.7704と0.7520を達成し、リソースが比較的多いインド語においても安定した性能を示した。
  • マラタ語、パンジャブ語、タミル語、テルグ語は、それぞれFスコア0.4289、0.5455、0.4466、0.4003にとどまり、低リソース環境における課題を反映している。
  • リソースが豊富な言語と低リソース言語との間の性能格差は、学習データ量と言語的複雑さの影響を強く示している。
  • 結果から、複雑な言語学的特徴や外部リソースがなくても、HMMがインド語のNERに有効であることが確認された。
  • 最小限の言語固有のチューニングで、複数のインド語に統一された統計的モデルを適用可能なことが、本システムによって示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。