Skip to main content
QUICK REVIEW

[論文レビュー] A Hidden Markov Model Based System for Entity Extraction from Social Media English Text at FIRE 2015

Kamal Sarkar|arXiv (Cornell University)|Dec 12, 2015
Natural Language Processing Techniques参考文献 10被引用数 6
ひとこと要約

この論文では、英語のソーシャルメディアテキストからのエンティティ抽出のための trigram Hidden Markov Model (HMM) ベースのシステムを提示している。地名リスト(gazetteer lists)、品詞(POS)タグ、および単語レベルの特徴を活用して、既知および未知のトークンの観測確率を向上させた。このシステムは、FIRE 2015 英語データセットで F1 スコア 48.21 を達成し、英語言語タスクの他の提出物よりも優れていた。

ABSTRACT

This paper presents the experiments carried out by us at Jadavpur University as part of the participation in FIRE 2015 task: Entity Extraction from Social Media Text - Indian Languages (ESM-IL). The tool that we have developed for the task is based on Trigram Hidden Markov Model that utilizes information like gazetteer list, POS tag and some other word level features to enhance the observation probabilities of the known tokens as well as unknown tokens. We submitted runs for English only. A statistical HMM (Hidden Markov Models) based model has been used to implement our system. The system has been trained and tested on the datasets released for FIRE 2015 task: Entity Extraction from Social Media Text - Indian Languages (ESM-IL). Our system is the best performer for English language and it obtains precision, recall and F-measures of 61.96, 39.46 and 48.21 respectively.

研究の動機と目的

  • ノイジーで非形式的な英語のソーシャルメディアテキストに特化した耐障害性の高いエンティティ抽出システムの開発。
  • ソーシャルメディアにおける語彙の多様性と未知語の影響により、エンティティ認識の精度と再現率が低くなるという課題に対処。
  • 統計的 HMM フレームワークに複数の言語的特徴を統合することで、認識パフォーマンスの向上を図ること。
  • インド諸言語におけるエンティティ抽出の FIRE 2015 ベンチマークタスクに参加し、英語言語タスクでトップパフォーマンスを達成すること。

提案手法

  • エンティティラベルの系列をモデル化するために trigram HMM が用いられ、トークン系列における長距離依存関係を捉えた。
  • 観測確率は、地名リスト(gazetteer list)、品詞(POS)タグ、およびその他の単語レベルの特徴を用いて向上させた。
  • 既知および未知のトークンの両方をモデル化する組み合わせが用いられ、未知トークンには形態論的および文脈的手がかりに基づいた確率が割り当てられた。
  • 大文字の使用、標点、語の形状などの特徴が、未知語のエンティティ認識を向上させるために用いられた。
  • モデルは、標準的な HMM デコーディングと Viterbi アルゴリズムを用いて、FIRE 2015 ESM-IL データセット上で学習および評価された。
  • インド諸言語への適応なしに、FIRE 2015 タスクの英語言語サブセットに最適化された。

実験結果

リサーチクエスチョン

  • RQ1ノイジーで非形式的な英語のソーシャルメディアテキストから、trigram HMM モデルが効果的に名前付きエンティティを抽出できるか?
  • RQ2地名リスト、POS タグ、および単語レベルの特徴を統合することで、リソースが限られた状況や未知語が多い状況でのエンティティ認識がどの程度向上するか?
  • RQ3統計的 HMM ベースのアプローチが、FIRE 2015 エンティティ抽出ベンチマークでベースラインシステムをどの程度上回れるか?
  • RQ4HMM を用いたソーシャルメディアテキストからのエンティティ抽出において、精度と再現率のトレードオフはどの程度のものか?

主な発見

  • 提案された HMM ベースのシステムは、FIRE 2015 ESM-IL タスクの英語テストセットで F1 スコア 48.21 を達成した。
  • システムは精度 61.96% と再現率 39.46% を記録しており、中程度の再現率を犠牲にして精度に重点を置いたことが示された。
  • 地名リストと POS タグの統合により、特に未知語やレア語のエンティティ同定能力が顕著に向上した。
  • trigram HMM 構造は、より単純な HMM 変種よりも優れた系列モデリングを実現し、系列全体にわたるラベルの一貫性を高めた。
  • このシステムは、FIRE 2015 ベンチマークの英語言語タスクにおいて、すべての提出物の中で最高のパフォーマンスを記録した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。