Skip to main content
QUICK REVIEW

[論文レビュー] A CRF Based POS Tagger for Code-mixed Indian Social Media Text

Kamal Sarkar|arXiv (Cornell University)|Dec 23, 2016
Natural Language Processing Techniques参考文献 6被引用数 3
ひとこと要約

本稿では、バンガラルー英語、ヒンディー英語、テルグ語英語の言語ペアを対象として、コードミックスド・インディアンSNSテキスト向けのCRFベースの品詞タギングシステムを提示する。このシステムは、2016年ICON NLPツールコンテストの制約付きモードにおいて16の参加システムの中で最高のF1スコア79.99を達成し、リソースが乏しく、非公式で、多言語的なテキストにおいて優れたパフォーマンスを示している。

ABSTRACT

In this work, we describe a conditional random fields (CRF) based system for Part-Of- Speech (POS) tagging of code-mixed Indian social media text as part of our participation in the tool contest on POS tagging for codemixed Indian social media text, held in conjunction with the 2016 International Conference on Natural Language Processing, IIT(BHU), India. We participated only in constrained mode contest for all three language pairs, Bengali-English, Hindi-English and Telegu-English. Our system achieves the overall average F1 score of 79.99, which is the highest overall average F1 score among all 16 systems participated in constrained mode contest.

研究の動機と目的

  • コードミックスド・インディアンSNSテキスト向けに、複数のインド諸言語と英語を組み合わせた非公式なデジタルコミュニケーションを対象とした耐障害性の高い品詞タギングシステムの開発。
  • コードミックスドSNSコンテンツにおけるアノテート済みデータの限定的さと言語的多様性の課題に対処すること。
  • 固定テストセットを用いた制約付きモード設定で高いパフォーマンスを達成すること。これは、競争的なNLPツールコンテストの一環として実施された。
  • CRFベースのシーケンスラベル付けが、多言語的SNSテキストにおける形態素的および構文的複雑さをどのように処理できるかを評価すること。

提案手法

  • システムは、コンテキスト的依存関係をモデル化するために特徴テンプレートを活用する条件付きランダムフィールド(CRF)を用いたシーケンスラベル付けを採用する。
  • 特徴には、語形、文字レベルのパターン、事前学習済みモデルからの品詞タグ、言語固有の形態素的手がかりが含まれる。
  • 各言語ペアについて、コンテストで提供されたトレーニングデータセットからの単語言語および並列データの組み合わせを用いてモデルを学習する。
  • タグの一貫性を保証し、未知のテストデータへの一般化を向上させるために、制約付きデコード戦略を適用する。
  • 特徴およびハイパーパramータのセットを固定し、トレーニングデータ上で交差検証を用いて最適化する。

実験結果

リサーチクエスチョン

  • RQ1CRFベースのモデルは、インドSNSテキストにおける形態的・構文的複雑さおよびコードミックスングパターンを効果的に処理できるか?
  • RQ2コードミックスド品詞タギングにおいて、他のシーケンスラベル付けモデルと比較して、CRFベースのアプローチはF1スコアで優れているか?
  • RQ3特徴工学とCRFデコードは、リソースが乏しく、非公式な多言語テキストにおいてどれほどパフォーマンスを向上させられるか?
  • RQ4本システムは、ヒンディー英語、バンガラルー英語、テルグ語英語のテキストにおける多様なコードミックスングパターンに対して、どれほど頑健であるか?

主な発見

  • システムは全体の平均F1スコア79.99を達成し、制約付きモードコンテストにおける全16システムの中で最高のスコアを記録した。
  • CRFベースのアプローチはコンテスト全体で他の手法を上回り、多様なコードミックスドSNSテキストに対して優れた一般化性能を示した。
  • 文字レベルおよび言語固有の特徴を含む豊富な特徴工学の活用が、タギング精度を顕著に向上させた。
  • システムはバンガラルー英語、ヒンディー英語、テルグ語英語の3つの言語ペアすべてで一貫したパフォーマンスを発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。