Skip to main content
QUICK REVIEW

[論文レビュー] SMPOST: Parts of Speech Tagger for Code-Mixed Indic Social Media Text

Deepak Gupta, Shubham Tripathi|arXiv (Cornell University)|Feb 1, 2017
Natural Language Processing Techniques参考文献 4被引用数 10
ひとこと要約

本稿では、条件付き確率場(CRF)を用い、豊富な言語的特徴を組み込んだ教師あり部分品詞(PoS)タガーラーであるSMPOSTを提示する。コードミックスドのインディックSNSテキスト(英語-ヒンディー語、英語-ベンガル語、英語-テルグ語)のTwitter、Facebook、WhatsAppデータにおいて、強力な性能を達成しており、特にWhatsAppおよびTwitterにおいて、Run-1がRun-2を上回る結果を示し、コードミックスドSNSプラットフォーム全体にわたる頑健性と一般化能力を示している。

ABSTRACT

Use of social media has grown dramatically during the last few years. Users follow informal languages in communicating through social media. The language of communication is often mixed in nature, where people transcribe their regional language with English and this technique is found to be extremely popular. Natural language processing (NLP) aims to infer the information from these text where Part-of-Speech (PoS) tagging plays an important role in getting the prosody of the written text. For the task of PoS tagging on Code-Mixed Indian Social Media Text, we develop a supervised system based on Conditional Random Field classifier. In order to tackle the problem effectively, we have focused on extracting rich linguistic features. We participate in three different language pairs, ie. English-Hindi, English-Bengali and English-Telugu on three different social media platforms, Twitter, Facebook & WhatsApp. The proposed system is able to successfully assign coarse as well as fine-grained PoS tag labels for a given a code-mixed sentence. Experiments show that our system is quite generic that shows encouraging performance levels on all the three language pairs in all the domains.

研究の動機と目的

  • 英語とヒンディー語、ベンガル語、テルグ語などの地域言語が混合されたインドのSNSテキストに対して、頑健なPoSタギングシステムの開発を目的とする。
  • 規則ベースと分類器ベースのハイブリッドアプローチを用いて、ノイズが多く、非公式で多様性の高いSNSテキストの課題に取り組む。
  • 粗粒度および細粒度のPoSタグセットを用い、Twitter、Facebook、WhatsAppなどの複数の言語ペアとSNSプラットフォームで、システムの性能を評価する。
  • 低リソースなコードミックスドNLPタスクにおいて、手作業で作成した言語的特徴を有するCRFベースの分類が効果を発揮するかを検討する。

提案手法

  • 2段階のパイプラインを採用:まず、正規表現および辞書照合を用いて、句読点、URL、数字、絵文字、Unicode記号などの非アルファベットトークンをルールベースでクリーニングおよびタグ付けする。
  • クリーニング済みデータは、語の形態、接頭辞、接尾辞、文脈特徴を含む手作業で作成した言語的特徴に基づいて、CRFベースの分類器で処理される。
  • CRFモデルはCRF++を用いて訓練され、英語-ヒンディー語データで最適化された特徴テンプレートが、全言語ペアに一様に適用される。
  • 2つの制約付きシステムランを評価:Run-1は、Facebook、Twitter、WhatsAppの全プラットフォームのデータを統合して学習する。一方、Run-2は、各プラットフォームごとに別々に学習および予測を行う。
  • 訓練および評価にはBIS PoSタグセットが用いられ、性能は粗粒度および細粒度のタグレベルで報告される。
  • 制約なしシステムは、Run-1に前年のICON-2015共有タスクのデータを追加することで拡張されるが、顕著な性能向上は観察されなかった。

実験結果

リサーチクエスチョン

  • RQ1コードミックスドのインドSNSテキストにおけるPoSタギングに、ハイブリッド規則ベースおよびCRFベースのアプローチはどの程度効果的か?
  • RQ2Facebook、Twitter、WhatsAppを含む複数のSNSプラットフォームのデータを統合して学習することで、プラットフォーム固有の学習よりも一般化性能が向上するか?
  • RQ3英語-ヒンディー語、英語-ベンガル語、英語-テルグ語の各言語ペアにおいて、異なるSNSプラットフォームでシステムの性能はどのように変化するか?
  • RQ4豊富な言語的特徴を有するCRFベースのモデルは、低リソースなコードミックスドPoSタギングタスクにおいて強力な性能を発揮できるか?
  • RQ5前年のデータを統合することで、制約付き設定における性能が顕著に向上するか?

主な発見

  • Run-1は、Facebook、Twitter、WhatsAppの全データを統合して学習する1つのモデルを用いるが、ほとんどのドメインでRun-2を上回り、粗粒度レベルで英語-テルグ語のWhatsAppデータでF1スコア0.846を達成した。
  • 英語-ヒンディー語において、Run-1は粗粒度レベルでTwitterデータでF1スコア0.904を達成し、プラットフォーム間での一般化能力が優れていることが示された。
  • Run-2は、全言語ペアにおいてFacebookデータでより良い性能を示し、プラットフォーム固有の言語的パターンが、各プラットフォームごとの学習によって恩恵を受けることが示唆された。
  • Run-1では、粗粒度レベルで英語-テルグ語のTwitterデータでF1スコア0.879を達成し、低リソース言語ペアにおいても強力な性能を示した。
  • ICON-2015共有タスクのデータを統合したにもかかわらず、制約なしシステムは制約付きRun-1に顕著な性能向上を示さなかった。これは、現在のデータ量が十分であるか、あるいはデータ分布のズレが向上を制限している可能性を示唆している。
  • 規則ベースのコンponentは、85%の非アルファベットトークン(句読点、URL、数字など)を適切に処理し、CRF分類の前のノイズを低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。