Skip to main content
QUICK REVIEW

[論文レビュー] Language Identification of Bengali-English Code-Mixed data using Character & Phonetic based LSTM Models

Soumil Mandal, Sourya Dipta Das|arXiv (Cornell University)|Mar 10, 2018
Authorship Attribution and Profiling参考文献 9被引用数 16
ひとこと要約

本稿では、文字レベルおよび発音(ルート音素)表現を用いた双方向LSTMを用いた深層学習的手法を提案し、リソースが限られたベンガル語-英語混在テキストにおける単語レベルの言語識別を実現する。しきい値ベースのアンサンブルモデルを用いることで92.35%の正確度を達成し、ベースラインのSVMより8.71%高い性能を示しており、リソースが限られた状況下でのコードミックスドNLPタスクにおいて、発音および文字レベルの埋め込み表現の有効性が裏付けられている。

ABSTRACT

Language identification of social media text still remains a challenging task due to properties like code-mixing and inconsistent phonetic transliterations. In this paper, we present a supervised learning approach for language identification at the word level of low resource Bengali-English code-mixed data taken from social media. We employ two methods of word encoding, namely character based and root phone based to train our deep LSTM models. Utilizing these two models we created two ensemble models using stacking and threshold technique which gave 91.78% and 92.35% accuracies respectively on our testing data.

研究の動機と目的

  • リソースが限られたベンガル語-英語混在のソーシャルメディアテキストにおける正確な単語レベルの言語識別を解決すること。
  • コードミックスドデータの言語的パターンを捉えるために、文字レベルおよびルート音素表現の有効性を検証すること。
  • LSTMを用いた深層学習により、従来のn-gramおよびSVMベースのモデルを上回る性能を向上させること。
  • アンサンブル手法(スタッキングおよびしきい値処理)を用いて、文字および発音モデルの予測を統合する方法を評価すること。
  • 多言語的で非公式なテキストにおける言語識別に耐障害的かつデータ効率的なソリューションを提供すること。

提案手法

  • 文字レベルの符号化とベンガル語のルート音素による発音表現を用いた、二つの双方向LSTMモデルを訓練する。
  • 文字符号化はサブワードレベルでの語彙的パターンを捉えるのに対し、ルート音素符号化は言語固有の音声構造をモデル化し、言語特異的な音声を区別する。
  • しきい値ベースのアンサンブル手法により、予測確率のファジィ平均値に学習されたしきい値(θ ≤ 0.9)を適用することで正確度を最大化する。
  • スタッキングアンサンブルでは、開発データ上で両モデルの予測をロジスティック回帰で統合し、一般化性能を向上させる。
  • データ前処理には、小文字化、短い語、数字または特殊文字を多く含む語の削除、繰り返し文字の正規化が含まれる。
  • テストセット700語対の評価において、正確度、適合率、再現率、F1スコアといった指標が用いられた。

実験結果

リサーチクエスチョン

  • RQ1文字レベルおよび発音レベルのLSTM符号化は、コードミックスドテキストにおけるベンガル語と英語の語を効果的に区別できるか?
  • RQ2スタッキングおよびしきい値処理といったアンサンブル手法は、個々のモデルに比べて言語識別正確度をどのように向上させるか?
  • RQ3限られた学習例しか利用できない低リソースのコードミックスドデータにおいて、深層学習モデルがどれほど高い正確度を達成できるか?
  • RQ4ルート音素に基づく発音符号化は、文字レベルの符号化に比べて、コードミックスドテキストにおける言語特異的パターンをより効果的に捉えられるか?
  • RQ5同じスペルを持つが言語的起源が異なる曖昧な語に対して、モデルはどのように対処するか?

主な発見

  • しきい値ベースのアンサンブルモデルがテストセットで最高の正確度92.35%を達成し、スタッキングアンサンブル(91.78%)およびベースラインSVM(83.64%)を上回った。
  • しきい値処理後の発音モデル単体でも90.42%の正確度を達成し、ルート音素符号化による優れた性能が示された。
  • しきい値処理後の文字モデルは89.42%の正確度を達成し、文字レベルのパターンが言語境界を区別するのに有効であることが示された。
  • 混同行列の分析から、しきい値アンサンブルモデルはベンガル語の語を正しく識別する傾向が強く(TP = 667)、ベンガル語予測に対する高い信頼度を示した。
  • スタッキングアンサンブルモデルはF1スコア(91.77%)が向上し、適合率と再現率のバランスが取れていることから、一般化性能に優れていることが示された。
  • ベースラインSVMモデルに比べ、システムは正確度で顕著な8.71%の向上を示し、適切な符号化を用いた深層学習の利点が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。