Skip to main content
QUICK REVIEW

[論文レビュー] JUNLP@Dravidian-CodeMix-FIRE2020: Sentiment Classification of Code-Mixed Tweets using Bi-Directional RNN and Language Tags

Sainik Kumar Mahata, Dipankar Das|arXiv (Cornell University)|Oct 20, 2020
Sentiment Analysis and Opinion Mining参考文献 9被引用数 6
ひとこと要約

本稿では、英語・タミル語の混在するツイートのセンチメント分類のため、言語タグとFastText単語埋め込みを組み合わせた双方向LSTMモデルを提案する。システムはF1スコア0.58を達成し、低リソースでコードミックスされたNLPの文脈において、言語タグがベースラインモデルよりも性能を向上させることを示している。

ABSTRACT

Sentiment analysis has been an active area of research in the past two decades and recently, with the advent of social media, there has been an increasing demand for sentiment analysis on social media texts. Since the social media texts are not in one language and are largely code-mixed in nature, the traditional sentiment classification models fail to produce acceptable results. This paper tries to solve this very research problem and uses bi-directional LSTMs along with language tagging, to facilitate sentiment tagging of code-mixed Tamil texts that have been extracted from social media. The presented algorithm, when evaluated on the test data, garnered precision, recall, and F1 scores of 0.59, 0.66, and 0.58 respectively.

研究の動機と目的

  • コードミックスされたソーシャルメディアテキストにおけるセンチメント分類の課題、特にタミル語・英語のようなドライアダン語圏の文脈に対処すること。
  • 従来のNLPツールが機能しない低リソースで多言語的かつ構文的に複雑なコードミックスデータにおける性能向上を図ること。
  • コードミックステキストのセンチメント分類モデルにおける言語タグの特徴量としての有効性を評価すること。
  • 双方向LSTMとFastText埋め込みを用いた堅牢なディープラーニングモデルを構築し、センチメント極性検出を行うこと。
  • ドライアダン・コードミックス・FIRE2020共有タスクに参加し、その貢献を行うこと。

提案手法

  • モデルは、文字nグラム(3–6)を用いたFastText埋め込みを用い、コードミックスされた英語・タミル語テキストの単語に対して密なベクトル表現を生成する。
  • 各文の個々の単語は、NLTKベースの言語検出を用いて英語または非英語としてタグ付けされ、追加の入力特徴として機能する。
  • 単語ベクトルと言語タグが連結され、前向きおよび後向きの両方向の文脈的依存関係を捉えるために双方向LSTM層に供給される。
  • 双方向LSTMの最終的な文脈ベクトルは、5つのセンチメントラベル(ポジティブ、ネガティブ、混合感情、タミル語でない、不明)のうちの1つを予測するための全結合層に渡される。
  • モデルは、Adam最適化法、スパースカテゴリカル交差エントロピー損失関数、バッチサイズ32、50エポックで訓練され、10%の検証データ分割が用いられる。
  • アブレーションスタディでは、言語タグの有無および単方向対比双方向LSTMのモデルを比較し、特徴量の寄与を分離する。

実験結果

リサーチクエスチョン

  • RQ1コードミックスされた英語・タミル語ツイートのセンチメント分類精度向上において、言語タグを特徴量として統合することはどの程度有効か?
  • RQ2コードミックスされたソーシャルメディアテキストのセンチメント分類において、双方向LSTMは単方向LSTMに比べてどの程度性能向上をもたらすか?
  • RQ3文字nグラムを用いたFastText埋め込みは、低リソースでコードミックスされたNLPタスクにおける表現学習をどの程度改善するか?
  • RQ4ドライアダン・コードミックス共有タスクにおいて、言語タグなしまたは双方向文脈モデリングなしのベースラインモデルと比較して、本モデルはどの程度優れているか?
  • RQ5最小限のアーキテクチャ的複雑性を持つ軽量なディープラーニングアーキテクチャは、コードミックスセンチメント分類で競争力のある結果を達成できるか?

主な発見

  • 最終的なモデル(双方向LSTMに言語タグ特徴量を組み合わせたもの)は、FIRE2020主催者による公式テストセットでF1スコア0.58を達成した。
  • モデルは精度0.59、再現率0.66を達成し、センチメント予測においてやや再現率が高めの不均衡傾向を示している。
  • アブレーションモデルの中で、言語タグを備えた双方向LSTMがF1スコアで他を上回り、その有効性を確認した。
  • 言語タグなしのモデルは、最良のバージョンと比較してやや低いF1スコア(0.61)を記録したが、言語タグが価値を追加していることを示している。
  • 最良のモデルはテストセットで70.42%の精度を達成し、センチメントクラスごとに精度と再現率のバランスの取れた分布を示した。
  • アブレーションスタディにより、言語タグと双方向文脈モデリングが、コードミックスセンチメント分類の性能向上に共同で寄与することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。