Skip to main content
QUICK REVIEW

[論文レビュー] NUIG-Shubhanker@Dravidian-CodeMix-FIRE2020: Sentiment Analysis of Code-Mixed Dravidian text using XLNet

Shubhanker Banerjee, Arun Jayapal|arXiv (Cornell University)|Oct 15, 2020
Natural Language Processing Techniques参考文献 24被引用数 5
ひとこと要約

本論文は、追加の前処理を施さずに、コードミックスドのドラヴィダ語-英語テキスト、特にタミル-英語(タングリッシュ)およびマラヤーラム-英語のデータセットに対してXLNet言語モデルをファインチューニングし、感情分析を実施する。マラヤーラム-英語では49%、タミル-英語では35%の正解率を達成したが、クラスの不均衡とデータノイズの影響により結果は限定的であり、延長された訓練とデータ拡張によって改善が図れる可能性がある。

ABSTRACT

Social media has penetrated into multilingual societies, however most of them use English to be a preferred language for communication. So it looks natural for them to mix their cultural language with English during conversations resulting in abundance of multilingual data, call this code-mixed data, available in todays' world.Downstream NLP tasks using such data is challenging due to the semantic nature of it being spread across multiple languages.One such Natural Language Processing task is sentiment analysis, for this we use an auto-regressive XLNet model to perform sentiment analysis on code-mixed Tamil-English and Malayalam-English datasets.

研究の動機と目的

  • コードミックスドのドラヴィダ語-英語のソーシャルメディアテキストにおける感情分析の課題に対処すること。これはリソースが限られ、意味論的に複雑である。
  • 豊富な前処理を要せず、低リソースのコードミックスドデータセットに対して事前学習済みXLNetモデルの感情分類への有効性を評価すること。
  • 感情分類の文脈において、マラヤーラム-英語とタミル-英語のコードミックスドデータセットの間で性能に差が生じる要因を調査すること。
  • 特にクラスの不均衡とデータ品質の問題によるモデル性能の制限を特定し、改善策を提案すること。

提案手法

  • タミル-英語およびマラヤーラム-英語のコードミックスドテキストのラベル付きデータセットに対して、4エポック、最大の自己学習率0.005を用いて事前学習済みXLNetモデルをファインチューニングした。
  • XLNetの二重ストリームアテンションメカニズムを活用し、自己回帰的予測中に左および右のトークンに注目することで、双方向的文脈をモデル化した。
  • 入力シーケンスのすべての可能な順列に対して順列言語モデルを適用し、XLNetが両方向からの文脈的依存関係を学習できるようにした。
  • コードミックスドシーケンス内の長距離依存関係を捉えるために、標準的なトランスフォーマー構造とマルチヘッド自己アテンションを用いた。
  • XLNet出力の[CLS]トークンの最終隠れ状態を用いて感情分類を行い、その後にマルチクラス予測のためのソフトマックス層を適用した。
  • FIRE 2020コンペティションに準拠し、タミル-英語データセットに15,744文、マラヤーラム-英語データセットに6,738文をそれぞれ訓練・検証・テストセットに分割した。

実験結果

リサーチクエスチョン

  • RQ1追加の前処理を施さずに、XLNetモデルは低リソースのコードミックスドドラヴィダ語-英語テキストに対して感情分析を効果的に行えるか?
  • RQ2データ品質やサイズの違いを考慮すると、マラヤーラム-英語とタミル-英語のコードミックスドデータセットにおけるモデル性能にどのような差が生じるか?
  • RQ3訓練データにおけるクラスの不均衡が、少数派の感情クラスに対するモデルの予測性能にどの程度影響を及えるか?
  • RQ4標準的なハイパーパrameterでXLNetをファインチューニングするのを越えて、コードミックスドドラヴィダ語テキストにおける感情分類の正確性を向上させるにはどのような改善が可能か?

主な発見

  • マラヤーラム-英語データセットではテスト正解率が49%、タミル-英語データセットでは35%にとどまり、低リソースのコードミックスドテキストにおいて中程度の性能を示した。
  • マラヤーラム-英語ではF1加重平均スコアが0.52、タミル-英語では0.32であり、両データセット間で顕著な性能差が確認された。
  • マラヤーラム-英語ではポジティブクラスのF1スコアが最高の0.59、タミル-英語では0.51を記録し、多数派クラスとの整合性が高かった。
  • マラヤーラム-英語では「混合感情」と「ネガティブ」クラスのF1スコアがそれぞれ0.05および0.19にとどまり、曖昧な感情やネガティブな感情の検出が不十分であることが示された。
  • 「非マラヤーラム語」と「非タミル語」クラスでは、F1スコアがそれぞれ0.44および0.16にとどまり、コードミックスド文脈における言語識別に困難をきたしていることが示された。
  • 著者らは、タミル-英語データセットの性能が低い要因として、マラヤーラム-英語データセットよりもサイズが大きいにもかかわらず、データのノイズレベルが高いためだと説明している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。