Skip to main content
QUICK REVIEW

[論文レビュー] Code-mixed Sentiment and Hate-speech Prediction

Anjali Yadav, Tanya Garg|arXiv (Cornell University)|May 21, 2024
Hate Speech and Cyberbullying Detection被引用数 4
ひとこと要約

本稿は、英語-ヒンディー語および英語-スロベニア語のコードミックステキストを対象とし、非公式なソーシャルメディアデータに特化して事前学習された、4つの新しいバイリンガルマスク言語モデルを紹介する。感情分析および嫌がらせ発言検出のタスクにおいて、単言語モデル、バイリンガルモデル、多言語モデル、生成モデルを評価した結果、ファインチューニングされたバイリンガルモデルおよびソーシャルメディア特化型多言語モデルが、汎用的で大規模な生成モデルを上回ることを確認した。特に、ヒンディー語では HingRoBERTa が最高の F1 スコアを記録し、スロベニア語では SlEng-BERT が最高のスコアを記録した。

ABSTRACT

Code-mixed discourse combines multiple languages in a single text. It is commonly used in informal discourse in countries with several official languages, but also in many other countries in combination with English or neighboring languages. As recently large language models have dominated most natural language processing tasks, we investigated their performance in code-mixed settings for relevant tasks. We first created four new bilingual pre-trained masked language models for English-Hindi and English-Slovene languages, specifically aimed to support informal language. Then we performed an evaluation of monolingual, bilingual, few-lingual, and massively multilingual models on several languages, using two tasks that frequently contain code-mixed text, in particular, sentiment analysis and offensive language detection in social media texts. The results show that the most successful classifiers are fine-tuned bilingual models and multilingual models, specialized for social media texts, followed by non-specialized massively multilingual and monolingual models, while huge generative models are not competitive. For our affective problems, the models mostly perform slightly better on code-mixed data compared to non-code-mixed data.

研究の動機と目的

  • 多言語的で非公式な文脈におけるコードミックスされた感情分析および嫌がらせ発言検出のための効果的な大規模言語モデルの不足に対処すること。
  • 英語-ヒンディー語および英語-スロベニア語のコードミックステキストを対象とし、非公式なコードミックスコーパスに特化して訓練された、新しいバイリンガルマスク言語モデルを構築すること。
  • 単言語モデル、バイリンガルモデル、多言語モデル、生成モデルという多様なLLMの種類が、コードミックスされた感情認識タスクにおいてどのように性能を発揮するかを評価すること。
  • コードミックステキストが、感情および攻撃的言語検出において、非コードミックステキストよりも本質的に分類が容易であるかどうかを調査すること。
  • 既存の言語検出ツールが、コードミックステキストを同定する際に抱える制限を評価すること。

提案手法

  • 英語-ヒンディー語用の RoBERTa-en-hi-codemixed および MuRIL-en-hi-codemixed、英語-スロベニア語用の SlEng-BERT および SloBERTa-SlEng を、コードミックスされたソーシャルメディアコーパスを用いて事前学習した。
  • これらのモデルを、5ヶ国語(フランス語、ヒンディー語、ロシア語、スロベニア語、タミル語)を対象とした感情分析および攻撃的言語検出という2つの感情認識タスクにファインチューニングした。
  • mBERT、XLM-R、TwHIN-BERT、GPT-3、Llama2-7B といった多様なLLMを、コードミックスおよび非コードミックスのデータサブセットに対して評価した。
  • F1スコアといった標準的な指標を用いて、言語ペアおよびデータタイプごとのモデル性能を比較した。
  • モデルの挙動および言語検出の弱みを評価するために、手動での検査およびコントラストセット分析を実施した。
  • 低リソース環境およびコードミックス環境に適応させるために、トランスファー学習技術を適用した。

実験結果

リサーチクエスチョン

  • RQ1バイリンガルおよび多言語モデルは、単言語モデルおよび大規模多言語モデルと比較して、コードミックスされた感情分析および嫌がらせ発言検出タスクでどの程度の性能を示すか?
  • RQ2非公式なコードミックスソーシャルメディアデータを用いた学習は、感情認識タスクにおけるモデル性能を向上させるか?
  • RQ3感情および攻撃的言語検出において、コードミックステキストは非コードミックステキストよりも本質的に分類が容易であるか?
  • RQ4GPT-3 や Llama2-7B といった大規模生成モデルは、専用モデルと比較して、コードミックスされた感情認識タスクでどの程度の性能を示すか?
  • RQ5既存の言語検出ツールは、コードミックステキストを同定する際に、どのような制限を抱えているか?

主な発見

  • バイリンガルの HingRoBERTa モデルは、ヒンディー語-英語のコードミックスデータにおける感情分析で、F1スコア 0.876 を記録し、他のすべてのモデルを上回った。
  • 新たに導入された RoBERTa-en-hi-codemixed および MuRIL-en-hi-codemixed モデルは、ヒンディー語のコードミックスデータにおいて、非コードミックスデータよりも優れた性能を示した。
  • スロベニア語-英語のコードミックスにおいて、SlEng-BERT は感情分析で F1 スコア 0.874、攻撃的言語検出で 0.865 を記録し、他のモデルを上回った。
  • ソーシャルメディア特化型コードミックスコーパスで学習されたモデル、例えば HingRoBERTa や SlEng-BERT は、汎用的多言語モデルおよび単言語モデルを一貫して上回った。
  • GPT-3 や Llama2-7B は、性能が不十分で、特にヒンディー語の感情分析では F1 スコアがたった 0.466 にとどまり、コードミックステキストへの適応性が低いことが示された。
  • 驚くべきことに、ほとんどのモデルが非コードミックスデータよりもコードミックスデータでわずかに高い性能を示した。これは、コードミックスの議論において、言語間で共通する感情的パターンが存在する可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。