[論文レビュー] NLP-CUET@DravidianLangTech-EACL2021: Offensive Language Detection from Multilingual Code-Mixed Text using Transformers
本稿では、英語とタミル語、マラヤーラム語、カナーダ語が混合された多言語コードミックスドテキストにおける攻撃的言語検出のためのトランスフォーマー基盤システムを提案する。複数のモデルを評価した結果、タミル語とマラヤーラム語ではXLM-Rが最良であり、カナーダ語ではm-BERTが最良であった。それぞれの重み付きF1スコアは0.76、0.93、0.71を記録し、従来の機械学習およびディープラーニング手法を著しく上回った。
The increasing accessibility of the internet facilitated social media usage and encouraged individuals to express their opinions liberally. Nevertheless, it also creates a place for content polluters to disseminate offensive posts or contents. Most of such offensive posts are written in a cross-lingual manner and can easily evade the online surveillance systems. This paper presents an automated system that can identify offensive text from multilingual code-mixed data. In the task, datasets provided in three languages including Tamil, Malayalam and Kannada code-mixed with English where participants are asked to implement separate models for each language. To accomplish the tasks, we employed two machine learning techniques (LR, SVM), three deep learning (LSTM, LSTM+Attention) techniques and three transformers (m-BERT, Indic-BERT, XLM-R) based methods. Results show that XLM-R outperforms other techniques in Tamil and Malayalam languages while m-BERT achieves the highest score in the Kannada language. The proposed models gained weighted $f_1$ score of $0.76$ (for Tamil), $0.93$ (for Malayalam), and $0.71$ (for Kannada) with a rank of $3^{rd}$, $5^{th}$ and $4^{th}$ respectively.
研究の動機と目的
- ドゥラヴィダ語族の言語、特にタミル語、マラヤーラム語、カナーダ語を含む多言語コードミックスドSNSテキストにおける攻撃的コンテンツを自動で検出できるシステムの開発を目的とする。
- 多言語攻撃的コンテンツの分類に際し、モノリンガルモデルが効果的に機能しない原因となるコードスイッチイングの複雑さに対処することを目的とする。
- 共通のベンチマークデータセットを用いて、従来の機械学習、ディープラーニング、トランスフォーマー基盤のアプローチを含む多様なモデルを評価することで、今後の研究のための堅実なベースラインを確立することを目的とする。
- タミル語、マラヤーラム語、カナーダ語の3つのドゥラヴィダ語において、モデルのパフォーマンスと誤りのパターンを分析することを目的とする。
提案手法
- 本システムは、6つの攻撃的言語クラス(非攻撃的(NF)、攻撃的・標的的・中傷・他者(OTIO)、攻撃的・標的的・中傷・個人(OTII)、攻撃的・標的的・中傷・集団(OTIG)、非タミル語/非マラヤーラム語(NT/NM)、非カナーダ語(NK))を識別するためのマルチクラス分類フレームワークを採用する。
- 対象となるモデルには、従来の機械学習(ロジスティック回帰、SVM)、ディープラーニング(LSTM、アテンション付きLSTM)、トランスフォーマー基盤モデル(m-BERT、Indic-BERT、XLM-R)が含まれる。
- 非トランスフォーマー系モデルの入力表現には、ワードエンベッディング(Word2Vec、FastText)とTF-IDF特徴量が用いられる。
- トランスフォーマー系モデルでは、バッチサイズ4でXLM-R、バッチサイズ12でm-BERTおよびIndic-BERTをコードミックスドデータセット上で微調整する。
- モデルのパフォーマンスは重み付きF1スコア、適合率、再現率を用いて評価され、最良のパフォーマンスを示したモデルごとに混同行列を用いた誤り分析が実施される。
実験結果
リサーチクエスチョン
- RQ1従来の機械学習、ディープラーニング、トランスフォーマー基盤のモデルは、多言語コードミックスドテキストにおける攻撃的コンテンツ分類において、どのように比較されるか?
- RQ2m-BERT、Indic-BERT、XLM-Rの中では、どのトランスフォーマー・モデルがタミル語、マラヤーラム語、カナーダ語のコードミックスドテキストにおける攻撃的言語検出で最も優れているか?
- RQ33言語にわたる最良のパフォーマンスを示したモデルにおいて、主な失敗モードとクラス固有の誤分類パターンは何か?
- RQ4クラス不均衡は、OTIO や OTIG のようなレアな攻撃的カテゴリにおいて、モデルのパフォーマンスにどの程度影響を与えるか?
主な発見
- XLM-Rはタミル語において最高の重み付きF1スコア0.76を記録し、m-BERT や Indic-BERT など他のすべてのモデルを上回った。
- マラヤーラム語では、XLM-Rが重み付きF1スコア0.93を達成し、全体で3位であった。m-BERT と Indic-BERT はそれぞれ0.90 と 0.92 のスコアを記録した。
- カナーダ語では、m-BERT が重み付きF1スコア0.71を記錵し、XLM-R をわずかに上回り、適合率と再現率の指標に基づき最良のモデルとして選定された。
- トランスフォーマー基盤のモデルは、従来の機械学習およびディープラーニングのモデルを著しく上回り、タミル語ではF1スコアで0.03、マラヤーラム語では0.05、カナーダ語では0.23の改善を達成した。
- 誤り分析の結果、OTIOの誤分類率が非常に高く、タミル語では真陽性率が0%、カナーダ語では100%であった。これは、クラス不均衡とコードスイッチド中傷の言語的複雑さが原因であると推測される。
- NFクラスに対しては高いパフォーマンスを示したが、特にマラヤーラム語においてはOTIG や OTII のようなレアな攻撃的カテゴリの分類に苦戦し、27件のOTIIインスタンスのうちたった2件しか正しく分類できなかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。