Skip to main content
QUICK REVIEW

[論文レビュー] IIITG-ADBU@HASOC-Dravidian-CodeMix-FIRE2020: Offensive Content Detection in Code-Mixed Dravidian Text

Arup Baruah, Kaushik Amar Das|arXiv (Cornell University)|Jul 29, 2021
Hate Speech and Cyberbullying Detection被引用数 6
ひとこと要約

本論文は、コードミックスド・ドラヴィダ語(マラヤーラム語-英語およびタミル語-英語)における攻撃的言語検出のためのSVMとXLM-RoBERTaモデルの比較研究を提示する。TF-IDF特徴量を用いたSVM分類器は、YouTubeでのマラヤーラム語データでF1スコア0.95(1位)を達成し、Twitterでのマラヤーラム語データでF1スコア0.76(3位)を記録した。一方、XLM-RoBERTaは、タミル語-英語のTwitterデータでF1スコア0.87(3位)を達成した。

ABSTRACT

This paper presents the results obtained by our SVM and XLM-RoBERTa based classifiers in the shared task Dravidian-CodeMix-HASOC 2020. The SVM classifier trained using TF-IDF features of character and word n-grams performed the best on the code-mixed Malayalam text. It obtained a weighted F1 score of 0.95 (1st Rank) and 0.76 (3rd Rank) on the YouTube and Twitter dataset respectively. The XLM-RoBERTa based classifier performed the best on the code-mixed Tamil text. It obtained a weighted F1 score of 0.87 (3rd Rank) on the code-mixed Tamil Twitter dataset.

研究の動機と目的

  • コードミックスド・ドラヴィダ語、特にマラヤーラム語-英語およびタミル語-英語における攻撃的コンテンツを検出する課題に対処すること。
  • 低リソースなコードミックスドSNSテキストにおいて、従来の機械学習(SVM)と事前学習済み多言語トランスフォーマー・モデル(XLM-RoBERTa)を評価すること。
  • 異なるデータソース(YouTube対Twitter)および言語ペア(マラヤーラム語-英語、タミル語-英語)におけるモデル性能を比較すること。
  • 低リソースでコードミックスドな状況における攻撃的言語検出のための、最も効果的な特徴工学とモデルアーキテクチャを同定すること。

提案手法

  • 文字n-gram(1–6)および語n-gram(1–3)の組み合わせを含む、その両方の特徴量から得られるTF-IDF特徴量を用いてSVM分類器を訓練した。
  • Hugging Face Transformersライブラリを用い、Adam最適化法と重み減衰を用いて、多言語トランスフォーマーであるXLM-RoBERTa baseモデルを二値分類タスクに微調整した。
  • タスク2の開発セット作成のため、訓練データから階層的サンプリングを実施し、クラスバランスを維持した。
  • XLM-RoBERTaの訓練中に、エポックの早期停止と、2e-5の初期学習率スケジューリング(epsilon=1e-8)を適用した。
  • 開発セットおよびテストセットにおいて、重み付きF1、適合率、再現率を評価し、解釈可能性を高めるために混同行列を用いた。
  • 最終モデルは開発セットの性能に基づき選定され、共有タスクへの提出は、最高性能を示した設定のみが行われた。

実験結果

リサーチクエスチョン

  • RQ1コードミックスド・ドラヴィダ語テキストにおける攻撃的言語検出において、SVMとXLM-RoBERTaモデルの性能はどのように比較されるか?
  • RQ2SVMのコードミックスド・マラヤーラム語-英語テキストにおいて、文字n-gram、語n-gram、またはその組み合わせの特徴表現のうち、どのものが最も優れた結果をもたらすか?
  • RQ3データソース(YouTube対Twitter)の選択が、マラヤーラム語-英語の攻撃的言語検出におけるモデル性能に顕著な影響を与えるか?
  • RQ4XLM-RoBERTaは、従来のTF-IDFを用いたSVMと比較して、低リソースでコードミックスドなタミル語-英語およびマラヤーラム語-英語テキストをどれほど効果的に処理できるか?
  • RQ5XLM-RoBERTaはなぜマラヤーラム語-英語のTwitterデータではSVMに比べて性能を発揮できないのか、その低下要因は何か?

主な発見

  • 文字n-gramと語n-gramの組み合わせTF-IDF特徴量を用いたSVM分類器は、YouTubeでのマラヤーラム語データセットで最高のF1スコア0.95(1位)を達成した。
  • Twitterでのマラヤーラム語データセットでは、同じSVMモデルが重み付きF1スコア0.7623を記録し、全提出物の中で3位を獲得した。
  • タミル語-英語のTwitterデータセットでは、XLM-RoBERTaモデルが重み付きF1スコア0.8669を達成し、全体で3位となり、このタスクではすべてのSVMバージョンを上回った。
  • 語n-gramのみで訓練されたSVMモデルは、タミル語-英語データで開発セットのF1スコア0.8714を記録し、この言語ペアにおいて優れた性能を示した。
  • XLM-RoBERTaはマラヤーラム語-英語のTwitterデータで顕著に性能を発揮できず、F1スコアはわずか0.5171にとどまり、このアーキテクチャが低リソースのコードミックスド・ドラヴィダ語テキストを処理する際に限界を示していると考えられる。
  • 混同行列の分析から、マラヤーラム語-英語のYouTubeデータ向けSVMモデルは、攻撃的と誤分類された例がわずか2件にとどまり、このテストセットでは高い適合率と再現率を示していることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。