Skip to main content
QUICK REVIEW

[論文レビュー] Cross-lingual Offensive Language Identification for Low Resource Languages: The Case of Marathi

Saurabh Gaikwad, Tharindu Ranasinghe|Aston Publications Explorer (Aston University)|Sep 8, 2021
Hate Speech and Cyberbullying Detection参考文献 40被引用数 4
ひとこと要約

本稿では、低リソースのインド・アリヤン語の一つであるマラーティー語向けに、最初の攻撃的言語識別データセット「MOLD」を紹介する。XLM-RoBERTaを用いたクロスリンガル転移学習により、英語ベースの転移学習よりも、ヒンディー語やベンガル語といった類縁言語での微調整が顕著に性能向上をもたらすことを示している。ヒンディー語からの転移学習では、転移学習設定でマクロF1が0.9401、ゼロショット設定で0.8396を達成した。

ABSTRACT

The widespread presence of offensive language on social media motivated the development of systems capable of recognizing such content automatically. Apart from a few notable exceptions, most research on automatic offensive language identification has dealt with English. To address this shortcoming, we introduce MOLD, the Marathi Offensive Language Dataset. MOLD is the first dataset of its kind compiled for Marathi, thus opening a new domain for research in low-resource Indo-Aryan languages. We present results from several machine learning experiments on this dataset, including zero-short and other transfer learning experiments on state-of-the-art cross-lingual transformers from existing data in Bengali, English, and Hindi.

研究の動機と目的

  • 低リソースのインド・アリヤン語、特にマラーティー語における攻撃的言語識別リソースの不足に対処すること。
  • 攻撃的言語識別を目的とした、約2,500件のマラーティー語ツイートから構成される、最初のアノテート済みデータセット「MOLD」の開発および公開すること。
  • 多言語トランスフォーマー(XLM-R)を用いたクロスリンガル転移学習の有効性を、低リソース言語タスクにおいて検証すること。
  • 言語の類縁度がクロスリンガル転移性能に与える影響を検討し、英語、ヒンディー語、ベンガル語をソース言語として比較すること。
  • 再現可能性および低リソース攻撃的言語検出分野におけるさらなる研究を支援するため、オープンソースのモデルおよびコードを提供すること。

提案手法

  • 攻撃的言語を識別する目的で、2,500件のマラーティー語ツイートを収集し、手動でアノテートしてMOLDデータセットを構築した。
  • MOLDデータセット上で、単言語モデル(SVM、LSTM)を訓練し、XLM-RoBERTaを微調整して攻撃的言語分類を実行した。
  • XLM-Rモデルを、英語(OLID、SOLID)、ヒンディー語(HASOC)、ベンガル語(TRAC)のデータセットで事前学習された重みで初期化することで、転移学習を実施した。
  • 微調整なしで他の言語で訓練されたモデルをマラーティー語のテストセットに直接適用することで、ゼロショット推論を実行した。
  • 微調整の回数を増やしながら、マラーティー語データセットの部分集合(100~4,000件)を用いて、フェイシュート学習の実験を実施した。
  • 複数の転移学習およびゼロショット設定において、マクロF1およびウェイトドF1スコアを用いて性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1RQ1: 低リソース環境下における攻撃的言語識別タスクにおいて、データセットサイズが単言語モデルおよびクロスリンガルモデルの性能に与える影響は何か?
  • RQ2RQ2: 攻撃的言語識別における言語の類縁度が、クロスリンガル予測性能に与える影響は何か?
  • RQ3RQ3: 英語、ヒンディー語、ベンガル語からの転移学習戦略を比較すると、マラーティー語の攻撃的コンテンツ予測性能にどのような差が生じるか?
  • RQ4RQ4: ソース学習データのサイズが一定値を超えて増加しても、転移学習性能に効果的な増加が得られるか、それとも限界効果が現れるか?

主な発見

  • ヒンディー語からの転移学習が、マラーティー語テストセットで最高のマクロF1スコア(0.9401)を達成し、他のすべてのソース言語および単言語ベースラインを上回った。
  • ヒンディー語ベースの転移学習はゼロショット設定でも最高の性能(マクロF1 = 0.8396)を達成し、言語の類縁度に起因する明確な利点を示した。
  • 8倍以上も大きなEN-SOLIDデータセットは、より小さなヒンディー語データセット(0.9401)よりも低い性能(マクロF1 = 0.9321)を示した。これは、言語の類縁度がデータサイズを上回る要因であることを示唆している。
  • フェイシュート学習の実験結果から、ヒンディー語はすべてのショット設定で他言語を常に上回り、言語的近接性の優位性が裏付けられた。
  • OLIDとSOLIDからの転移学習の性能差は最小限にとどまり、ある閾値を超えると追加のデータが結果に顕著な向上をもたらさないことが示された。
  • 結果から、英語とは距離の遠い言語に比べ、ヒンディー語やマラーティー語のような類縁言語からのクロスリンガル転移が、より大きなトレーニングセットを持つ英語からのものよりも効果的であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。