Skip to main content
QUICK REVIEW

[論文レビュー] Toxicity Detection for Indic Multilingual Social Media Content

Manan Jhaveri, Devanshu Ramaiya|arXiv (Cornell University)|Jan 3, 2022
Hate Speech and Cyberbullying Detection被引用数 5
ひとこと要約

本論文は、翻訳されたデータ、メタデータ特徴量、および言語固有の閾値チューニングを活用したアンサンブル学習を用いて、13言語のインディック言語のソーシャルメディア投稿における多言語中毒性検出システムを提示している。XLM-RoBERTaとMuRILを用い、IIIT-D Multilingual Abusive Comment IdentificationチャレンジでSOTAとなる平均F1スコア0.90005を達成した。

ABSTRACT

Toxic content is one of the most critical issues for social media platforms today. India alone had 518 million social media users in 2020. In order to provide a good experience to content creators and their audience, it is crucial to flag toxic comments and the users who post that. But the big challenge is identifying toxicity in low resource Indic languages because of the presence of multiple representations of the same text. Moreover, the posts/comments on social media do not adhere to a particular format, grammar or sentence structure; this makes the task of abuse detection even more challenging for multilingual social media platforms. This paper describes the system proposed by team 'Moj Masti' using the data provided by ShareChat/Moj in \emph{IIIT-D Multilingual Abusive Comment Identification} challenge. We focus on how we can leverage multilingual transformer based pre-trained and fine-tuned models to approach code-mixed/code-switched classification tasks. Our best performing system was an ensemble of XLM-RoBERTa and MuRIL which achieved a Mean F-1 score of 0.9 on the test data/leaderboard. We also observed an increase in the performance by adding transliterated data. Furthermore, using weak metadata, ensembling and some post-processing techniques boosted the performance of our system, thereby placing us 1st on the leaderboard.

研究の動機と目的

  • 多言語ソーシャルメディアプラットフォームにおける低リソースなインディック言語の中毒的コンテンツを検出する課題に対処すること。
  • 標準的な文法や構造が欠如しているコードミックスドおよび非公式なソーシャルメディアテキストにおける嫌がらせ検出を改善すること。
  • 多様なインド言語コーパスで事前学習された多言語トランスフォーマーモデルを、低リソース言語設定で活用すること。
  • 翻訳されたテキストを用いたデータ拡張と弱いメタデータ特徴量の統合を通じて、モデル性能を向上させること。
  • 言語固有の確率閾値とポストプロセッシング技術を用いた推論最適化。

提案手法

  • 13言語の665,000件以上のアノテート済みインディックソーシャルメディアコメントを含む多言語データセット上で、XLM-RoBERTaとMuRILモデルを微調整した。
  • トレーニングデータ上でマスクド言語モデリング(MLM)事前学習を適用し、下流タスクのF1スコアを0.87から0.88に向上させた。
  • テストサンプルの翻訳済みバージョンを含めることでトレーニングデータを拡張し、7:3の重み比で予測を結合した。
  • XLM-RoBERTa、MuRIL、その他の多様なモデルを等重みでアンサンブル化し、一般化性能の向上と誤差相関の低減を図った。
  • 特徴工学的アプローチにより弱いメタデータ(例:レポート数、いいね数、コメント長さ)を統合し、勾配ブースティング分類器(XGBoost、CatBoost)を訓練した。
  • 言語固有の確率閾値(例:マラーティー語では0.6、グジャラート語では0.4)を適用し、境界ケースを是正するため0.01の確率ブーストを加えることで推論を最適化した。

実験結果

リサーチクエスチョン

  • RQ1コードミックスドおよび非公式な文法を持つ低リソースなインディック言語において、XLM-RoBERTa や MuRIL といった多言語トランスフォーマーモデルの中毒性検出効果はどの程度か?
  • RQ2翻訳によるデータ拡張は、多言語中毒性検出におけるモデルの一般化性能をどの程度向上させるか?
  • RQ3レポート数やいいね数といった弱いメタデータをディープラーニングの予測と組み合わせることで、モデル性能は向上するか?
  • RQ4言語固有の推論閾値が多言語環境下でのF1スコアに与える影響は何か?
  • RQ5非事前学習モデルも含む多様なモデルを用いたアンサンブル学習は、低リソースNLPタスクにおけるロバスト性と性能をどの程度向上させるか?

主な発見

  • XLM-RoBERTaとMuRILのアンサンブルが、テストセットで最高の平均F1スコア0.90005を達成し、リーダーボードで1位を獲得した。
  • マスクド言語モデリングによる事前学習により、ベースラインF1スコアが0.87から0.88に向上し、自己教師付き事前学習の価値を示した。
  • 翻訳済みデータの統合により、トレーニング例が限られる低リソース言語におけるモデルの一般化性能が向上した。
  • メタデータに基づく特徴工学的処理とブースティングモデル(XGBoost、CatBoost)の統合により予測性能が顕著に向上し、XGBoostとCatBoostのCV平均はそれぞれ0.9051および0.9052を記録した。
  • 言語固有の推論閾値(例:マラーティー語では0.6、グジャラート語では0.4)と0.01の確率ブーストにより、明確なパフォーマンス向上が得られた。
  • 驚くべきことに、インド語テキストで特に微調整されたMuRILは単体で使用した際には低性能であったが、アンサンブルにおいては貴重な多様性を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。