Skip to main content
QUICK REVIEW

[論文レビュー] indicnlp@kgp at DravidianLangTech-EACL2021: Offensive Language Identification in Dravidian Languages

Kushal Kedia, Abhilash Nandy|arXiv (Cornell University)|Feb 14, 2021
Hate Speech and Cyberbullying Detection参考文献 19被引用数 9
ひとこと要約

本論文は、コードミックスド・ドラヴィダ語(タミル-英語、マラヤーラム-英語、カナレース-英語)における攻撃的言語識別のための最先端のアンサンブルシステムを提示する。多言語 BERT および RoBERTa を用いた転移学習を活用し、追加の単語語彙英語攻撃的言語データ(OLID)で微調整している。この手法により、それぞれのデータセットで重み付き F1 スコア 0.77、0.97、0.72 を達成し、順位は第1位、第2位、第3位となった。

ABSTRACT

The paper presents the submission of the team indicnlp@kgp to the EACL 2021 shared task "Offensive Language Identification in Dravidian Languages." The task aimed to classify different offensive content types in 3 code-mixed Dravidian language datasets. The work leverages existing state of the art approaches in text classification by incorporating additional data and transfer learning on pre-trained models. Our final submission is an ensemble of an AWD-LSTM based model along with 2 different transformer model architectures based on BERT and RoBERTa. We achieved weighted-average F1 scores of 0.97, 0.77, and 0.72 in the Malayalam-English, Tamil-English, and Kannada-English datasets ranking 1st, 2nd, and 3rd on the respective tasks.

研究の動機と目的

  • 低リソースでコードミックスドなドラヴィダ語データセットにおける攻撃的言語識別の課題に対処すること。
  • 転移学習と外部の単語語彙データを活用することで、低リソース環境におけるモデルの汎化能力を向上させること。
  • RNN とトランスフォーマー・アーキテクチャを組み合わせたアンサンブルモデルの多言語攻撃的言語検出における有効性を調査すること。
  • 転移学習によるデータ拡張が、コードミックスド・テキストにおける多言語 BERT および RoBERTa に与える影響を評価すること。
  • EACL 2021 の共有課題「ドラヴィダ語における攻撃的言語識別」で競争的に順位を獲得すること。

提案手法

  • コードミックスド・ドラヴィダ語データセットを用いて、転移学習により多言語 BERT (mBERT) および XLM-RoBERTa (XLM-R) モデルを微調整した。
  • ドリャビダ語のコードミックスドデータセットに、単語語彙の OLID データセット(14k 英語ツイート)を組み合わせることで、汎化能力の向上とクラス不均衡の緩和を図った。
  • ストップワード除去、語形還元、絵文字を説明文に置換する処理、および相互情報量に基づく特徴選択を含むデータ前処理を実施した。
  • ドメイン固有のデータで言語モデルを微調整する ULMFiT を用いた転移学習により、AWD-LSTM モデルを訓練した。
  • トランスフォーマー・モデルの最終層隠れ状態の最大プーリングおよび平均プーリングの連結により、文の表現を構築した。
  • 最終推論のために、上位の性能を示した XLM-R、mBERT、ULMFiT モデルの予測を平均化することでアンサンブルモデルを構築した。

実験結果

リサーチクエスチョン

  • RQ1単語語彙英語攻撃的言語データ(OLID)からの転移学習が、低リソースのコードミックスド・ドラヴィダ語データセットにおける性能向上に寄与するか?
  • RQ2外部データと組み合わせたコードミックスド・ドラヴィダ語データで微調整された多言語トランスフォーマー・モデル(mBERT、XLM-R)の有効性はいかほどか?
  • RQ3多様なアーキテクチャ(RNN、BERT、RoBERTa)を統合したアンサンブル学習が、攻撃的言語識別におけるロバスト性と性能向上にどの程度寄与するか?
  • RQ4より大きな統合データセットで微調整されたモデルが、低リソース言語へのゼロショットまたはフェイシュート転移に与える影響は?
  • RQ5異なる前処理戦略(例:絵文字の置換、語形還元)が、コードミックスドSNSテキストにおけるモデル性能に与える影響は?

主な発見

  • アンサンブルモデルはタミル-英語データセットで重み付き F1 スコア 0.77 を達成し、共有課題で第1位となった。
  • モデルはマラヤーラム-英語データセットで重み付き F1 スコア 0.97 を達成し、第2位となった。
  • モデルはカナレース-英語データセットで重み付き F1 スコア 0.72 を達成し、全体で第3位となった。
  • OLID データセットを用いた転移学習は、特に小さなカナレース-英語データセットにおいて性能を顕著に向上させた。
  • 統合データで微調整された XLM-RoBERTa モデルが、3つのデータセットすべてで最高の F1 スコアを記録し、mBERT や ULMFiT を上回った。
  • XLM-R、mBERT、ULMFiT モデルのアンサンブルは、低リソース環境におけるモデル多様性の利点を示し、最もロバストで高い性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。