Skip to main content
QUICK REVIEW

[論文レビュー] SJ_AJ@DravidianLangTech-EACL2021: Task-Adaptive Pre-Training of Multilingual BERT models for Offensive Language Identification

Sai Muralidhar Jayanthi, Akshat Gupta|arXiv (Cornell University)|Feb 1, 2021
Hate Speech and Cyberbullying Detection参考文献 20被引用数 21
ひとこと要約

本稿では、コードミックスド・ドラヴィダ語(カンナダ語、タミル語、マラヤーラム語)における攻撃的言語の識別に、タスクに適応した微調整を施したmBERTおよびXLM-RoBERTaモデルのアンサンブルを提示する。多言語BERTにおけるマスク言語モデル化をタスク固有の事前学習段階で活用することで、EACL 2021共有タスクにおいてカンナダ語で1位、マラヤーラム語で2位、タミル語で3位という最先端の性能を達成した。

ABSTRACT

In this paper we present our submission for the EACL 2021-Shared Task on Offensive Language Identification in Dravidian languages. Our final system is an ensemble of mBERT and XLM-RoBERTa models which leverage task-adaptive pre-training of multilingual BERT models with a masked language modeling objective. Our system was ranked 1st for Kannada, 2nd for Malayalam and 3rd for Tamil.

研究の動機と目的

  • 自然言語処理分野で未だ十分にカバーされていないコードミックスド・ドラヴィダ語向けに、強固な攻撃的言語識別システムの開発。
  • 低リソースでコードミックスドのソーシャルメディアテキストを対象とした、多言語BERTモデルにおけるマスク言語モデル化を用いたタスクに適応した事前学習の有効性の調査。
  • モデルアンサンブルおよび表現融合技術を活用することで、不均衡な多言語データセットにおける性能の向上。
  • 入力形式(オリジナル文字 script とローマ字表記)がモデルの汎化性能および頑健性に与える影響の評価。

提案手法

  • 各ドラヴィダ語の訓練セットおよび開発セットを統合したデータ上で、マスク言語モデル化(MLM)を用いてmBERTおよびXLM-RoBERTaのタスクに適応した事前学習。
  • [CLS]トークンの表現とソフトマックス層を用いて、タスクに適応した事前学習済みモデルを攻撃的言語分類タスクに微調整。
  • 最終予測のためのメジャー投票を用いて、3つのmBERTおよび3つのXLM-RoBERTaモデルのアンサンブル作成。
  • BiLSTM層による文字レベル、サブワードレベル、語彙レベルの埋め込み表現の連結を用いた表現融合の検討。
  • Hugging Faceのtransformersライブラリを用い、デフォルトのハイパーパrameterを設定:5エポック、バッチサイズ8、開発セット性能に基づく早期停止。
  • アブレーションスタディのため、indic-transを用いてデータセットを表記変換したが、最終モデルには使用しなかった。

実験結果

リサーチクエスチョン

  • RQ1マスク言語モデル化を用いたタスクに適応した事前学習は、低リソースでコードミックスドのドラヴィダ語における攻撃的言語検出を向上させるか?
  • RQ2混合スクリプト入力を伴う多言語的・コードミックスドのデータに対して微調整されたmBERTおよびXLM-RoBERTaの性能は、どのように比較されるか?
  • RQ3文字レベルおよび語彙レベルのBiLSTMを用いた表現融合は、異なるドラヴィダ語においてどの程度モデル性能を向上させるか?
  • RQ4入力形式(オリジナル文字 vs. ローマ字表記)は、攻撃的言語検出におけるモデルの汎化性能および頑健性にどのように影響するか?

主な発見

  • タスクに適応した事前学習により、全3言語でF1スコアが1〜2%絶対値上昇し、特にマラヤーラム語で最大2%の向上が観察された。
  • アンサンブルモデルは最高の性能を示し、カンナダ語の開発セットではF1スコア70.30、正答率74.00を達成した。
  • XLM-RoBERTaはタミル語およびマラヤーラム語でmBERTを上回り、開発セットでそれぞれF1スコア76.94および96.76を記録した。
  • ベースラインモデルは、入力が完全にローマ字表記に変換されても依然として高い性能を維持しており、スクリプトの変化に対して頑健であることが示された。
  • 表現融合は一部のデータセットでは性能向上をもたらしたが、他のデータセットでは性能が低下したため、文脈依存的な有効性が示唆された。
  • 本システムはEACL 2021共有タスクでカンナダ語1位、マラヤーラム語2位、タミル語3位を達成し、最先端の結果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。