Skip to main content
QUICK REVIEW

[論文レビュー] Mono vs Multilingual BERT for Hate Speech Detection and Text Classification: A Case Study in Marathi

Abhishek Velankar, Hrushikesh Patil|arXiv (Cornell University)|Apr 19, 2022
Hate Speech and Cyberbullying Detection被引用数 4
ひとこと要約

本研究では、マーラチ語のテキスト分類における単言語および多言語 BERT モデルを比較し、MahaBERT、MahaALBERT、MahaRoBERTa を mBERT、indicBERT、xlm-RoBERTa と比較して、嫌がらせ検出およびセンチメント分析のタスクで評価した。単語言語モデルは一貫して多言語モデルを上回り、MahaRoBERTa は HASOC-2021 で 89.0% の正確度を達成し、MahaAlBERT は Articles データセットで 94.5% を記録した。これは、マーラチ語 NLP タスクにおける優れた性能と、より豊かな文の埋め込み表現を示している。

ABSTRACT

Transformers are the most eminent architectures used for a vast range of Natural Language Processing tasks. These models are pre-trained over a large text corpus and are meant to serve state-of-the-art results over tasks like text classification. In this work, we conduct a comparative study between monolingual and multilingual BERT models. We focus on the Marathi language and evaluate the models on the datasets for hate speech detection, sentiment analysis and simple text classification in Marathi. We use standard multilingual models such as mBERT, indicBERT and xlm-RoBERTa and compare with MahaBERT, MahaALBERT and MahaRoBERTa, the monolingual models for Marathi. We further show that Marathi monolingual models outperform the multilingual BERT variants on five different downstream fine-tuning experiments. We also evaluate sentence embeddings from these models by freezing the BERT encoder layers. We show that monolingual MahaBERT based models provide rich representations as compared to sentence embeddings from multi-lingual counterparts. However, we observe that these embeddings are not generic enough and do not work well on out of domain social media datasets. We consider two Marathi hate speech datasets L3Cube-MahaHate, HASOC-2021, a Marathi sentiment classification dataset L3Cube-MahaSent, and Marathi Headline, Articles classification datasets.

研究の動機と目的

  • マーラチ語固有の NLP タスク、たとえば嫌がらせ検出やセンチメント分析における単語言語および多言語 BERT モデルの性能を評価すること。
  • 大規模なマーラチ語コーパスを用いた単語言語の事前学習が、低リソースのインド語に対して多言語事前学習よりも優れた表現を生み出すかどうかを評価すること。
  • モデル間で固定された BERT エンコーダーからの文の埋め込みを比較し、異なるドメインにわたる一般化能力を検証すること。
  • 単一言語の下流タスク、とりわけマーラチ語のような低リソース言語において、単語言語モデルの優位性を実証的根拠で示すこと。
  • 標準化されたデータセット上で最先端のモデルをベンチマークすることで、マーラチ語 NLP のためのモデル選定ガイドラインを NLP 社会に提供すること。

提案手法

  • L3Cube-MahaHate、HASOC-2021、L3Cube-MahaSent、およびマーラチ語ヘッドライン/記事データセットなどのマーラチ語データセットに、MahaBERT、MahaALBERT、MahaRoBERTa という単語言語のマーラチ語 BERT 亜種を微調整した。
  • 同じマーラチ語データセットに微調整された標準的な多言語モデル(mBERT、indicBERT、xlm-RoBERTa)と比較した。
  • 2つの訓練方式を実施した:完全微調整(非固定)と、BERT エンコーダー層を固定して分類器ヘッドのみを訓練する方法。
  • 文の埋め込みを評価するため、BERT エンコーダーを固定し、[CLS] テンキー表現を下流分類に使用した。
  • L3Cube-MahaCorpus(752M テンキー)を含む大規模な単語言語コーパスを用いて、単語言語モデルを事前学習した。
  • 嫌がらせ検出、センチメント分析、およびテキスト分類タスクの5つの異なる下流分類実験を実施した。

実験結果

リサーチクエスチョン

  • RQ1大規模なマーラチ語コーパスを用いて事前学習された単語言語 BERT モデルは、マーラチ語テキスト分類タスクにおいて多言語 BERT モデルを上回るのか?
  • RQ2単語言語および多言語 BERT モデルの文の埋め込みは、マーラチ語 NLP タスクにおける判別力の観点でどのように比較されるか?
  • RQ3固定された BERT エンコーダー層は、異なるマーラチ語テキスト分類データセットにわたって、一般的で再利用可能な文の表現をどの程度生成するのか?
  • RQ4MahaBERT、MahaALBERT、MahaRoBERTa のうち、どのモデルアーキテクチャがマーラチ語嫌がらせ検出およびセンチメント分類で最高のパフォーマンスを示すのか?
  • RQ5多言語モデルが多言語間転送を目的として設計されているにもかかわらず、なぜ単語言語モデルが優れたパフォーマンスを示すのか?

主な発見

  • MahaRoBERTa は、HASOC-2021 嫌がらせ検出データセットで 89.0% の最高正確度を記録し、すべての多言語モデルを上回った。
  • MahaAlBERT は、マーラチ語 Articles 分類データセットで 94.5% の正確度を達成し、テストされたすべてのモデルの中で最高だった。
  • 単語言語モデルは、すべての5つの下流タスクで一貫して多言語モデルを上回り、嫌がらせ検出の非固定微調整では MahaBERT が 88.3% を記録した。
  • BERT エンコーダー層を固定した場合、性能が著しく低下した(例:MahaBERT は L3Cube-MahaHate で 82.4%)。これは、固定モデルからの一般的な文の埋め込み表現が劣っていることを示している。
  • MahaBERT や MahaAlBERT といった単語言語モデルの文の埋め込みは、多言語モデルのそれよりも豊かな表現を提供しており、特に微調整された場合に顕著だった。
  • より優れた文の表現を備えながらも、単語言語の埋め込みはドメイン外のソーシャルメディアデータセットへの一般化がうまくいかなかった。これは、ドメイン適応型の文の埋め込みモデルの開発が求められていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。