Skip to main content
QUICK REVIEW

[論文レビュー] Hate and Offensive Speech Detection in Hindi and Marathi

Abhishek Velankar, Hrushikesh Patil|arXiv (Cornell University)|Oct 23, 2021
Hate Speech and Cyberbullying Detection参考文献 17被引用数 8
ひとこと要約

この論文では、HASOC 2021 データセットを用いて、ヒンディ語およびマラーティー語における嫌がらせおよび攻撃的発言検出のためのディープラーニングモデルを提案および評価している。CNN、LSTM、および BERTベースのモデルを比較した結果、微細分類タスクにおけるヒンディ語分類では、学習不能な FastText 嵪合が BERT を上回る性能を示した一方、RoBERTa および IndicBERT は二値分類タスクで最先端の結果を達成した。

ABSTRACT

Sentiment analysis is the most basic NLP task to determine the polarity of text data. There has been a significant amount of work in the area of multilingual text as well. Still hate and offensive speech detection faces a challenge due to inadequate availability of data, especially for Indian languages like Hindi and Marathi. In this work, we consider hate and offensive speech detection in Hindi and Marathi texts. The problem is formulated as a text classification task using the state of the art deep learning approaches. We explore different deep learning architectures like CNN, LSTM, and variations of BERT like multilingual BERT, IndicBERT, and monolingual RoBERTa. The basic models based on CNN and LSTM are augmented with fast text word embeddings. We use the HASOC 2021 Hindi and Marathi hate speech datasets to compare these algorithms. The Marathi dataset consists of binary labels and the Hindi dataset consists of binary as well as more-fine grained labels. We show that the transformer-based models perform the best and even the basic models along with FastText embeddings give a competitive performance. Moreover, with normal hyper-parameter tuning, the basic models perform better than BERT-based models on the fine-grained Hindi dataset.

研究の動機と目的

  • ヒンディ語やマラーティー語などの低リソースなインド言語における嫌がらせおよび攻撃的発言検出のためのアノテート済みデータの不足に対処すること。
  • ヒンディ語およびマラーティー語のテキストに対して、CNN、LSTM、BiLSTM、およびトランスフォーマーベースのモデルを含む多様なディープラーニングアーキテクチャの性能を評価すること。
  • 事前学習済み語の嵌め込み(FastText)とランダム初期化、および学習可能/学習不能な埋め込みの有効性を比較すること。
  • ヒンディ語における微細分類のための嫌がらせ発言ラベル付けにおいて、階層的分類戦略と直接的マルチクラス分類戦略の優劣を調査すること。
  • 今後のインド語の低リソース NLP 分野における研究のため、公開共有された最先端のモデルを提供すること。

提案手法

  • HASOC 2021 共同タスクの二値および微細分類ラベルを用いて、嫌がらせおよび攻撃的発言検出をテキスト分類タスクとして定式化した。
  • 1D-CNN、LSTM、および BiLSTM モデルを、ヒンディ語およびマラーティー語の両方の言語で、ランダム初期化および事前学習済み FastText 語彙埋め込み(学習可能および学習不能モード)を用いて訓練した。
  • 多言語 BERT(mBERT)、IndicBERT、RoBERTa-base、およびヒンディ語専用の RoBERTa 変種を含むトランスフォーマーベースのモデルを評価した。
  • ヒンディ語の4クラス分類タスクに対して、階層的分類アプローチを適用:まず嫌がらせまたは非嫌がらせに分類し、嫌がらせのインスタンスをさらに HATE、OFFN、または PRFN に分類した。
  • モデルの性能を比較するために、標準的な指標(正確性、マクロ F1、適合率、再現率)を用いた。
  • 再現可能性およびコミュニティ利用を目的として、最高性能を示したモデルを Hugging Face で公開した。

実験結果

リサーチクエスチョン

  • RQ1ヒンディ語およびマラーティー語における嫌がらせおよび攻撃的発言検出において、FastText 嵪合を用いた従来のディープラーニングモデル(CNN、LSTM)と、BERT バリエーションを含むトランスフォーマーベースのモデルの性能はどのように比較されるか?
  • RQ2低リソース環境下で、学習不能な FastText 嵪合が学習可能またはランダム初期化の埋め込みよりも性能を向上させるか?
  • RQ3ヒンディ語における微細分類タスクにおいて、階層的分類戦略は直接的マルチクラス分類戦略よりも優れているか?
  • RQ4データの不均衡問題は、微細分類タスクにおける BERT ベースのモデルの性能にどのように影響を与えるか?
  • RQ5基本的なモデル(CNN や LSTM)は、低リソースかつ微細分類タスクにおいて BERT ベースのモデルを上回ることができるか?

主な発見

  • マラーティー語の二値分類タスクにおいて、最高性能を示したのは、学習不能な FastText 嵪合を用いた BiLSTM で、F1 スコアは 0.854 を記録した。
  • ヒンディ語の二値分類タスクでは、学習不能な FastText 嵪合を用いた BiLSTM が F1 スコア 0.750 を達成し、他の設定を上回った。
  • ヒンディ語の微細分類4クラス分類タスクにおいて、学習不能な FastText 嵪合を用いた CNN モデルが F1 スコア 0.517 を達成し、階層的 RoBERTa モデル(F1: 0.520)および直接的マルチクラス RoBERTa(F1: 0.521)をわずかに上回った。
  • マラーティー語データセットにおいて、IndicBERT が BERT バリエーションの中で最高の性能を示し、F1 スコアは 0.869 を記録した。
  • ヒンディ語の二値分類タスクにおいて、RoBERTa-base が他の BERT バリエーションを上回り、F1 スコア 0.763 を達成した。
  • BERT ベースのモデルは、微細分類タスクにおけるヒンディ語データセットのクラス不均衡に対してより感受性が高く、最適な性能を得るにはデータ拡張が必要であるのに対し、基本的なモデルは不均衡に対してより頑健であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。