Skip to main content
QUICK REVIEW

[論文レビュー] Spread Love Not Hate: Undermining the Importance of Hateful Pre-training for Hate Speech Detection

Omkar Gokhale, Aditya Kane|arXiv (Cornell University)|Oct 9, 2022
Hate Speech and Cyberbullying Detection被引用数 4
ひとこと要約

この論文は、ヒンディー語およびマラーティー語において、嫌がらせの前処理が有害なコンテンツの前処理に比べて優れたもしくは同等の性能を示すことで、嫌がらせの前処理が有害発話検出に不可欠であるという仮定に疑問を呈する。MahaTweetBERTおよびHindTweetBERT——インド諸言語向けの最先端のBERTモデル——を新たに開発し、金標準の有害発話ベンチマークを併せて公開することで、性能向上の主因は害意特有の前処理ではなくドメイン適応であることを示している。

ABSTRACT

Pre-training large neural language models, such as BERT, has led to impressive gains on many natural language processing (NLP) tasks. Although this method has proven to be effective for many domains, it might not always provide desirable benefits. In this paper, we study the effects of hateful pre-training on low-resource hate speech classification tasks. While previous studies on the English language have emphasized its importance, we aim to augment their observations with some non-obvious insights. We evaluate different variations of tweet-based BERT models pre-trained on hateful, non-hateful, and mixed subsets of a 40M tweet dataset. This evaluation is carried out for the Indian languages Hindi and Marathi. This paper is empirical evidence that hateful pre-training is not the best pre-training option for hate speech detection. We show that pre-training on non-hateful text from the target domain provides similar or better results. Further, we introduce HindTweetBERT and MahaTweetBERT, the first publicly available BERT models pre-trained on Hindi and Marathi tweets, respectively. We show that they provide state-of-the-art performance on hate speech classification tasks. We also release hateful BERT for the two languages and a gold hate speech evaluation benchmark HateEval-Hi and HateEval-Mr consisting of manually labeled 2000 tweets each. The models and data are available at https://github.com/l3cube-pune/MarathiNLP .

研究の動機と目的

  • 低リソースのインド諸言語、たとえばヒンディー語やマラーティー語において、有害発話検出に有害前処理が本当に必要かどうかを調査すること。
  • 4000万件のツイートコーパスの有害性、非有害性、およびランダムなサブセットで事前学習したBERTモデルの性能を、有害発話分類タスクにおいて評価すること。
  • マラーティー語とヒンディー語のツイートをそれぞれ対象に、最初の公開可能なBERTモデル(MahaTweetBERTおよびHindTweetBERT)を開発・公開すること。
  • 各言語で2000件の手動ラベル付きツイートを含む、金標準の有害発話評価ベンチマーク(HateEval-HiおよびHateEval-Mr)を構築すること。
  • ドメイン特化した適応、つまりコンテンツのポジティブ性・ネガティブ性に関係なくドメイン内前処理が、有害特化型前処理を上回る優れた性能をもたらすことを実証すること。

提案手法

  • マラーティー語およびヒンディー語のツイート4000万件をそれぞれ用いて、マスク言語モデル(MLM)目的関数に基づき、MahaBERTおよびHindBERTを事前学習した。
  • 先行の最先端の有害発話モデルから得た信頼度スコアを用いて、4000万件のツイートコーパスから3つのサブセットを抽出した:最も有害な(上位100万件)、最も非有害な(下位100万件)、およびランダム(100万件)のツイート。
  • 25エポックのトレーニングスケジュールと初期値5e-6のレーニングレートを用いて、各モデルバージョンを下流の有害発話検出データセット(HASOCおよびCONSTRAINT)で微調整した。
  • 再現性とアクセシビリティを確保するため、Hugging Faceのtransformersライブラリを用いてトレーニングおよびモデルホスティングを実施した。
  • 各実験に対して5回のランダムシード実行を実施し、平均マクロ-F1スコアを報告することで統計的信頼性を確保した。
  • すべてのモデル、データセット、トレーニングコードをL3Cube-MarathiNLPプロジェクトとしてGitHubに公開し、コミュニティの利用を可能にした。

実験結果

リサーチクエスチョン

  • RQ1低リソースのインディック言語、たとえばヒンディー語やマラーティー語において、有害ツイートで前処理をすると、有害発話検出の性能が向上するのか?
  • RQ2有害前処理による性能向上は、ドメイン適応の効果によるものか、それとも前処理データに含まれる有害なコンテンツそのものに起因するのか?
  • RQ3非多言語モデル(ドメイン内ツイートで事前学習)は、17カ国のインド言語と数十億トークンで事前学習された多言語モデルMuRILと比べて、有害発話検出タスクでどのように性能を発揮するか?
  • RQ4非有害またはランダムなドメイン内テキストで事前学習したモデルは、有害コンテンツで事前学習したモデルと同等またはそれ以上の性能を発揮できるか?
  • RQ54000万件のツイートで大規模な前処理を実施することで、小規模でキュレートされたサブセットよりも、下流の有害発話分類タスクの性能がどの程度向上するのか?

主な発見

  • 非有害またはランダムなツイートサブセットで事前学習したモデルは、ヒンディー語およびマラーティー語の両方において、有害コンテンツで事前学習したモデルを上回るか同等の性能を示した。
  • 4000万件のドメイン内ツイートで事前学習したMahaTweetBERTおよびHindTweetBERTは、すべての下流データセットで最先端の性能を達成し、有害バージョンでさえも上回った。
  • 有害前処理バージョン(例:MahaTweetBERT-Hateful)は最良の結果をもたらさず、実際にはマクロ-F1スコアにおいて3つのマラーティー語データセットのうち2つと、2つのヒンディー語データセットで非有害またはランダムデータで学習したモデルに劣った。
  • 大規模なドメイン内ツイートコーパスで微調整された単言語モデルは、17カ国のインド言語と数十億トークンで事前学習された多言語モデルMuRILを著しく上回った。
  • 有害前処理による性能向上は、おそらく有害特化の言語的パターンを学習する直接的効果ではなく、ドメイン適応の副次的効果である可能性が高い。
  • 2000件の手動ラベル付きツイートを含むHateEval-HiおよびHateEval-Mrの公開により、ヒンディー語およびマラーティー語における有害発話検出の最初の金標準ベンチマークが提供された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。