Skip to main content
QUICK REVIEW

[論文レビュー] A BERT-Based Transfer Learning Approach for Hate Speech Detection in Online Social Media

Marzieh Mozafari, Reza Farahbakhsh|arXiv (Cornell University)|Oct 28, 2019
Hate Speech and Cyberbullying Detection被引用数 6
ひとこと要約

本稿では、複数のBERTエンコーダーレイヤーを微調整することにより性能を向上させる、BERTベースの転移学習手法を提案し、ソーシャルメディアにおける嫌がらせ発言検出に応用している。ベンチマークデータセットにおいて最先端の結果を達成しており、精度、再現率、F1スコアの向上を示した一方で、誤分類解析を通じてデータアノテーションにおけるバイアスを明らかにした。

ABSTRACT

Generated hateful and toxic content by a portion of users in social media is a rising phenomenon that motivated researchers to dedicate substantial efforts to the challenging direction of hateful content identification. We not only need an efficient automatic hate speech detection model based on advanced machine learning and natural language processing, but also a sufficiently large amount of annotated data to train a model. The lack of a sufficient amount of labelled hate speech data, along with the existing biases, has been the main issue in this domain of research. To address these needs, in this study we introduce a novel transfer learning approach based on an existing pre-trained language model called BERT (Bidirectional Encoder Representations from Transformers). More specifically, we investigate the ability of BERT at capturing hateful context within social media content by using new fine-tuning methods based on transfer learning. To evaluate our proposed approach, we use two publicly available datasets that have been annotated for racism, sexism, hate, or offensive content on Twitter. The results show that our solution obtains considerable performance on these datasets in terms of precision and recall in comparison to existing approaches. Consequently, our model can capture some biases in data annotation and collection process and can potentially lead us to a more accurate model.

研究の動機と目的

  • 嫌がらせ発言のアノテーション済みデータが限られていること、および既存のデータセットに内在するバイアスの課題に対処すること。
  • 事前学習済みBERTモデルを用いた転移学習により、嫌がらせ発言検出の性能を向上させること。
  • 新たな微調整戦略を用いて、異なるBERTエンコーダーレイヤーが下流の嫌がらせ分類に与える影響を調査すること。
  • モデルの予測が、データ収集およびアノテーションプロセスにおけるバイアスをどのように露呈するかを分析すること。
  • 嫌がらせ発言と攻撃的言語、ニュートラルな内容を区別できる、文脈に配慮した強力な分類器を開発すること。

提案手法

  • 嫌がらせ、人種差別、性差別、攻撃的コンテンツのアノテーションが施された2つの公開済みTwitterデータセットを用いて、事前学習済みBERTモデルを嫌がらせ発言検出に微調整すること。
  • 複数のBERTトランスフォーマーエンコーダーレイヤーからの構文的および文脈的情報を活用するための新規なCNNベースの微調整戦略を適用すること。
  • 嫌がらせ発言検出に最適な特徴抽出を特定するために、異なるBERTレイヤー表現のパフォーマンスを評価すること。
  • 英語のWikipediaおよびBookCorpusを用いた大規模な事前学習によるBERTの一般言語理解を活用するための転移学習を実施すること。
  • 誤分類されたサンプルを分析し、特に口語的表現、地理的文脈、スラングに関連するバイアスを特定すること。
  • モデルの予測結果と人間のアノテーションを比較し、モデルが文脈的なニュアンスやアノテーションバイアスを検出できるかを評価すること。

実験結果

リサーチクエスチョン

  • RQ1低リソースなソーシャルメディアデータセットにおいて、異なるBERTエンコーダーレイヤーを微調整することで、嫌がらせ発言検出の性能にどのような影響を与えるか?
  • RQ2BERTベースのモデルは、嫌がらせ発言検出において、精度、再現率、F1スコアの面で先行する最先端手法を上回ることができるか?
  • RQ3データ収集およびアノテーション中に生じたバイアス、特に口語的表現やスラングに関連するバイアスを、どの程度モデルが検出できるか?
  • RQ4文脈的に複雑なツイートにおいて、モデルは嫌がらせ発言、攻撃的言語、ニュートラルな内容をどのように区別するか?
  • RQ5モデルの予測結果は、既存の嫌がらせ発言データセットにおける系統的なアノテーションバイアスを明らかにできるか?

主な発見

  • 提案されたBERTベースのモデルは、ベンチマークデータセットにおいて最先端のパフォーマンスを達成し、精度、再現率、F1スコアの面で先行手法を上回った。
  • 複数のBERTレイヤーにCNNベースの戦略を用いた微調整により、文脈的および構文的特徴を活用することで、検出性能が顕著に向上した。
  • モデルはアノテーションバイアスを検出する能力を示し、特にアフリカ系アメリカ英語(African American Vernacular English)を用いたツイートや、'nigga' や 'faggot' といったスラングに関連するバイアスを明らかにした。
  • 誤分類の多くはモデルの失敗ではなく、スラングが文脈的に中立的または攻撃的であるにもかかわらず、しばしば嫌がらせとしてラベル付けされていたことから、アノテーションバイアスに起因していた。
  • モデルは、暗黙の嫌がらせ、攻撃的言語、ニュートラルな内容を効果的に区別できており、事前学習による知識から強力な文脈理解が得られていることを示唆した。
  • 誤分類されたサンプルの分析から、アノテーターが発話者の身元、口語的表現、社会的文脈を考慮せずにスラングを嫌がらせとしてラベル付けしていることが明らかになり、データバイアスの存在が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。