Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Anti-Semitic Hate Speech using Transformer-based Large Language Models

Dengyi Liu, Minghao Wang|arXiv (Cornell University)|May 6, 2024
Hate Speech and Cyberbullying Detection被引用数 4
ひとこと要約

本稿では、LoRA適応を用いた微調整された BERT、RoBERTa、LLaMA-2 モデルを用いて、変換器ベースの手法による反ユダヤ的嫌がらせ発言の検出を提案する。変換器モデル、特に BERT と RoBERTa が、精度、再現率、F1 スコアにおいて従来の機械学習手法を顕著に上回ることを示しており、LoRA の微調整により、微妙な嫌がらせ発言パターンの検出感度がさらに向上することが明らかになった。

ABSTRACT

Academic researchers and social media entities grappling with the identification of hate speech face significant challenges, primarily due to the vast scale of data and the dynamic nature of hate speech. Given the ethical and practical limitations of large predictive models like ChatGPT in directly addressing such sensitive issues, our research has explored alternative advanced transformer-based and generative AI technologies since 2019. Specifically, we developed a new data labeling technique and established a proof of concept targeting anti-Semitic hate speech, utilizing a variety of transformer models such as BERT (arXiv:1810.04805), DistillBERT (arXiv:1910.01108), RoBERTa (arXiv:1907.11692), and LLaMA-2 (arXiv:2307.09288), complemented by the LoRA fine-tuning approach (arXiv:2106.09685). This paper delineates and evaluates the comparative efficacy of these cutting-edge methods in tackling the intricacies of hate speech detection, highlighting the need for responsible and carefully managed AI applications within sensitive contexts.

研究の動機と目的

  • Twitter などのソーシャルメディアプラットフォームにおける反ユダヤ的嫌がらせ発言の増加に伴う課題に対処すること。従来の検出手法は、言語のニュアンスや文脈の複雑さのため、しばしば失敗する。
  • 反ユダヤ的コンテンツの民主的で合意形成に基づくアノテーションを可能にする、新たなデータラベル付け手法の開発。これにより、データセットの品質と信頼性が向上する。
  • 従来の機械学習モデル(例:SVM、ナイーブベイズ、ランダムフォレスト)と最先端の変換器ベースのモデル(例:BERT、RoBERTa、LLaMA-2)の反ユダヤ的嫌がらせ発言検出における性能を比較評価すること。
  • LoRA 微調整が、RoBERTa や LLaMA-2(7B)のような大規模言語モデルの性能に与える影響を調査すること。特に、再現率と F1 スコアの向上に注目する。
  • 解釈可能で高精度な NLP モデルを用いた自動コンテンツモデレーションの発展を通じて、より安全なオンラインコミュニケーションの実現に貢献すること。

提案手法

  • 民主的合意に基づく独自のデータラベル付けアルゴリズムを採用し、Twitter からの反ユダヤ的コンテンツに高品質で文脈に配慮したラベルを付与した。
  • 従来の機械学習モデルには CountVectorizer、TfidfVectorizer、HashingVectorizer を使用し、ディープラーニングモデルには BERT、DistilBERT、RoBERTa、LLaMA-2 の文脈的埋め込みを用いた。
  • 抽出された特徴量を用いて、k-NN、ロジスティック回帰、SVM、ランダムフォレスト、ナイーブベイズといった従来の分類器をベースラインモデルに適用した。
  • LoRA(低ランク適応)というパラメータ効率の良い微調整手法を用いて、RoBERTa と LLaMA-2(7B)を微調整した。この手法により、事前学習済みの知識を保持しながら、嫌がらせ発言検出に適応できる。
  • アノテートされたデータセット上で、すべてのモデルに対して標準的な NLP 評価指標(正解率、精度、再現率、F1 スコア)を用いてモデル性能を評価した。
  • 文脈理解力とアテンション機構の影響が嫌がらせ発言検出に与える影響を評価するため、従来モデルと変換器ベースのモデルの性能を比較した。
Figure 1: This figure shows the workflow of voting algorithm.
Figure 1: This figure shows the workflow of voting algorithm.

実験結果

リサーチクエスチョン

  • RQ1BERT や RoBERTa、LLaMA-2 といった変換器ベースのモデルは、従来の機械学習モデルと比較して、反ユダヤ的嫌がらせ発言の検出においてどのように異なるか?
  • RQ2LoRA の微調整は、RoBERTa や LLaMA-2(7B)といった大規模言語モデルの性能を、特に微妙なまたは文脈的に埋め込まれた反ユダヤ的嫌がらせ発言の検出においてどの程度向上させるか?
  • RQ3埋め込み手法の選択(例:TF-IDF、単語埋め込み、文脈的埋め込み)は、嫌がらせ発言検出モデルの性能にどのような影響を与えるか?
  • RQ4モデルアーキテクチャと計算効率は、反ユダヤ的嫌がらせ発言の検出に、特に再現率と F1 スコアの観点からどのような影響を与えるか?
  • RQ5合意形成に基づくデータラベル付けアプローチは、高精度な嫌がらせ発言検出システムの学習に適した信頼性があり代表的なデータセットを生成できるか?

主な発見

  • BERT は、すべての評価モデルの中で最高の正解率と F1 スコアを達成し、深い文脈理解のおかげで反ユダヤ的嫌がらせ発言の検出において優れた性能を示した。
  • LoRA の微調整後、RoBERTa と LLaMA-2(7B)は再現率と F1 スコアで顕著な向上を示し、ニュアンスや文脈に埋め込まれた嫌がらせ発言に対する感受性が向上したことが示された。
  • k-NN といった従来のモデルは、すべての指標で最悪の成績を示し、嫌がらせ発言検出に一般的に見られる高次元かつスパースなテキストデータの処理における限界が浮き彫りになった。
  • SVM やロジスティック回帰は、ある程度のベースライン性能を示したが、特に再現率において変換器モデルに常に劣り、多くの関連事例を検出できなかった。
  • 文脈的埋め込み(例:RoBERTa からのもの)と LoRA の微調整の組み合わせにより、LLaMA-2(7B)の F1 スコアが著しく10〜15%向上した。これは、パラメータ効率の良い微調整がモデルの適応性を高めることを示唆している。
  • 本研究は、変換器ベースのモデルが、反ユダヤ的嫌がらせ発言における言語的複雑さと文脈を捉える能力において、従来の機械学習モデルよりも顕著に優れていることを確認した。
Figure 2: Architecture of LoRA fine-tuning applied to Llama2 model weights, demonstrating how the injection of trainable low-rank matrices A and B (initialized as A with a normal distribution and B set to zero) allows for efficient adaptation of the model’s weights to new tasks, preserving the origi
Figure 2: Architecture of LoRA fine-tuning applied to Llama2 model weights, demonstrating how the injection of trainable low-rank matrices A and B (initialized as A with a normal distribution and B set to zero) allows for efficient adaptation of the model’s weights to new tasks, preserving the origi

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。