Skip to main content
QUICK REVIEW

[論文レビュー] Offensive Language and Hate Speech Detection with Deep Learning and Transfer Learning

Bencheng Wei, Jason Li|arXiv (Cornell University)|Aug 6, 2021
Hate Speech and Cyberbullying Detection参考文献 1被引用数 19
ひとこと要約

本稿では、BERT、DistilBERT、GPT-2を用いた転移学習とBi-LSTMを組み合わせた深層学習的手法を提案し、ツイートを嫌がらせ発言、攻撃的言語、またはその他の分類に分類する。24,783件のツイートを含む公開データセットを用い、ハイパーパrameterチューニングの結果、92%を超える正確性を達成した。特に、ALBERTモデルが他の転移学習アーキテクチャーより分類性能で優れていた。

ABSTRACT

Toxic online speech has become a crucial problem nowadays due to an exponential increase in the use of internet by people from different cultures and educational backgrounds. Differentiating if a text message belongs to hate speech and offensive language is a key challenge in automatic detection of toxic text content. In this paper, we propose an approach to automatically classify tweets into three classes: Hate, offensive and Neither. Using public tweet data set, we first perform experiments to build BI-LSTM models from empty embedding and then we also try the same neural network architecture with pre-trained Glove embedding. Next, we introduce a transfer learning approach for hate speech detection using an existing pre-trained language model BERT (Bidirectional Encoder Representations from Transformers), DistilBert (Distilled version of BERT) and GPT-2 (Generative Pre-Training). We perform hyper parameters tuning analysis of our best model (BI-LSTM) considering different neural network architectures, learn-ratings and normalization methods etc. After tuning the model and with the best combination of parameters, we achieve over 92 percent accuracy upon evaluating it on test data. We also create a class module which contains main functionality including text classification, sentiment checking and text data augmentation. This model could serve as an intermediate module between user and Twitter.

研究の動機と目的

  • SNSコンテンツにおける嫌がらせ発言や攻撃的言語といった、増加する有害なオンライン発言の課題に対処すること。
  • 自動的かつスケーラブルなソリューションを提供し、ツイートを3つのカテゴリに分類する:嫌がらせ発言、攻撃的言語、またはその他の分類。
  • 事前学習された言語モデル(BERT、DistilBERT、GPT-2など)を用いた転移学習により分類の正確性を向上させること。
  • Keras Tunerを用いたハイパーパrameterチューニングにより、学習率、ドロップアウト、全結合層の構成を最適化し、モデル性能を向上させること。
  • ブランドセーフティ応用分野におけるテキスト分類、感情分析、データ拡張を支援する再利用可能でモジュラーなNLPパイプラインを構築すること。

提案手法

  • 著者らは、テキスト分類のベースラインを確立するために、ランダムおよび事前学習済みGloVe埋め込みを用いたBi-LSTMモデルを訓練した。
  • 3つの事前学習済みモデル(BERT、DistilBERT、GPT-2)を用いた転移学習を実施し、3クラスの嫌がらせ発言分類タスクに適応して微調整した。
  • Keras Tunerライブラリを用いてハイパーパrameterチューニングを実施し、LSTMおよび全結合層の両方で、隠れユニット数、ドロップアウト率、学習率を最適化した。
  • バッチサイズ128、20エポックでモデルを訓練し、Adam最適化法とカテゴリカル交差エントロピー損失関数を用いた。
  • テキスト分類、TextBlobによる感情分析、およびモデルの耐性強化のためのデータ拡張を支援するカスタムクラスモジュールを開発した。
  • テストデータを用いたモデル評価を実施し、正確性、混同行列、および誤検出(偽陽性)と見逃し(偽陰性)のコスト・ベネフィット分析を通じて性能を測定した。

実験結果

リサーチクエスチョン

  • RQ1BERT、DistilBERT、GPT-2といった転移学習モデルは、ランダムまたはGloVe埋め込みを用いた従来のBi-LSTMモデルよりも、攻撃的言語および嫌がらせ発言の分類において優れた性能を示すか?
  • RQ2このデータセット上でBi-LSTMアーキテクチャの分類正確性を最大化するための最適なハイパーパrameterの組み合わせ(例:学習率、ドロップアウト率、隠れユニット数)は何か?
  • RQ3誤検出と見逃しの予測がブランドセーフティに与える影響は何か?また、高コストな誤分類を最小限に抑えるために、モデル性能をどのように最適化できるか?
  • RQ4データの不均衡はモデル性能にどの程度影響を与えるか?また、データ拡張および正規化技術は、この問題をどのように緩和できるか?
  • RQ5リアルタイムのSNS監視における攻撃的言語検出を支援する、モジュラーかつ再利用可能なNLPパイプラインを効果的に構築できるか?

主な発見

  • 最も優れた性能を示したのは、微調整されたALBERTベースの転移学習モデルで、テストセットで92%を超える正確性を達成した。これは、ランダム埋め込みを用いたBi-LSTMモデルや他の転移学習モデルを上回った。
  • ハイパーパrameterチューニングによりモデル性能が顕著に向上した。最適な設定は、LSTMユニット数が352および320、ドロップアウト率が0.65および0.80、学習率が0.0001であった。
  • 転移学習モデルの中で、ベースALBERTモデルが最も高い正確性を示し、次いでDistilBERT、GPT-2の順に性能が良かった。これは、このタスクにおいて小型で簡略化されたモデルが優れた性能を発揮することを示している。
  • TextBlobを用いた感情分析の結果、嫌がらせ発言および攻撃的言語のツイートは、中立のツイート(主観度 ≈0.3)と比較して、同程度の主観度(≈0.4)を示したが、より否定的な極性を示した。
  • モデルは攻撃的言語と中立的コンテンツを強く区別できる能力を示したが、クラス0(嫌がらせ発言)とクラス1(攻撃的言語)は重複する語彙を共有しており、分類の難易度を高めていることが分かった。
  • ALBERTベースのモデルを用いた実世界のブランドセーフティ応用への再現性およびデプロイメントを可能にするために、公開のGitHubリポジトリにJupyterノートブックを提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。