Skip to main content
QUICK REVIEW

[論文レビュー] Enhanced Offensive Language Detection Through Data Augmentation

Ruibo Liu, Guangxuan Xu|arXiv (Cornell University)|Dec 5, 2020
Hate Speech and Cyberbullying Detection参考文献 9被引用数 5
ひとこと要約

本稿では、分類器に依存しないGPT-2ベースのデータ拡張手法Dagerを提案する。この手法は、特定のクラスに特化した語彙的特徴を活用して、不均衡なデータセットにおける分類性能を向上させるために、攻撃的言語のトレーニングデータを合成生成する。ICWSM-2020データセットの1%のデータでの学習時にもF1スコアを11%向上させ、複数の分類器で一貫した向上効果を示し、生成されたデータのラベル保持性も優れている。

ABSTRACT

Detecting offensive language on social media is an important task. The ICWSM-2020 Data Challenge Task 2 is aimed at identifying offensive content using a crowd-sourced dataset containing 100k labelled tweets. The dataset, however, suffers from class imbalance, where certain labels are extremely rare compared with other classes (e.g, the hateful class is only 5% of the data). In this work, we present Dager (Data Augmenter), a generation-based data augmentation method, that improves the performance of classification on imbalanced and low-resource data such as the offensive language dataset. Dager extracts the lexical features of a given class, and uses these features to guide the generation of a conditional generator built on GPT-2. The generated text can then be added to the training set as augmentation data. We show that applying Dager can increase the F1 score of the data challenge by 11% when we use 1% of the whole dataset for training (using BERT for classification); moreover, the generated data also preserves the original labels very well. We test Dager on four different classifiers (BERT, CNN, Bi-LSTM with attention, and Transformer), observing universal improvement on the detection, indicating our method is effective and classifier-agnostic.

研究の動機と目的

  • レアラベル(例:嫌がらせ)を含む攻撃的言語検出におけるクラス不均衡問題に対処すること。
  • 外部データセットや補助学習を必要とせず、低リソースかつ不均衡なテキスト分類を改善すること。
  • 少数クラスにおけるモデル一般化性能を向上させる分類器に依存しないデータ拡張手法を開発すること。
  • 大規模言語モデルが、下流NLPタスク用に高品質でラベル保持性の高い合成データを効果的に生成できるかどうかを評価すること。

提案手法

  • Dagerは、特定の攻撃的言語ラベルに条件づけられたGPT-2に基づく条件付き生成器を用いる。この生成器は、ラベルに応じて微調整されている。
  • 各ターゲットクラス(例:嫌がらせ)から語彙的特徴を抽出し、生成プロセスをガイドする。
  • 条件付き生成はベイズ推論を用いて実装される:P(xₜ|c) ∝ P(xₜ)P(c|xₜ)、ここでcはラベル、xₜはステップtにおけるトークンである。
  • デコード段階でクラス条件信号を注入することで、自己回帰的生成が望ましいラベルへと誘導される。
  • 生成されたサンプルは学習セットに追加され、クラス分布のバランスが取られ、モデルの一般化性能が向上する。
  • 本手法は4つの分類器(BERT、CNN、Bi-LSTM with attention、Transformer)に適用され、広範な適用可能性が示された。

実験結果

リサーチクエスチョン

  • RQ1GPT-2ベースのデータ拡張は、低リソースかつ不均衡なデータセットにおける攻撃的言語検出性能を顕著に向上させることができるか?
  • RQ2生成された合成データは元のラベルを高い忠実度で保持しているか?
  • RQ3本手法は多様なニューラルネットワークアーキテクチャに対して効果的かつ頑健であるか?
  • RQ4合成サンプルで拡張された場合、元の学習データ量の変化に応じて性能はどのようにスケーリングするか?

主な発見

  • ICWSM-2020データセットの1%のデータでの学習時、Dagerはベースラインと比較してF1スコアを11ポイント向上させた。
  • 学習データの70%が合成データであってもF1スコアはわずか12.5%低下にとどまり、優れたラベル保持性を示した。
  • 本手法は4つのテスト分類器(BERT、CNN、Bi-LSTM with attention、Transformer)すべてで性能向上を示し、分類器に依存しない性質を確認した。
  • 最も顕著な相対的向上は、低データ環境(例:学習データの20%)で観察され、F1スコアは最大で7%の絶対的向上を達成した。
  • 生成されたテキストは高い意味的・構文的多様性を維持しており、単純な語の置換による拡張手法を上回った。
  • Dagerを用いて学習セットを全データサイズの80%まで拡張した場合、F1スコアは0.8157に達し、元の全データセットの0.8139にほぼ等しい水準に近づいた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。