Skip to main content
QUICK REVIEW

[論文レビュー] Kungfupanda at SemEval-2020 Task 12: BERT-Based Multi-Task Learning for Offensive Language Detection

Wenliang Dai, Tiezheng Yu|arXiv (Cornell University)|Apr 28, 2020
Hate Speech and Cyberbullying Detection参考文献 31被引用数 6
ひとこと要約

本稿では、SNSにおける攻撃的言語検出のためのBERTベースのマルチタスク学習モデルを提示する。3つの階層的サブタスク(A:攻撃的言語検出、B:分類、C:標的特定)を共同で学習する。本手法は、OLIDデータセットのみを用いてSemEval-2020 Task 12 Sub-task Aで91.51%のマクロ-F1スコアを達成し、85件の提出の中での順位は7位であり、共有BERT表現を用いたマルチタスク学習が単一タスクの微調整よりも性能を向上させることを示している。

ABSTRACT

Nowadays, offensive content in social media has become a serious problem, and automatically detecting offensive language is an essential task. In this paper, we build an offensive language detection system, which combines multi-task learning with BERT-based models. Using a pre-trained language model such as BERT, we can effectively learn the representations for noisy text in social media. Besides, to boost the performance of offensive language detection, we leverage the supervision signals from other related tasks. In the OffensEval-2020 competition, our model achieves 91.51% F1 score in English Sub-task A, which is comparable to the first place (92.23%F1). An empirical analysis is provided to explain the effectiveness of our approaches.

研究の動機と目的

  • 関連するサブタスクを活用することで、SNSにおける攻撃的言語検出の性能を向上させること。
  • BERTからの共有表現とサブタスク間の共同最適化が、検出性能を向上させるかどうかを調査すること。
  • 大規模でノイズの多いデータ(SOLID)での事前学習と、小規模で高品質なデータセット(OLID)での微調整の有効性を評価すること。
  • 関連タスク(例:標的特定)からのラベル付けが、主たるタスク(攻撃的言語検出)の性能を向上させるかどうかを検証すること。
  • 異なる損失重み付けとモデルアンサンブル戦略がマクロ-F1スコアに与える影響を分析すること。

提案手法

  • OLIDデータセット上で事前学習済みBERTモデルを微調整し、3つの階層的サブタスク(A:攻撃的分類、B:分類、C:標的特定)を実行する。
  • 3つのサブタスクすべてでBERTエンコーダーを共有し、それぞれに別々の分類ヘッドを設けることでマルチタスク学習を実装する。
  • サブタスクA、B、Cのクロスエントロピー損失を重み付きで組み合わせて最適化し、損失重みはそれぞれ0.4、0.3、0.3とする。
  • 過学習を防ぐために、最大20エポックで早期停止と学習率スケジューリング(初期値3e-6、バッチサイズ32)を適用する。
  • 5つの独立して初期化されたMTLモデルの予測結果を多数決で統合することで、汎化性能とロバスト性を向上させる。
  • OLIDでの交差検証により導出された閾値0.3を用いて、SOLIDのAVG_CONFスコアを二値ラベルに変換する。

実験結果

リサーチクエスチョン

  • RQ1攻撃的言語検出、分類、標的特定の3つのタスクを共同で学習することで、主たる検出タスクの性能が向上するか?
  • RQ2大規模でノイズの多いデータ(SOLID)で回帰損失を用いて事前学習することで、OLIDにおける下流タスクの性能が向上するか?
  • RQ3共有BERT表現を用いたマルチタスク学習は、単一タスクの微調整に比べてマクロ-F1スコアで優れているか?
  • RQ4モデルアンサンブルとハイパーパramータチューニングが検出性能に与える影響は何か?
  • RQ5大規模な規模にもかかわらず、SOLIDでの事前学習が性能向上に寄与しないのはなぜか?

主な発見

  • マルチタスク学習モデルは、SemEval-2020 Task 12 Sub-task Aの公式テストセットで91.51%のマクロ-F1スコアを達成し、85件の提出の中での順位は7位であった。
  • 異なるランダム初期化を用いた5つのMTLモデルのアンサンブルが最良の性能を示し、多様性による汎化性能の向上が裏付けられた。
  • SOLIDで平均二乗誤差損失を用いて事前学習したが、性能は向上せず、むしろわずかに劣化した。これはデータのノイズが原因であると考えられる。
  • BERTベースのマルチタスクモデルは、OLIDでの単一タスクBERT微調整を上回り、マクロ-F1スコアで1.38%の絶対的向上(82.03% → 83.41%)を達成した。
  • SOLIDにおけるモデルの性能はOLIDと一致しており、データ品質の違いにもかかわらず、モデルの堅牢性が示された。
  • 内部タスク関係(例:BがNULLの場合、AはNOTでなければならない)がマルチタスク学習によって効果的に捉えられており、予測の信頼性が向上していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。