Skip to main content
QUICK REVIEW

[論文レビュー] Towards non-toxic landscapes: Automatic toxic comment detection using DNN

Ashwin Geet d'Sa, Irina Illina|arXiv (Cornell University)|Nov 19, 2019
Hate Speech and Cyberbullying Detection参考文献 24被引用数 19
ひとこと要約

本論文では、BERTの微調整を用いた深層ニューラルネットワーク(DNN)ベースのアプローチを提案し、特徴ベースのBERT、fastText、Mikolovの埋め込みよりも優れた性能を発揮する。アドバーシャルな摂動に対する耐性を評価し、英語Wikipedia Detoxデータセットにおいて最先端の性能を示し、有毒コンテンツ分類においてBERTの微調整が最も効果的な手法であることを確立した。

ABSTRACT

The spectacular expansion of the Internet has led to the development of a new research problem in the field of natural language processing: automatic toxic comment detection, since many countries prohibit hate speech in public media. There is no clear and formal definition of hate, offensive, toxic and abusive speeches. In this article, we put all these terms under the umbrella of "toxic" speech. The contribution of this paper is the design of binary classification and regression-based approaches aiming to predict whether a comment is toxic or not. We compare different unsupervised word representations and different DNN based classifiers. Moreover, we study the robustness of the proposed approaches to adversarial attacks by adding one (healthy or toxic) word. We evaluate the proposed methodology on the English Wikipedia Detox corpus. Our experiments show that using BERT fine-tuning outperforms feature-based BERT, Mikolov's and fastText representations with different DNN classifiers.

研究の動機と目的

  • オンラインディス course における有毒コメントを堅牢かつ正確に分類する手法の開発。
  • さまざまな単語表現(例:BERT、fastText、Mikolov)が有毒コメント検出に与える効果の比較。
  • DNNモデルがアドバーシャルな語の摂動(有毒または無害な語)に対してどれほど耐性を示すかの評価。
  • 実世界のWebテキストにおける深層学習を用いた有毒言語検出の強力なベースラインの確立。

提案手法

  • 著者らは、コメントの有毒性を予測するために二値分類および回帰ベースのDNNモデルを採用する。
  • 複数の非教師あり単語表現(微調整済みBERT、特徴ベースBERT、fastText、Mikolovのスキップグラム)を比較する。
  • モデルは、有毒コメント検出の標準ベンチマークである英語Wikipedia Detoxデータセット上で訓練および評価される。
  • アドバーシャルな耐性は、コメントに1語(有毒または非有毒)を挿入し、モデル性能の変化を測定することでテストされる。
  • 微調整済みBERTを主なモデルとして用い、文脈を考慮した埋め込みを活用して意味理解を向上させる。
  • モデルの性能を比較するために、AUC-ROCやF1スコアといった標準的なNLP評価指標が使用される。

実験結果

リサーチクエスチョン

  • RQ1微調整済みBERTは、他の単語表現手法よりも有毒コメント検出で優れているか?
  • RQ2さまざまな事前学習済み埋め込みを用いた際、DNNアーキテクチャの性能はどのように異なるか?
  • RQ3DNNモデルは、コメントにおけるアドバーシャルな語の挿入に対してどの程度耐性を示すか?
  • RQ4統一されたフレームワークは、ヘイトスピーチや攻撃的コンテンツを含む多様な形態の有毒言語を効果的に分類できるか?

主な発見

  • 微調整済みBERTは、テストされたすべてのモデルの中で最高の性能を示し、特徴ベースBERT、fastText、Mikolov埋め込みを著しく上回った。
  • 1語の追加に対してもモデルは高い耐性を示し、わずかなアドバーシャル摂動に対しても強靭であることが示された。
  • 特徴ベースBERTは強力な性能を示したが、微調整済みBERTに比べて劣っていたことから、下流タスクにおける微調整の利点が浮き彫りになった。
  • fastTextおよびMikolov埋め込みは、曖昧な有毒言語を捉える能力が低く、特にその点で性能が低かった。
  • 回帰ベースのアプローチは二値分類と同等の結果を示し、タスク定式化の柔軟性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。