Skip to main content
QUICK REVIEW

[論文レビュー] ToxCCIn: Toxic Content Classification with Interpretability

Tong Xiang, Sean MacAvaney|arXiv (Cornell University)|Mar 1, 2021
Hate Speech and Cyberbullying Detection参考文献 39被引用数 8
ひとこと要約

本稿では、投稿の毒性をそのスパンの毒性の最大値としてモデル化することで、トランスフォーマーに基づく毒性検出における解釈可能性を向上させるToxCCInという手法を提案する。マルチタスク学習により、全体の毒性と個々のスパンの毒性の両方を予測するように訓練することで、優れた品質で人間が好む説明を生成し、解釈性において従来のロジスティック回帰を上回る結果を得た。一方で、Civil Commentsデータセットにおける分類性能は高く維持されている。

ABSTRACT

Despite the recent successes of transformer-based models in terms of effectiveness on a variety of tasks, their decisions often remain opaque to humans. Explanations are particularly important for tasks like offensive language or toxicity detection on social media because a manual appeal process is often in place to dispute automatically flagged content. In this work, we propose a technique to improve the interpretability of these models, based on a simple and powerful assumption: a post is at least as toxic as its most toxic span. We incorporate this assumption into transformer models by scoring a post based on the maximum toxicity of its spans and augmenting the training process to identify correct spans. We find this approach effective and can produce explanations that exceed the quality of those provided by Logistic Regression analysis (often regarded as a highly-interpretable model), according to a human study.

研究の動機と目的

  • コンテンツモデレーションにおける信頼性や手動レビューの妨げとなる、最先端のトランスフォーマー型モデルにおける解釈性の欠如を是正すること。
  • 特にソーシャルメディアのコンテンツモデレーションのような高リスクな文脈において、モデルの予測に対する人間が理解できる説明を生成する手法を開発すること。
  • 新たなマルチタスク学習アプローチにより、ドメイン内およびクロスドメインの両設定において、モデルの性能と頑健性を向上させること。
  • モデルが生成する説明が、本質的に解釈可能なモデルとして広く使われているロジスティック回帰を上回る解釈性を持つかどうかを評価すること。

提案手法

  • 投稿の毒性は、最も毒性の強いスパンの毒性以上であるという仮定に基づく。したがって、全体の毒性は、すべてのスパンの毒性スコアの最大値(max-pooling)によって決定される。
  • ニューラルマルチタスク学習フレームワークを用い、(1) 全文の毒性分類と(2) 各トークンの毒性スコアの予測を同時に学習する。
  • モデルはBERTまたはELECTRAをベースエンコーダーとして使用し、最終層で各トークンの毒性スコアを予測する。これらのスコアは最大プーリングにより集約され、最終的な予測が得られる。
  • 訓練中は、極端な毒性スコア(0または1に近い値)を促すために、平均二乗誤差(MSE)損失が適用され、予測の極端化によって解釈性が向上する。
  • 有害語の形態的変化でさえも、検出を回避するために改ざんされた場合でも、WordPieceトークン化を活用して保持する。
  • 説明は、予測された毒性スコアが最も高いトークンを強調することで生成され、モデルの意思決定に対する人間が読みやすい根拠が提供される。

実験結果

リサーチクエスチョン

  • RQ1スパンの毒性の最大値として毒性をモデル化することで、分類性能を損なわせることなく、トランスフォーマー型モデルが解釈性を向上させられるか?
  • RQ2提案手法が生成する説明が、人間評価においてロジスティック回帰の説明を上回るか?
  • RQ3標準的なファインチューニング済みトランスフォーマーと比較して、モデルはクロスドメイン設定でどのように性能を発揮するか?
  • RQ4従来の解釈可能なモデルの説明と比較して、モデルの説明の定性的な強みと弱みは何か?

主な発見

  • 人間評価において、53.7%のアノテーターが統合データセットでロジスティック回帰よりもBERT-MT(ToxCCIn)の説明を好んだ。CCDデータセットでは59.4%が好んだ。
  • BERT-MTは、Civil Comments Dataset(CCD)およびOffenseval 2019 Implicit Dataset(OLID)の両方で、解釈性においてロジスティック回帰を上回った。有意な優位性が確認された。
  • モデルはドメイン内およびクロスドメインの両評価で、ベースラインモデルよりも高いF1スコアを達成し、分類効果の向上を示した。
  • BERT-MTは、文脈的に敏感な、あるいは改ざんされた有害語を含むケースにおいて、特に有毒スパンを正確に特定できた。これは、文脈的埋め込みとWordPieceの保持によるものである。
  • 複数の非有害語が集まって毒性を示す状況では、ロジスティック回帰がより包括的(ただし、やや不正確)な説明を生成するため、好まれた。
  • 否定された侮辱や悪意的に改ざんされたスラングのような、暗黙的(implicit)な毒性言語に対しては、両モデルとも性能を発揮できず、今後の研究課題として、暗黙的毒性の対処が必要であると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。