Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Offensive Content in Open-domain Conversations using Two Stage Semi-supervision

Chandra Khatri, Behnam Hedayatnia|arXiv (Cornell University)|Nov 30, 2018
Hate Speech and Cyberbullying Detection被引用数 11
ひとこと要約

本論文は、オープンドメインの会話における感受性のある言語を検出するための大規模で高品質なデータセットをブートストラップする二段階の半教師付き手法を提案する。ブラックリストを用いてサブレdditコミュニティを感受性のレベルでランク付けし、弱教師付きモデルを反復的に精練することで、データ選択を最適化する。このアプローチにより、公開データセットで学習したモデルと比較して、ドメイン外のテストセットで95.5%という最先端のF1スコアを達成した。

ABSTRACT

As open-ended human-chatbot interaction becomes commonplace, sensitive content detection gains importance. In this work, we propose a two stage semi-supervised approach to bootstrap large-scale data for automatic sensitive language detection from publicly available web resources. We explore various data selection methods including 1) using a blacklist to rank online discussion forums by the level of their sensitiveness followed by randomly sampling utterances and 2) training a weakly supervised model in conjunction with the blacklist for scoring sentences from online discussion forums to curate a dataset. Our data collection strategy is flexible and allows the models to detect implicit sensitive content for which manual annotations may be difficult. We train models using publicly available annotated datasets as well as using the proposed large-scale semi-supervised datasets. We evaluate the performance of all the models on Twitter and Toxic Wikipedia comments testsets as well as on a manually annotated spoken language dataset collected during a large scale chatbot competition. Results show that a model trained on this collected data outperforms the baseline models by a large margin on both in-domain and out-of-domain testsets, achieving an F1 score of 95.5% on an out-of-domain testset compared to a score of 75% for models trained on public datasets. We also showcase that large scale two stage semi-supervision generalizes well across multiple classes of sensitivities such as hate speech, racism, sexual and pornographic content, etc. without even providing explicit labels for these classes, leading to an average recall of 95.5% versus the models trained using annotated public datasets which achieve an average recall of 73.2% across seven sensitive classes on out-of-domain testsets.

研究の動機と目的

  • 手動でのアノテーションが高コストで文脈依存的であるため、オープンドメインのチャットボット相互作用における感受性のある言語の検出という課題に対処すること。
  • ブラックリストの限界、例えば低リCALLや、暗黙的または文脈依存的な攻撃的コンテンツを捉えられないことに対処すること。
  • 各感受性クラスに明示的なラベルを必要とせず、複数の感受性クラスに一般化可能なスケーラブルで柔軟なデータ収集戦略を開発すること。
  • 大規模な半教師付きデータを活用することで、インドメインおよびドメイン外のテストセットにおけるモデル性能を向上させること。
  • ブートストラップされたデータで学習したモデルが、繊細で暗黙的、あるいは文化的にニュアンスのある攻撃的言語に優れた一般化性能を示すことを実証すること。

提案手法

  • 攻撃的語彙のシードブラックリストを用いて、感受性のレベルでサブレdditコミュニティをランク付けし、感受性が最も高く・低いコミュニティからコンテンツを選択する。
  • 感受性が高く・低いコミュニティからサンプリングされた少量のバランスの取れた発話文を用いて初期分類器を訓練し、ベースラインモデルを確立する。
  • 訓練済み分類器とブラックリストを併用して、ランク付けされたコミュニティからスコア付けされ、キュレートされたより大規模でより代表的なデータセットを生成する。
  • 弱教師付きモデルを、Toxic Comment Challengeデータセットで事前学習し、第二段階でのデータ選択を改善することで、モデルの一般化性能を向上させる。
  • ブートストラップされたデータを公開データセット(Twitter、Toxic Wikipedia)と組み合わせ、最終モデルのファインチューニングおよび評価を行う。
  • 大規模な会話データを活用して、標準的なフィルタが見逃す文脈的・暗黙的・文化的にニュアンスのある攻撃的コンテンツを捉える。

実験結果

リサーチクエスチョン

  • RQ1二段階の半教師付きアプローチは、オープンドメインの会話における感受性のある言語検出のための大規模で多様で高品質なデータを有効にブートストラップできるか?
  • RQ2ブートストラップされたデータで学習したモデルの性能は、公開で手動アノテーションが施されたデータセットで学習したモデルと比較して、ドメイン外テストセットでどう異なるか?
  • RQ3特定の感受性クラス(例:差別的発言、人種差別、性的表現)に対して明示的なラベルを一切与えずに学習したモデルが、複数の攻撃的言語タイプにどれほど一般化できるか?
  • RQ4ブラックリストと弱教師付きスコアリングを統合することで、暗黙的または文脈依存的な攻撃的発話文のデータ選択とモデルリCALLが向上するか?
  • RQ5大規模な半教師付きデータは、ルールベースのシステムが検出が難しい、皮肉や政治的に敏感な発言のような繊細で明白でない攻撃的コンテンツを捉えることができるか?

主な発見

  • 提案された二段階の半教師付き手法は、ドメイン外テストセットで95.5%のF1スコアを達成した。これは、公開データセットで学習したベースラインモデルの75% F1と比べて顕著に優れていた。
  • ブートストラップされたデータで学習したモデルは、ドメイン外テストセットにおいて7つの感受性クラスの平均リCALLが95.5%であったのに対し、公開データセットで学習したモデルは73.2%であった。
  • TS Bootstrapモデルは、チャットボットテストセットにおける感受性クラスのリCALLを92.0%まで向上させ、未観測のオープンドメイン会話データへの一般化性能が優れていることを示した。
  • 定性的分析の結果、モデルは「Xはかつて語られた最も洗練された嘘だ」とか「Zは悪魔だ」といった、人間のアノテーターですら検出が難しい、繊細で文脈依存的な攻撃的発話文を検出できた。
  • この手法は、差別的発言、人種差別、性的表現、暴力といった多様な感受性タイプに良好に一般化したが、これらのカテゴリに明示的なラベルを付与する必要はなかった。
  • ブートストラップされたデータと公開データセット(TwitterおよびToxic)を組み合わせることで、F1スコアは95.6%まで向上し、複数のデータソースからの相乗効果が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。