Skip to main content
QUICK REVIEW

[論文レビュー] Trawling for Trolling: A Dataset

Hitkul, Karmanya Aggarwal|arXiv (Cornell University)|Aug 2, 2020
Marine and fisheries research被引用数 4
ひとこと要約

本稿では、5つのクラス(通常、不穏、トロール、貶義、嫌がらせ)にラベルが付された、12,490件のソーシャルメディアサンプルからなる、公開可能で手作業で検証されたデータセットを紹介する。既存のデータセットを明確な定義に基づいて再ラベル付けすることで、トロールと嫌がらせを明確に区別するリソースを構築し、モデルが統計的アーチファクトではなく意味的な言語的パターンを学習できるようにする。その有効性は、高い性能とデータアブレーションに対する感受性の両面で示されている。

ABSTRACT

The ability to accurately detect and filter offensive content automatically is important to ensure a rich and diverse digital discourse. Trolling is a type of hurtful or offensive content that is prevalent in social media, but is underrepresented in datasets for offensive content detection. In this work, we present a dataset that models trolling as a subcategory of offensive content. The dataset was created by collecting samples from well-known datasets and reannotating them along precise definitions of different categories of offensive content. The dataset has 12,490 samples, split across 5 classes; Normal, Profanity, Trolling, Derogatory and Hate Speech. It encompasses content from Twitter, Reddit and Wikipedia Talk Pages. Models trained on our dataset show appreciable performance without any significant hyperparameter tuning and can potentially learn meaningful linguistic information effectively. We find that these models are sensitive to data ablation which suggests that the dataset is largely devoid of spurious statistical artefacts that could otherwise distract and confuse classification models.

研究の動機と目的

  • トロールと他の攻撃的コンテンツ(特に嫌がらせ)を区別できるデータセットの不足に対処すること。
  • トロールを攻撃的コンテンツの独立したカテゴリとして捉える、公開可能で手作業でアノテートされたデータセットを構築すること。
  • 厳密なデータ検証とアブレーションテストにより、攻撃的コンテンツ検出データセットにおける誤った統計的アーチファクトを低減すること。
  • モデルが軽度で破壊的なトロールと深刻な嫌がらせを区別できるようにすることで、自動コンテンツモデレーションの公平性と正確性を向上させること。

提案手法

  • データセットは、以前に公開済みの攻撃的コンテンツデータセットのサンプルを、明確に定義された、経験的根拠に基づくカテゴリを用いて再アノテートすることで構築された。
  • 各サンプルは、5つのクラス(通常、不穏、トロール、貶義、嫌がらせ)の明確な定義に基づいて、人間のアノテーターによってラベル付けされた。
  • データセットは、ツイッター、レッドディット、ウィキペディア・トークページの3つのプラットフォームをカバーしており、多様な言語的特徴を確保している。
  • モデル評価には、ハイパーパrameterチューニングをほとんど行わず、全データセットで訓練されたBERTベースの分類器が使用され、汎化性能と言語的学習の程度が評価された。
  • データアブレーションテスト(ラベルのシャッフル、単語順序のランダム化、トークンの削除)を実施し、モデルが言語的構造に依存しているか、誤った手がかりに依存しているかを評価した。
  • 各クラスごとの上位n-gramの統計的分析を実施し、モデルを誤導する可能性のある強いユニグラムや短いシーケンスバイアスが存在しないことを確認した。

実験結果

リサーチクエスチョン

  • RQ1明確にトロールと嫌がらせを区別するデータセットが、攻撃的コンテンツ検出モデルの性能と公平性を向上させられるか?
  • RQ2最先端のモデルは、攻撃的コンテンツ検出において、表面的な統計的手がかりに依存するのではなく、意味的な言語的パターンをどれだけ正しく学習できるか?
  • RQ3本データセットに強いユニグラムやn-gramの手がかりが存在しない場合、モデルが誤った統計的アーチファクトに依存する割合は低下するか?
  • RQ4このデータセットで訓練されたモデルは、データアブレーションに対してどの程度感受性を示すか?これは、モデルが文脈的・順序的情報をどれだけ依存しているかを示唆する。
  • RQ5このデータセットは、攻撃的言語検出におけるNLPモデルのロバスト性と言語的一般化能力を評価するベンチマークとして機能できるか?

主な発見

  • 提案されたデータセットで訓練されたモデルは、ハイパーパrameterチューニングなしで75.3%の正確度と0.73の加重F1スコアを達成し、強力なベースライン性能を示した。
  • ラベルをシャッフルした場合、モデルの性能は35.1ポイント低下した。これは、モデルが正しいラベルに関連する手がかりを学習したことを示しており、データを記憶したのではなく、関連付けを学習したことを意味する。
  • 単語の順序をランダム化した場合、正確度は62.4%に低下した。これは、モデルが袋(bag)の単語表現ではなく、順序構造に依存していることを示している。
  • 50%のトークンを削除した場合、正確度は60.8%に低下した。これは、モデルが孤立したキーワードだけでなく、全シーケンスからの情報を使用していることを確認している。
  • 各クラスの上位n-gramの手がかりには、支配的なユニグラムパターンが存在しなかった。これは、データセットがモデルを誤導する強い統計バイアスを避けており、信頼できる学習環境を提供していることを示している。
  • データセットの設計と検証プロセスのおかげで、モデルは文脈的・言語的特徴を学習するようになり、ロバストで公平かつ解釈可能な攻撃的コンテンツ検出システムの構築に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。