Skip to main content
QUICK REVIEW

[論文レビュー] WAC: A Corpus of Wikipedia Conversations for Online Abuse Detection

Noé Cécillon, Vincent Labatut|arXiv (Cornell University)|Jan 1, 2019
Hate Speech and Cyberbullying Detection参考文献 16被引用数 4
ひとこと要約

本稿では、383,000件のアノテート済みウィキペディア会話メッセージを含み、193,000件の議論スレッドにまたがる大規模かつ公開可能なコーパス、WACを紹介する。高品質な嫌がらせラベルが付与されている。会話の文脈を保持するために、ウィキペディアコメントコーパスと編集履歴を組み合わせた再構築パイプラインを提案し、嫌がらせ検出手法の公平な比較を可能にするベンチマークプラットフォームを導入した。Google Perspective APIとテキストおよびグラフベースのハイブリッド分類器を用いたベースライン評価を通じて、文脈に配慮したモデルの有効性を示した。

ABSTRACT

Figures used in "WAC: A Corpus of Wikipedia Conversations for Online Abuse Detection".https://www.aclweb.org/anthology/2020.lrec-1.173/<br>

研究の動機と目的

  • オンライン嫌がらせに対してアノテートされた大規模かつ公開可能なウィキペディア会話スレッドのコーパスが不足しているという問題に対処すること。
  • 共通のベンチマークプラットフォームを導入することで、嫌がらせ検出手法の再現可能性と公平な比較を向上させること。
  • データセットに会話構造とダイナミクスを保持することで、文脈に基づく嫌がらせ検出研究を可能にすること。
  • コンテンツベースおよび構造ベースの嫌がらせ検出モデルの両方の学習と評価に適した高品質でスケーラブルなリソースを提供すること。

提案手法

  • 固有の識別子(rev_id および page_id)を用いて、ウィキペディアコメントコーパスのメッセージをその対応する編集履歴にリンクすることで、完全な会話スレッドを再構築する。
  • メッセージの種別、著者、トークページ、嫌がらせラベルなどのメッセージレベルのアノテーションを抽出するためのマルチステップパイプラインを適用する。
  • テキスト特徴量(例:TF-IDF、n-gram)と会話構造から導出されるグラフ特徴量(例:リプライツリー、トポロジー的測度)を組み合わせたハイブリッド分類アプローチを用いる。
  • データ分割、評価指標(精度、再現率、F1スコア)、モデル統合を標準化するオープンソースのベンチマークプラットフォームを開発する。
  • ベースライン毒性スコアを生成するためにGoogle Perspective APIを活用し、等誤差率の閾値(毒性 >0.64、深刻な毒性 >0.92)を用いて二値分類を行う。
  • コーパスに同梱された標準化された訓練/開発/テスト分割を用い、3つの異なる嫌がらせタイプ(個人攻撃、攻撃的、毒性)に対して手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1既存のウィキペディアコメントデータと編集ログから、高品質なアノテーションが付与された大規模かつ公開可能な完全なウィキペディア会話スレッドのコーパスを再構築できるか?
  • RQ2会話の文脈を含めることで、孤立したメッセージ分類と比較して、自動嫌がらせ検出モデルの性能がどの程度向上するか?
  • RQ3Google Perspective API などの事前学習モデルが、構造化された会話データに対して、異なる嫌がらせタイプ(個人攻撃、攻撃的、毒性)に一般化する程度はどの程度か?
  • RQ4テキスト特徴量と構造的特徴量を組み合わせたハイブリッドモデルは、純粋にテキストベースまたは構造のみに依存するモデルよりも、嫌がらせ検出において優れた性能を示せるか?
  • RQ5共通のベンチマークプラットフォームは、標準化されたコーパス上で多様な嫌がらせ検出手法の公平かつ再現可能な評価をどの程度可能にするか?

主な発見

  • WACコーパスには、193,000件の会話スレッドにまたがる383,000件のアノテート済みメッセージが含まれており、高品質な人間による嫌がらせラベルが付与されており、これは現在公開されている中で最大規模の会話レベルの嫌がらせ検出データセットの一つである。
  • Google Perspective API は、毒性データセットではF1スコア約75%を達成しているが、個人攻撃および攻撃的タイプでは性能が著しく低下しており、異なる嫌がらせタイプへの一般化能力に限界があることが示された。
  • Perspective API の深刻な毒性スコアは、高い再現率(約70%)を示すが、精度は低く(約54%)なため、誤検出率が高く、自動アノテーションの信頼性が人間によるアノテーションより低いことを裏付けた。
  • 提案されたテキストおよびグラフベースのハイブリッド分類器は、3つの嫌がらせタイプすべてでF1スコア約75%を達成しており、Perspective API の毒性スコアを上回る性能を示したが、他のコーパスで報告された先行研究に比べてやや劣る性能であった。
  • ベンチマークプラットフォームにより、標準化されたデータ分割と評価指標を用いた一貫した評価と比較が可能となり、再現不能な結果のリスクを低減し、嫌がらせ検出研究における再現可能性を促進した。
  • 本研究では、線形チャット会話に最適化されたグラフ特徴量が、しばしば非線形かつ多分支構造を持つウィキペディアトークページでは効果が低いことが明らかになった。これは、構造モデリングに特化した手法の開発が今後必要であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。