Skip to main content
QUICK REVIEW

[論文レビュー] Online Hate: Behavioural Dynamics and Relationship with Misinformation

Matteo Cinelli, Andraž Pelicon|arXiv (Cornell University)|May 28, 2021
Hate Speech and Cyberbullying Detection参考文献 38被引用数 9
ひとこと要約

本研究では、イタリアのCOVID-19関連動画の100万件以上のYouTubeコメントを、ファインチューニングされた深層学習モデルを用いて分析し、嫌がらせ発言や有毒な言語を検出する。『連続嫌がらせ投稿者』の証拠は見つからなかったが、信頼できるまたは疑わしい動画チャンネルに傾倒するユーザーが、反対のコミュニティで関与する際により有毒になることが示され、議論の長さ(時間的およびコメント数的)が延びるにつれて毒性が増加することが判明。これは、デジタル版のゴッドウィンの法則に相当するものである。

ABSTRACT

Online debates are often characterised by extreme polarisation and heated discussions among users. The presence of hate speech online is becoming increasingly problematic, making necessary the development of appropriate countermeasures. In this work, we perform hate speech detection on a corpus of more than one million comments on YouTube videos through a machine learning model fine-tuned on a large set of hand-annotated data. Our analysis shows that there is no evidence of the presence of "serial haters", intended as active users posting exclusively hateful comments. Moreover, coherently with the echo chamber hypothesis, we find that users skewed towards one of the two categories of video channels (questionable, reliable) are more prone to use inappropriate, violent, or hateful language within their opponents community. Interestingly, users loyal to reliable sources use on average a more toxic language than their counterpart. Finally, we find that the overall toxicity of the discussion increases with its length, measured both in terms of number of comments and time. Our results show that, coherently with Godwin's law, online debates tend to degenerate towards increasingly toxic exchanges of views.

研究の動機と目的

  • YouTubeのような主流のソーシャルメディアプラットフォームにおけるオンライン嫌がらせ行動のダイナミクスを調査すること。
  • 誤情報の消費と有毒または嫌がらせの言語使用の関係を検討すること。
  • 誤情報のソースに関与するユーザーが、嫌がらせ発言をより多く生成するかどうかを特定すること。
  • 毒性が時間経過とともにどのように変化するか、および議論の長さに応じてどのように変化するかを分析すること。
  • 持続的な『連続嫌がらせ投稿者』の仮定に疑問を呈し、エコーチャンバーの役割がオンラインの有毒性に与える影響を検討すること。

提案手法

  • 70,000件以上のYouTubeコメントを手動でアノテートしたデータセットを用いて、深層学習モデルをファインチューニングし、嫌がらせ発言検出に使用した。
  • コメントを4段階の毒性レベルに分類した:適切(0)、不適切(1)、攻撃的(2)、暴力的(3)。
  • 各ディスカッションの平均毒性レベル $ T_d $ を、個々のコメントの毒性スコアの平均値として算出した。
  • コメント数とコメント遅延(動画アップロードからの経過時間)という2つの時間的要因と毒性の関係を検証するため、線形回帰モデルを用いた。
  • イタリアのAGCOM規制当局が提供するリストに基づき、YouTubeチャンネルを「信頼できる」と「疑わしい」に分類した。
  • 観察された傾向の妥当性を検証し、統計的有意性を確保するために、実データとランダムラベルモデルを比較した。

実験結果

リサーチクエスチョン

  • RQ1YouTubeで誤情報を消費するユーザーは、嫌がらせ発言や有毒な言語をより高い頻度で示すのか?
  • RQ2『連続嫌がらせ投稿者』—つまり、常に嫌がらせのみを投稿するユーザー—の証拠はあるのか?
  • RQ3議論が時間的およびコメント数的に長くなるにつれて、オンライン議論の毒性はどのように変化するのか?
  • RQ4ユーザーが普段は参加しないコミュニティで関与する際に、より有毒になるのか?
  • RQ5エコーチャンバー効果が、異なるコミュニティ間の相互作用において、有毒な言語の使用をどの程度強化するのか?

主な発見

  • 『連続嫌がらせ投稿者』の証拠は見つからなかった—どのユーザーも常に嫌がらせコメントのみを投稿したわけではなく、嫌がらせ発言は専門的な少数派による持続的行動ではないことが示唆された。
  • 信頼できるニュースチャンネルに忠誠を誓うユーザーは、反対のコミュニティでコメントする際、疑わしいチャンネルに忠誠を誓うユーザーに比べ、平均的にはるかに有毒な言語を使用していた。
  • 議論の長さ(コメント数)とその平均的な毒性レベルとの間に、統計的に有意な正の相関関係が確認された。これは、ランダムラベルを制御しても成り立つ。
  • コメント遅延(動画アップロードからの経過時間)が長くなるほど、毒性が増加する傾向も確認された。これは、議論が時間とともに悪化する傾向があることを示し、ゴッドウィンの法則のデジタル的解釈を支持する。
  • 信頼できるチャンネルの動画における議論では、毒性と議論長さの関係が、疑わしいチャンネルの動画よりも強く、有意に顕著であった。
  • 全体として、YouTubeにおける嫌がらせ発言の割合は他のプラットフォームよりわずかに高かったが、信頼できるチャンネルと疑わしいチャンネルの動画におけるコメントに顕著な差は認められなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。