Skip to main content
QUICK REVIEW

[論文レビュー] Session-based Cyberbullying Detection in Social Media: A Survey

Peiling Yi, Arkaitz Zubiaga|arXiv (Cornell University)|Jul 14, 2022
Hate Speech and Cyberbullying Detection被引用数 4
ひとこと要約

本調査は、ソーシャルメディアの相互作用における繰り返し行動と力の不均衡をモデル化する、セッションベースのサイバーブリング検出フレームワークを提案する。データ、手法、データセット作成のベストプラクティスをレビューし、2つのデータセットで最先端のモデルおよび大規模言語モデルのベンチマークを実施し、セッションレベルのサイバーブリング検出における今後の研究における主要な課題を特定する。

ABSTRACT

Cyberbullying is a pervasive problem in online social media, where a bully abuses a victim through a social media session. By investigating cyberbullying perpetrated through social media sessions, recent research has looked into mining patterns and features for modeling and understanding the two defining characteristics of cyberbullying: repetitive behavior and power imbalance. In this survey paper, we define the Session-based Cyberbullying Detection framework that encapsulates the different steps and challenges of the problem. Based on this framework, we provide a comprehensive overview of session-based cyberbullying detection in social media, delving into existing efforts from a data and methodological perspective. Our review leads us to propose evidence-based criteria for a set of best practices to create session-based cyberbullying datasets. In addition, we perform benchmark experiments comparing the performance of state-of-the-art session-based cyberbullying detection models as well as large pre-trained language models across two different datasets. Through our review, we also put forth a set of open challenges as future research directions.

研究の動機と目的

  • 繰り返し行動と力の不均衡を捉える標準化されたセッションベースのサイバーブリング検出フレームワークを定義すること。
  • 多様なソーシャルメディアプラットフォームにおける、セッションベースのサイバーブリング検出のための既存のデータソースおよび手法論をレビューすること。
  • 高品質で代表的なセッションベースのサイバーブリングデータセットを作成するための証拠に基づく基準を確立すること。
  • 2つの公開データセット上で、最先端のセッションベースのモデルおよび大規模事前学習済み言語モデルのベンチマークを実施すること。
  • セッションベースのサイバーブリング検出における未解決の課題および今後の研究の方向性を特定すること。

提案手法

  • 本論文は、セッションベースのサイバーブリング検出をデータ収集、特徴工学、モデリング、評価の段階に分解する構造的フレームワークを導入する。
  • 繰り返し行動と力の不均衡をモデル化するため、メッセージの順序パターン、言語的手がかり、相互作用のダイナミクスなどのセッションレベル特徴を分析する。
  • セッションの分割、ラベルの一貫性、いじめ者・被害者関係におけるデータのバランスを含む、データセット構築のための一連のベストプラクティスを提案する。
  • ベンチマークは、最先端の順序モデル(例:RNN、Transformers)および大規模事前学習済み言語モデル(例:BERT)を2つの公開データセットで用いて実施する。
  • モデルの性能を比較するために、F1スコア、精度、再現率などの標準的なNLP指標を評価に用いる。
  • 計算言語学、社会心理学、NLPの知見を統合することで、方法論的および倫理的整合性を確保する。

実験結果

リサーチクエスチョン

  • RQ1繰り返し行動と力の不均衡を用いて、セッションベースのサイバーブリングをモデル化する標準化されたフレームワークをどのように設計できるか?
  • RQ2信頼性の高いセッションベースのサイバーブリング検出データセットを作成するにあたり、主なデータおよび手法論的課題は何か?
  • RQ3最先端の順序モデルおよび大規模事前学習済み言語モデルは、セッションベースのサイバーブリング検出タスクにおいてどのように性能を発揮するか?
  • RQ4高品質で代表的なセッションベースのサイバーブリングデータセットの作成をガイドする証拠に基づく基準は何か?
  • RQ5セッションベースのサイバーブリング検出における主要な未解決課題および今後の研究の方向性は何か?

主な発見

  • 提案されたセッションベースの検出フレームワークは、構造的なセッションモデリングにより、サイバーブリングの時間的・関係的ダイナミクスを効果的に捉えている。
  • ベンチマークの結果、大規模事前学習済み言語モデルは、セッションベースのサイバーブリング検出タスクにおいて一般的に従来の順序モデルを上回る性能を示した。
  • 研究では、データセット間で顕著な性能のばらつきが明らかになったことから、標準化された評価プロトコルの必要性が強調された。
  • 証拠に基づくデータセット作成基準は、今後の研究におけるデータ品質、一貫性、再現可能性を向上させた。
  • 長時間のセッションの処理、微妙な力の不均衡の検出、多様なソーシャルメディアプラットフォームにおけるモデルの一般化の確保といった、依然として重要な課題が残っている。
  • 本調査は、より強固な検出システムを実現するためには、社会心理学的知見をNLP技術と統合することが重要であることを強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。