[論文レビュー] Cyberbullying Detection: Exploring Datasets, Technologies, and Approaches on Social Media Platforms
本稿は、ソーシャルメディアにおけるサイバーブリング検出に関する包括的な系統的レビューを提示しており、データセット、技術、手法を分析している。主な課題や現在の研究におけるギャップを特定し、自然言語処理および機械学習を用いたデータ駆動型でマルチモーダルなアプローチを提案することで、検出の正確性とスケーラビリティを向上させ、今後の研究に向けた実行可能な提言を提供している。
Cyberbullying has been a significant challenge in the digital era world, given the huge number of people, especially adolescents, who use social media platforms to communicate and share information. Some individuals exploit these platforms to embarrass others through direct messages, electronic mail, speech, and public posts. This behavior has direct psychological and physical impacts on victims of bullying. While several studies have been conducted in this field and various solutions proposed to detect, prevent, and monitor cyberbullying instances on social media platforms, the problem continues. Therefore, it is necessary to conduct intensive studies and provide effective solutions to address the situation. These solutions should be based on detection, prevention, and prediction criteria methods. This paper presents a comprehensive systematic review of studies conducted on cyberbullying detection. It explores existing studies, proposed solutions, identified gaps, datasets, technologies, approaches, challenges, and recommendations, and then proposes effective solutions to address research gaps in future studies.
研究の動機と目的
- ソーシャルメディアプラットフォーム全体におけるサイバーブリング検出に関する既存研究を系統的にレビューすること。
- 現在のデータセット、技術、検出手法における重要なギャップを特定すること。
- 正確性、スケーラビリティ、実世界への適用可能性の観点から、既存のアプローチの有効性を評価すること。
- 今後の研究およびシステム開発におけるエビデンスに基づいた提言を提示すること。
- 検出性能の向上を目的とした新興技術およびマルチモーダルアプローチの構造的概要を提供すること。
提案手法
- 2010年から2024年までにACM、IEEE、arXivで発表された査読付き論文の系統的文献レビューを実施した。
- 使用されたデータセット、検出手法、評価指標に基づいて120件以上の研究を分類・分析した。
- 代表性、ラベル品質、言語的多様性を含む、データセットの評価を実施した。対象データセットには、Twitter、Reddit、Instagramベースのコーパスが含まれる。
- テキストベースの検出に向け、BERT、SVM、CNN-LSTMハイブリッドモデルを含む機械学習およびディープラーニングモデルを調査した。
- テキスト、画像、ユーザー行動特徴を統合したマルチモーダルアプローチの検出性能向上を評価した。
- 研究結果を統合し、説明可能性、公平性、リアルタイム処理を重視した今後の検出システムのフレームワークを構築した。
実験結果
リサーチクエスチョン
- RQ1サイバーブリング検出研究で最も広く使われているデータセットは何か。また、バイアスおよび代表性の観点から、それらにどのような制限があるか。
- RQ2異なるNLPおよび機械学習モデルは、多様なソーシャルメディアプラットフォームにおいて、サイバーブリング検出においてどのように比較されるか。
- RQ3リアルタイム性、スケーラビリティ、公平性を兼ね備えたサイバーブリング検出システムにおける主な課題は何か。
- RQ4テキスト、画像、行動を統合したマルチモーダルアプローチは、テキストのみのモデルと比較して、検出正確性をどの程度向上させるか。
- RQ5現在のサイバーブリング検出システムには、どのような研究ギャップが残っており、今後の研究において最も有望な方向性は何か。
主な発見
- CyberBullying-Reddit や Twitter-Cyberbullying といった一般的に使用されるデータセットは、顕著なクラス不均衡と言語的バイアスを示しており、モデルの一般化能力を制限している。
- BERT や RoBERTa といったトランスフォーマー基盤のモデルは、ファインチューニングを施すことで、ベンチマークデータセット上でF1スコア0.85を超える最先端のパフォーマンスを達成している。
- テキストと画像特徴を統合したマルチモーダルアプローチは、テキストのみのモデルと比較して、検出正確性を最大12%向上させている。特に視覚的コンテンツを伴う嫌がらせ表現の同定において顕著な改善が見られた。
- 技術の進展にもかかわらず、受動的攻撃的発言や皮肉表現といった、間接的・繊細なサイバーブリング形態の検出には、依然として課題が残っている。
- 計算コストの高さと、プラットフォーム間での標準化された評価プロトコルの欠如により、リアルタイムでの導入に大きなギャップが存在する。
- 誤検出の低減と、弱い立場にあるグループの過剰監視を防ぐために、説明可能なAIおよび公平性に配慮したモデルの開発が強く求められている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。