Skip to main content
QUICK REVIEW

[論文レビュー] Investigating Factors Influencing the Latency of Cyberbullying Detection

Rahat Ibn Rafiq, Homa Hosseinmardi|arXiv (Cornell University)|Nov 16, 2016
Hate Speech and Cyberbullying Detection参考文献 12被引用数 5
ひとこと要約

本稿では、初期予測子、動的マルチレベル優先スケジューラ、および段階的分類を備えたマルチステージアーキテクチャを用いて、オンラインソーシャルネットワーク向けにスケーラブルで低レイテンシのサイバーいじめ検出システムを提案する。実際の Vine データを用いた評価において、アラート応答時間を最大 7 倍短縮し、リソース使用量を最小限に抑えながら 100,000 件のアクティブなメディアセッションに効率的にスケーリングする高精度を維持する。

ABSTRACT

Cyberbullying in online social networks has become a critical problem, especially among teenagers who are social networks' prolific users. As a result, researchers have focused on identifying distinguishing features of cyberbullying and developing techniques to automatically detect cyberbullying incidents. While this research has resulted in developing highly accurate classifiers, two key practical issues related to identifying cyberbullying have largely been ignored, namely scalability of cyberbullying detection services and timeliness of raising alerts whenever a cyberbullying incident is suspected. These two issues are the subject of this paper. We propose a multi-stage cyberbullying detection solution that drastically reduces the classification time and the time to raise cyberbullying alerts. The proposed solution is highly scalable, does not sacrifice accuracy for scalability, and is highly responsive in raising alerts. The solution is comprised of three novel components, an initial predictor, a multilevel priority scheduler, and an incremental classification mechanism. We have implemented this solution and utilized data obtained from the Vine online social network to demonstrate the utility of each of these components via a detailed performance evaluation. We show that our complete solution is significantly more scalable and responsive than the current state-of-the-art.

研究の動機と目的

  • オンラインソーシャルネットワークにおけるスケーラブルで応答性の高いサイバーいじめ検出システムの不足に対処すること。
  • 検出精度を損なわず、疑わしいサイバーいじめ事案のアラートまでの時間を短縮すること。
  • 高ボリュームでリアルタイムのソーシャルメディアデータストリームを効率的に処理できるソリューションを設計すること。
  • 動的信頼度スコアに基づき、高リスクのメディアセッションを優先することで早期対応を可能にすること。
  • 段階的特徴再利用と知的なスケジューリングにより、計算効率を確保すること。

提案手法

  • 初期予測子は最小限のセッションデータを用いて、高い再現率で新規メディアセッションに高/低優先度を割り当てる。
  • 動的でマルチレベルの優先スケジューラは、過去の予測の信頼度に基づき分類頻度を調整し、高リスクセッションを優先する。
  • 段階的分類メカニズムは、以降の評価における時間オーバーヘッドを低減するため、過去の特徴計算を再利用する。
  • システムは 1 回のイテレーションあたり 10 コメントのチャンクでメディアセッションを処理し、応答性と計算コストのバランスを取る。
  • 実際の Vine データセット(1 日あたり 15 億のループを含む)を用いてプロトタイプを実装・評価した。
  • メモリおよび CPU の両面でのスケーラビリティを評価するため、さまざまな負荷下でのリソース使用量を測定した。

実験結果

リサーチクエスチョン

  • RQ1リアルタイムのソーシャルメディア環境において、サイバーいじめ検出システムの応答性をどのように向上させ、アラートレイテンシを短縮できるか?
  • RQ2高速なデータストリームにおいて、検出精度を保持しつつスケーラビリティを最大化するための設計選択は何か?
  • RQ3段階的分類は、パフォーマンスの劣化を招かずに計算オーバーヘッドをどの程度低減できるか?
  • RQ4単純なラウンドロビンスケジューリングと比較して、動的優先順位付けはシステムの応答性をどの程度向上させるか?
  • RQ5負荷が増加する条件下で、提案されたシステムのリソース効率はいかほどか?

主な発見

  • 動的優先スケジューラは、単純なラウンドロビンスケジューラと比較して平均アラート時間をほぼ 6 倍短縮した。
  • 1 イテレーションあたり 10 コメントのチャンクを使用することで、全コメント処理と比較して応答時間が約 7 倍改善された。
  • 100,000 件のアクティブなメディアセッションを処理しながらも、500 MB の RAM と 15.5% の CPU 使用率で高い精度を維持した。
  • 512 GB の RAM を搭載した単一のサーバーインスタンスは最大 1.1×10⁸ 件のアクティブなメディアセッションをサポートでき、水平スケーリングの強さが示された。
  • 高信頼度・高リスクセッションに計算リソースを集中させることで、早期検出が可能になり、対応のタイムリネスが向上した。
  • 段階的分類法により、過去の特徴計算の再利用によって時間オーバーヘッドが顕著に低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。