Skip to main content
QUICK REVIEW

[論文レビュー] Vietnamese Hate and Offensive Detection using PhoBERT-CNN and Social Media Streaming Data

Khanh Tran, An Nguyen|arXiv (Cornell University)|Jun 1, 2022
Hate Speech and Cyberbullying Detection被引用数 4
ひとこと要約

本稿では、強化されたデータ前処理およびEDA技術を組み合わせたPhoBERT-CNNモデルを提案し、ベトナム語の嫌がらせおよび攻撃的コメント検出に応用した。ViHSDではF1スコア67.46%、HSD-VLSPでは98.45%の性能を達成した。また、Apache Spark Structured Streamingを用いたリアルタイムストリーミング処理を実現し、ソーシャルメディアプラットフォームへの実用的導入を可能にした。

ABSTRACT

Society needs to develop a system to detect hate and offense to build a healthy and safe environment. However, current research in this field still faces four major shortcomings, including deficient pre-processing techniques, indifference to data imbalance issues, modest performance models, and lacking practical applications. This paper focused on developing an intelligent system capable of addressing these shortcomings. Firstly, we proposed an efficient pre-processing technique to clean comments collected from Vietnamese social media. Secondly, a novel hate speech detection (HSD) model, which is the combination of a pre-trained PhoBERT model and a Text-CNN model, was proposed for solving tasks in Vietnamese. Thirdly, EDA techniques are applied to deal with imbalanced data to improve the performance of classification models. Besides, various experiments were conducted as baselines to compare and investigate the proposed model's performance against state-of-the-art methods. The experiment results show that the proposed PhoBERT-CNN model outperforms SOTA methods and achieves an F1-score of 67,46% and 98,45% on two benchmark datasets, ViHSD and HSD-VLSP, respectively. Finally, we also built a streaming HSD application to demonstrate the practicality of our proposed system.

研究の動機と目的

  • 嫌がらせコメント検出におけるベトナム語ソーシャルメディアテキストに対する有効な前処理手法の不足に対処すること。
  • EDAを用いた効果的なデータ拡張により、ベトナム語の嫌がらせコメントデータセットにおけるデータの不均衡問題を克服すること。
  • 既存のベースラインを上回る高性能でエンドツーエンドのHSDモデルを、ベトナム語向けに特化して開発すること。
  • Apache Sparkを用いたリアルタイムストリーミング処理により、ソーシャルメディアプラットフォームへの実用的デプロイメントを実現する嫌がらせコメント検出システムを構築すること。
  • ベトナム語デジタル空間におけるより安全なオンライン環境を構築するための堅牢でスケーラブルなソリューションを貢献すること。

提案手法

  • ベトナム語ソーシャルメディアコメントの品質を向上させ、モデルの入力品質を向上させるための二段階の前処理パイプラインを提案した。
  • ベトナム語向けの事前学習マルチリンガルトランスフォーマーであるPhoBERTと、階層的特徴抽出および分類に適したText-CNNを組み合わせた。
  • 不均衡なデータセットにおける少数クラスの拡張にEDA(データ拡張)技術を適用し、モデルの汎化性能を向上させた。
  • F1スコアと正答率を指標として用い、2つのベンチマークデータセット(ViHSDおよびHSD-VLSP)上でPhoBERT-CNNモデルを訓練・評価した。
  • Apache Spark Structured Streaming 3.1.1を用いてリアルタイム嫌がらせコメント検出システムを構築し、1件あたり平均1.56秒の応答時間で低遅延処理を実現した。
  • YouTube Data APIを用いてリアルタイムコメントをストリーミングし、3名の経験豊富なベトナム語NLPアナノテーターがラベル付けした。CohenのKappa係数は0.64であった。

実験結果

リサーチクエスチョン

  • RQ1微調整されたPhoBERT-CNNモデルは、既存のSOTA手法と比較して、ベトナム語の嫌がらせコメント検出において優れた性能を達成できるか?
  • RQ2強化された前処理およびEDA技術は、不均衡なベトナム語の嫌がらせコメントデータセットにおけるモデル性能をどの程度向上させるか?
  • RQ3Apache Sparkを基盤とするリアルタイムストリーミングシステムは、ライブのソーシャルメディアデータにおける嫌がらせおよび攻撃的コメントの分類を効果的に実行できるか?
  • RQ4本稿で提案するシステムは、YouTubeのリアルタイムストリーミングコメントデータに対してどのように性能を発揮するか。応答遅延および正答率はどの程度か?
  • RQ5文脈に配慮した前処理は、リソースが限られたベトナム語NLP環境における嫌がらせコメント検出モデルの頑健性および汎化性能にどのような影響を与えるか?

主な発見

  • 提案されたPhoBERT-CNNモデルは、ViHSDデータセットでF1スコア67.46%を達成し、ベースラインモデルおよび先行SOTA手法を上回った。
  • HSD-VLSPデータセットでは、F1スコアが98.45%に達し、よりバランスの取れており高品質なベンチマークデータセットにおいて優れた性能を示した。
  • 前処理パイプラインにより、PhoBERT-CNNモデルのViHSDにおけるマクロF1スコアが4.80%向上し、HSD-VLSPでは9.70%向上した。これにより、前処理の有効性が裏付けられた。
  • ベースラインモデルに対しても前処理が効果を示し、ViHSDでは平均で3.58%、HSD-VLSPでは10.16%のF1スコア向上が確認された。
  • リアルタイムストリーミングシステムは、500件のリアルタイムYouTubeコメントに対して、マクロF1スコア58.19%、正答率82.02%を達成。平均応答時間は1.56秒であった。
  • Apache Spark Structured Streamingを用いたシステムは、低遅延処理を実現し、1ms継続処理でサブ秒レベルの応答時間を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。