Skip to main content
QUICK REVIEW

[論文レビュー] Bangla Text Dataset and Exploratory Analysis for Online Harassment Detection

Md. Faisal Ahmed, Zalish Mahmud|arXiv (Cornell University)|Feb 4, 2021
Hate Speech and Cyberbullying Detection被引用数 11
ひとこと要約

この論文は、有名人、政府関係者、スポーツ選手の公開投稿から収集した44,001件のFacebookコメントから成る、公開可能なベンガル語テキストデータセットを紹介している。これらのコメントはオンラインいじめのラベル付きでアノテーションされている。本研究では、複数のいじめのカテゴリにわたる探索的分析を実施し、マルチラベルのベンガル語NLPリソースの不足を補い、ベンガル語のような低リソース言語におけるサイバーいじめや不適切なコンテンツの検出に関する研究を可能にする。

ABSTRACT

Being the seventh most spoken language in the world, the use of the Bangla language online has increased in recent times. Hence, it has become very important to analyze Bangla text data to maintain a safe and harassment-free online place. The data that has been made accessible in this article has been gathered and marked from the comments of people in public posts by celebrities, government officials, athletes on Facebook. The total amount of collected comments is 44001. The dataset is compiled with the aim of developing the ability of machines to differentiate whether a comment is a bully expression or not with the help of Natural Language Processing and to what extent it is improper if it is an inappropriate comment. The comments are labeled with different categories of harassment. Exploratory analysis from different perspectives is also included in this paper to have a detailed overview. Due to the scarcity of data collection of categorized Bengali language comments, this dataset can have a significant role for research in detecting bully words, identifying inappropriate comments, detecting different categories of Bengali bullies, etc. The dataset is publicly available at https://data.mendeley.com/datasets/9xjx8twk8p.

研究の動機と目的

  • オンラインいじめ検出のためのアノテーション付きベンガル語テキストデータセットの不足を是正すること。
  • ベンガル語のサイバーいじめや不適切なコンテンツに関する研究を目的に、現実世界のFacebookコメントを収集・ラベリングすること。
  • ベンガル語のような低リソース言語におけるNLP研究を支援するため、公開可能なデータセットを提供すること。
  • ベンガル語のオンラインディス course におけるいじめのパターンと言語的特徴に関する探索的分析を実施すること。
  • ベンガル語におけるさまざまなタイプのオンラインいじめを検出・分類できる機械学習モデルの開発を可能にすること。

提案手法

  • 有名人、政府関係者、バングラデシュのスポーツ選手の公開Facebook投稿からコメントをスクレイピングした。
  • データセットは、44,001件のベンガル語コメントから成り、複数のいじめカテゴリに手作業でラベリングされたものである。
  • ラベリングは、ヘイトスピーチ、脅し、個人攻撃などのオンラインいじめの種別を可能にするマルチクラス方式に従った。
  • 統計的要約、頻度分布、可視化(表および図)を用いた探索的データ分析を実施した。
  • 低リソース言語におけるNLP研究の再現可能性を支援するため、データセットを公開した。
  • 攻撃的言語使用のパターンを理解するために、言語的および社会言語学的視点を分析に組み込んだ。

実験結果

リサーチクエスチョン

  • RQ1ベンガル語のソーシャルメディアコメントにおける、オンラインいじめの一般的な形態とカテゴリは何か?
  • RQ2ベンガル語における言語的特徴やコメントの特徴は、異なるタイプのいじめとどのように相関しているか?
  • RQ3公開済みのマルチラベル付きベンガル語データセットは、自動化されたいじめ検出システムの開発をどの程度支援できるか?
  • RQ4ベンガル語のオンラインディスコースにおいて、攻撃的言語の分布的パターンは、異なるデモグラフィック要因やコンテンツベースの文脈でどのように異なるか?
  • RQ5低リソース言語のデータセットに対する探索的分析は、将来のベンガル語NLPモデル設計にどのように寄与できるか?

主な発見

  • データセットには44,001件のベンガル語コメントが含まれており、複数のいじめカテゴリにラベル付けされており、NLP研究に貴重なリソースを提供している。
  • 探索的分析により、異なるいじめタイプごとに明確な言語的パターンと攻撃的表現の頻度分布が明らかになった。
  • データセットは、ヘイトスピーチ、個人攻撃、脅しを含む、いじめの深刻さや性質に顕著な差異を示している。
  • このデータセットの提供により、特にオンラインセーフティおよびコンテンツモデレーション分野におけるベンガル語NLPの重要な空白が埋められた。
  • 本研究は、ベンガル語テキストのスケーラブルで現実世界のアノテーションが、将来的なモデルのトレーニングと評価を可能にする可能性を示した。
  • このデータセットは、提供されたURLから公開アクセス可能であり、再現可能性とコミュニティ主導の研究を支援している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。