[論文レビュー] HS-BAN: A Benchmark Dataset of Social Media Comments for Hate Speech Detection in Bangla
本稿では、50,000件を超える多様な分野からのソーシャルメディアコメントを含む、バングラ語の嫌がらせ検出のための、公開利用可能な最大規模のベンチマークデータセットHS-BANを紹介する。厳密なアノテーションプロトコルと非形式的テキストで学習されたFastText埋め込みを用いて、Bi-LSTMモデルは86.78%のF1スコアを達成し、非形式的単語埋め込みが形式的単語埋め込みを上回ること、および伝統的スラングが非伝統的スラングよりも検出精度を向上させることを示している。
In this paper, we present HS-BAN, a binary class hate speech (HS) dataset in Bangla language consisting of more than 50,000 labeled comments, including 40.17% hate and rest are non hate speech. While preparing the dataset a strict and detailed annotation guideline was followed to reduce human annotation bias. The HS dataset was also preprocessed linguistically to extract different types of slang currently people write using symbols, acronyms, or alternative spellings. These slang words were further categorized into traditional and non-traditional slang lists and included in the results of this paper. We explored traditional linguistic features and neural network-based methods to develop a benchmark system for hate speech detection for the Bangla language. Our experimental results show that existing word embedding models trained with informal texts perform better than those trained with formal text. Our benchmark shows that a Bi-LSTM model on top of the FastText informal word embedding achieved 86.78% F1-score. We will make the dataset available for public use.
研究の動機と目的
- 自然言語処理研究のための、大規模で多様性に富み、言語的代表性を持つバングラ語嫌がらせデータセットが不足している問題に対処すること。
- 多数決とアノテーター間一致スコアを用いた詳細な複数アノテーター指針により、アノテーションバイアスを低減すること。
- ノイズが多くスラングが豊富なソーシャルメディアテキストで学習された単語埋め込みを活用することで、非形式的バングラ語における嫌がらせ検出を向上させること。
- 伝統的スラングと非伝統的スラングの違いが、嫌がらせ分類モデルの性能に与える影響を評価すること。
- 公開データセットとコードを用いて、低リソース言語における嫌がらせ検出の今後の研究のためのベンチマークを確立すること。
提案手法
- データセットは、2017年から2020年までの間、フェイスブックとユーチューブの7つの分野(スポーツ、エンターテインメント、犯罪、政治、宗教、有名人、その他)から、Facepagerを用いて、対立的トピックに関するコメントを抽出して収集した。
- フェイスブックとユーチューブのコミュニティ基準に基づいた詳細なアノテーションガイドラインを用い、各コメントを50名のアノテーターがラベル付けした。最終的なラベルは多数決により割り当てられ、バイアス低減を図った。
- アノテーター間一致は0.658(カッパ)で測定され、中程度の一致を示した。データは重複(ジャカード係数>0.8)とバングラ語以外のコンテンツを除去することで前処理された。
- スラング語は言語学者が手作業で伝統的(TS)と非伝統的(NTS)に分類し、モデル性能に与える影響を分析した。
- 複数のモデルを訓練した。Bi-LSTM、CNN、SVM、およびBERT変種を用い、形式的および非形式的単語埋め込み(FastText、Word2Vec)を用いて性能を比較した。
- 最も優れた性能を示したモデルは、非形式的テキストで学習されたFastText skip-gram(SG)埋め込みを用いたBi-LSTMで、F1スコア86.85%を達成し、形式的埋め込みやBERTモデルを上回った。
実験結果
リサーチクエスチョン
- RQ1バングラ語の非形式的テキスト埋め込みと形式的テキスト埋め込みで学習した嫌がらせ検出モデルの性能は、どのように異なるか?
- RQ2伝統的スラング語と非伝統的スラング語は、嫌がらせ分類モデルの精度にどの程度影響を与えるか?
- RQ3分野にまたがるデータセットの多様性は、モデルの汎化性能と性能にどのように影響するか?
- RQ4なぜ、BERTベースのモデルは、非形式的バングラ語ソーシャルメディアテキストでは、非形式的埋め込みを用いたシーケンスモデルよりも性能が低いのか?
- RQ5データサンプリングによるクラス不均衡の低減は、低リソース嫌がらせカテゴリにおける検出性能を向上させることができるか?
主な発見
- HS-BANデータセットには50,314件のバングラ語コメントが含まれており、そのうち40.17%が嫌がらせ、59.83%が嫌がらせでないものであり、これは公開利用可能な最大規模のバングラ語嫌がらせベンチマークである。
- 非形式的テキストで学習されたFastText単語埋め込みを微調整したBi-LSTMモデルが、86.85%のF1スコアを達成し、形式的埋め込みやBERT変種を上回った。
- 非形式的テキストで学習された単語埋め込み(FastText SG)は、形式的テキスト(例:ウィキペディア)で学習されたものよりも顕著に優れており、低リソースNLPタスクにおける非形式的事前学習の必要性を裏付けている。
- 伝統的スラング(TS)を含むコメントでは、非伝統的スラング(NTS)を含むものよりも性能が高く、NTS語はより高い曖昧さを引き起こし、検出精度を低下させた。
- 最良のモデル(Bi-LSTM+FT(SG))のF1スコアは、全データセットで86.78%であった。分野別性能は、有名人分野で78.84%(最低)から犯罪分野で92.27%(最高)の範囲にわたった。
- 嫌がらせと非嫌がらせのサンプル数を均等にしたことでトレーニングデータをバランス化したところ、政治および有名人分野のF1スコアが最も向上し、データ不足とクラス不均衡が性能の主な障壁であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。