[論文レビュー] TweetBLM: A Hate Speech Dataset and Analysis of Black Lives Matter-related Microblogs on Twitter
本稿では、9,165件のBlack Lives Matter関連ツイートを手動でアノテートした嫌がらせ発言データセットTweetBLMを紹介している。このデータセットは「嫌がらせ」と「非嫌がらせ」に分類されている。複数のモデル、特にBERT-baseおよびBERT-largeを評価した結果、BERT-largeが89.13%の最高精度を記録し、Blackコミュニティを標的にしたオンライン嫌がらせを軽減するための貴重なリソースを提供している。
In the past few years, there has been a significant rise in toxic and hateful content on various social media platforms. Recently Black Lives Matter movement came into the picture, causing an avalanche of user generated responses on the internet. In this paper, we have proposed a Black Lives Matter related tweet hate speech dataset TweetBLM. Our dataset comprises 9165 manually annotated tweets that target the Black Lives Matter movement. We annotated the tweets into two classes, i.e., HATE and NONHATE based on their content related to racism erupted from the movement for the black community. In this work, we also generated useful statistical insights on our dataset and performed a systematic analysis of various machine learning models such as Random Forest, CNN, LSTM, BiLSTM, Fasttext, BERTbase, and BERTlarge for the classification task on our dataset. Through our work, we aim at contributing to the substantial efforts of the research community for the identification and mitigation of hate speech on the internet. The dataset is publicly available.
研究の動機と目的
- Black Lives Matter運動の文脈における反ブラック・レーダリズムを標的にした専門的な嫌がらせ発言データセットの不足に対処すること。
- Black Lives Matter関連ツイートの高品質で手動アノテーション済みのデータセットを構築すること。
- 本データセット上で多様な機械学習モデル(BERTおよびFastTextを含む)の性能を評価すること。
- 嫌がらせ発言に関連する言語的パターン(頻出n-gramやハッシュタグなど)に関する統計的洞察を提供すること。
- 研究コミュニティがソーシャルメディア上の嫌がらせ発言を同定・軽減するためのより良いツールを開発できるように支援すること。
提案手法
- TweepyおよびTwitter APIを用いて2020年5月27日から7月26日までに730万件のツイートを収集し、英語のツイートおよび150件以上のフォロワーを持つユーザーに絞ってスパムを低減した。
- 運動関連のツイートを抽出するために、#BLM、#BlackLivesMatterおよび意味的変種を含むキーワードベースのクエリセットを構築した。
- 9,165件のツイートを手動で2つのクラスにアノテートした:'Hate'(Blackコミュニティを標的にした差別的コンテンツ)および'Non-Hate'(嫌がらせでないコンテンツ)。
- n-gram(ユニグラムおよびビグラム)およびハッシュタグの統計的分析を実施し、データセット内の言語的パターンを抽出した。
- 80/20のトレーニング・テスト分割を用いて、ランダムフォレスト、CNN、LSTM、BiLSTM、FastText、BERT-baseおよびBERT-largeの複数のモデルを訓練および比較した。
- バリデーションデータ上でハイパーパramータを微調整し、すべてのモデルでカテゴリカル・クロスエントロピー損失およびAdam最適化手法を用いた。
実験結果
リサーチクエスチョン
- RQ1最先端のディープラーニングモデルは、Black Lives Matter運動を標的にした嫌がらせ発言をどの程度効果的に検出できるか?
- RQ2BLM関連の嫌がらせ発言に顕著な言語的パターン(頻出ユニグラム、ビグラム、ハッシュタグなど)は何か?
- RQ3この専門的なデータセットにおいて、BERTベースのモデルはランダムフォレストやCNNといった従来のモデルと比べてどの程度優れているか?
- RQ4このデータセットの質と特化度は、嫌がらせ発言検出モデルの一般化性能をどの程度向上させるか?
- RQ5BLM運動のピーク期におけるユーザ生成コンテンツにおける嫌がらせ発言の統計的特性は何か?
主な発見
- BERT-largeは、89.13%の最高精度を記録し、他のモデルを著しく上回った。
- BERT-baseは87.45%の精度を達成し、文脈的表現の有効性が、微妙な嫌がらせ発言を理解する上で顕著に効果的であることを示した。
- FastTextは82.77%の精度を達成し、RNNベースのモデルを上回り、サブワード埋め込みの強力な性能を示した。
- BiLSTMは77.58%の精度を記録し、LSTMより1.37%高い結果となり、シーケンスモデリングにおける双方向的文脈の利点が裏付けられた。
- CNNは79.46%の精度を達成し、LSTMおよびランダムフォレストを上回り、局所的なテキストパターンを効果的に捉える能力が顕著に現れた。
- ランダムフォレストは77.35%の精度を記録し、LSTMをわずかに上回り、従来の木ベースのモデルのベースライン性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。