[論文レビュー] Countering hate on social media: Large scale classification of hate and counter speech
本研究では、数百万件のドイツ語ツイートを対象に、パラグラフ埋め込みと正則化ロジスティック回帰を用いたアンサンブル学習を用いた大規模かつ自動分類システムを提案する。F1スコアは0.76~0.97の高水準を達成し、組織的なカウンタースピーチが嫌がらせ発言の極端さを著しく低減させ、オンライン会話におけるバランスの取れた、極端でない議論を促進することを示している。
Hateful rhetoric is plaguing online discourse, fostering extreme societal movements and possibly giving rise to real-world violence. A potential solution to this growing global problem is citizen-generated counter speech where citizens actively engage in hate-filled conversations to attempt to restore civil non-polarized discourse. However, its actual effectiveness in curbing the spread of hatred is unknown and hard to quantify. One major obstacle to researching this question is a lack of large labeled data sets for training automated classifiers to identify counter speech. Here we made use of a unique situation in Germany where self-labeling groups engaged in organized online hate and counter speech. We used an ensemble learning algorithm which pairs a variety of paragraph embeddings with regularized logistic regression functions to classify both hate and counter speech in a corpus of millions of relevant tweets from these two groups. Our pipeline achieved macro F1 scores on out of sample balanced test sets ranging from 0.76 to 0.97---accuracy in line and even exceeding the state of the art. On thousands of tweets, we used crowdsourcing to verify that the judgments made by the classifier are in close alignment with human judgment. We then used the classifier to discover hate and counter speech in more than 135,000 fully-resolved Twitter conversations occurring from 2013 to 2018 and study their frequency and interaction. Altogether, our results highlight the potential of automated methods to evaluate the impact of coordinated counter speech in stabilizing conversations on social media.
研究の動機と目的
- オンラインディスコースにおけるカウンタースピーチおよび嫌がらせ発言を分類するための大規模かつラベル付きデータセットの不足に対処すること。
- ソーシャルメディアの会話において嫌がらせ発言およびカウンタースピーチを自動的かつスケーラブルに特定する手法を開発すること。
- 市民主導の組織的カウンタースピーチが、分極化および嫌がらせ発言の低減に与える実世界の影響を評価すること。
- 大規模なTwitter会話ツリーにおける嫌がらせ発言とカウンタースピーチの相互作用のダイナミクスを調査すること。
提案手法
- ドイツの自己ラベル付き嫌がらせ発言グループ(Reconquista Germanica)およびカウンタースピーチグループ(Reconquista Internet)から、数百万件のツイートを対象に、人間による検証済みの大規模なトレーニングデータセットを構築した。
- 複数のパラグラフ埋め込みモデルと正則化ロジスティック回帰を組み合わせたアンサンブル学習パイプラインを分類に用いた。
- 専門家がラベル付けしたラベルに基づき、70%の信頼度しきい値を設定して、返信ツリーにおける予測のフィルタリングと検証を実施した。
- クラウドソーシングを活用し、数千件のツイートについて、分類器の予測が人間の判断と一致するかを検証した。
- 一般化および信頼性を確保するため、アウトオブサンプルでバランスの取れたテストセットを用いてモデルを訓練および評価した。
- 嫌がらせ発言およびカウンタースピーチの時間的ダイナミクスを調査するため、135,000件以上の完全に解決されたTwitter会話ツリーを分析した。
実験結果
リサーチクエスチョン
- RQ1限られたラベル付きデータを用いて、自動分類がスケール的に嫌がらせ発言およびカウンタースピーチを信頼性高く同定できるか?
- RQ2組織的なカウンタースピーチの存在が、オンライン会話における嫌がらせ発言の頻度および極端さにどのように影響するか?
- RQ3時間の経過とともに、返信スレッド内での嫌がらせ発言とカウンタースピーチの動的相互作用はいかなるものか?
- RQ4カウンタースピーチは、特に組織的介入後、より多くのカウンタースピーチを引き寄せ、嫌がらせ発言を抑制するか?
- RQ5組織的なカウンタースピーチは、オンラインディスコースの分極化をどの程度軽減に寄与するか?
主な発見
- 分類器は、アウトオブサンプルでバランスの取れたテストセットにおいて、マクロF1スコア0.76~0.97を達成し、高い正確性と信頼性を示した。
- クラウドソーシングの結果、分類器の判断が数千件のラベル付きツイートについて人間の判断とよく一致することが確認された。
- 2018年4月に組織的なカウンタースピーチグループ(RI)が結成されて以降、会話における嫌がらせ発言の割合は低下し、カウンタースピーチの割合は増加した。
- RI設立後、カウンタースピーチは、さらに多くのカウンターやニュートラルな発言を引き寄せるとともに、嫌がらせ発言の増加を抑制する効果を示した。
- 返信スレッドにおいて、組織的なカウンタースピーチのツイートは、非組織的反応よりも、より多くのカウンターやニュートラルな発言を引き寄せ、嫌がらせ発言は少なくなる傾向があった。
- 本研究では、カウンタースピーチが個々の会話の分極化を軽減する寄与をしたことが判明し、中立的またはラベルなしの反応が生じやすくなる傾向があった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。