[論文レビュー] Detecting the Hate Code on Social Media
本稿では、極端派が人種的・民族的嫌悪語を無害な語に置き換えることで検出を回避する、Twitter上のコード化された憎悪スピーチを検出する機械学習システムを提案する。形態素解析済みで事前処理されたツイートを用いてサポートベクターマシン(SVM)分類器を適用した結果、コード化された憎悪スピーチと非憎悪的使用を区別する精度が79.4%に達した。また、このようなコンテンツを広める頻度の高いユーザーの特定にも成功し、憎悪を扇動する行動パターンの分析が可能になった。
Social media has become an indispensable part of the everyday lives of millions of people around the world. It provides a platform for expressing opinions and beliefs, communicated to a massive audience. However, this ease with which people can express themselves has also allowed for the large scale spread of propaganda and hate speech. To prevent violating the abuse policies of social media platforms and also to avoid detection by automatic systems like Google's Conversation AI, racists have begun to use a code (a movement termed Operation Google). This involves substituting references to communities by benign words that seem out of context, in hate filled posts or Tweets. For example, users have used the words Googles and Bings to represent the African-American and Asian communities, respectively. By generating the list of users who post such content, we move a step forward from classifying tweets by allowing us to study the usage pattern of these concentrated set of users.
研究の動機と目的
- 攻撃的語を無害な同義語に置き換えることで検出を回避する手法を用いるソーシャルメディアにおけるコード化された憎悪スピーチを検出すること。
- 繰り返しコード化された憎悪スピーチを投稿するユーザーを特定し、その行動パターンの分析を可能にすること。
- ツイートにおけるコード語の正当な使用と憎悪動機による使用を区別するシステムの開発。
- 出現したてのコード語を自動で検出する可能性を検討すること。
- 政治的・社会的混乱の時期にコード化された憎悪スピーチの使用が増加するかどうかを評価すること。
提案手法
- 2016年9月23日から10月18日までの間、ウェブスクリーパー(Jefferson-Henriqueスクリプト)を用いて100万件を超えるツイートを収集し、既知のコード語に焦点を当てた。
- トークンの語形還元、標 punctuatio ン、ストップワード、および頻度が低い語の除去により、ツイートを事前処理した。
- トレーニングデータ内で最も頻出する語を用いて、各ツイートに対してバッグオブワーズ特徴ベクトル表現を構築した。
- 1,999件のアノテート済みツイート(951件が非憎悪的、1,048件が憎悪的)を用い、10分割交差検証を実施して線形カーネルSVM分類器をトレーニングした。
- テストセット(英語ツイート23,401件、全件の10%)を用いて分類器を評価し、予測を生成し、憎悪的コンテンツを同定した。
- 予測された憎悪的ツイートからユーザーIDを抽出し、ヒューリスティックな閾値(頻度≥4)を適用して、高頻度の発信者を特定した。
実験結果
リサーチクエスチョン
- RQ1機械学習モデルは、ソーシャルメディア投稿におけるコード語の憎悪的使用と非憎悪的使用を効果的に区別できるか?
- RQ2どのユーザーがコード化された憎悪スピーチを繰り返し投稿しているのか?その行動パターンはどのような特徴を示すか?
- RQ3政治的・社会的緊張の時期に、コード化された憎悪スピーチの使用が顕著に増加するか?
- RQ4本システムは、オンラインディスコース内で出現する新しいコード語を自動で検出できるか?
- RQ5コード化された憎悪スピーチを投稿するユーザーは、つながったネットワークや共通のコミュニティ構造を形成しているか?
主な発見
- SVM分類器はテストセットで79.4397%の精度を達成し、精度(precision)は0.795、再現率(recall)は0.794であった。
- 分類器は憎悪的ツイートの83.3%(再現率)を正しく分類し、非憎悪的ツイートの75.2%(非憎悪的クラスの真正陽性率)も正しく識別した。
- 4回以上の投稿頻度という閾値が、偽陽性を最小限に抑えて高頻度のユーザーを最適に特定できることが判明した。
- 憎悪的ツイートで上位に相関する語には「#MAGA」、「#MAWA」、「#ALTRIGHT」、および「white」があり、極右思想との関連性を示している。
- 語「gas」は憎悪スピーチと強く相関しており、特に「gas the skypes」といった表現では暴力を扇動する兆候を示している。
- フォローアップ研究では新たなコード語は観察されず、観察期間中に安定的ではあるが進化を続ける語彙が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。