[論文レビュー] Modeling Islamist Extremist Communications on Social Media using Contextual Dimensions: Religion, Ideology, and Hate
本稿では、ドメイン固有の知識ベースを活用して、宗教、イデオロギー、憎悪の3つの異なる次元—宗教、イデオロギー、憎悪—を用いて、Twitter上のイスラム主義過激主義的コンテンツを分析する文脈に配慮した多次元計算モデルを提案する。これらの次元をランダムフォレストおよびナイーブベイズ分類器に統合することで、ベースライン比で10.2%の精度向上を達成し、誤分類を顕著に低減し、脱-radicalization(脱過激化)活動における実用的展開の信頼性を向上させる。
Terror attacks have been linked in part to online extremist content. Although tens of thousands of Islamist extremism supporters consume such content, they are a small fraction relative to peaceful Muslims. The efforts to contain the ever-evolving extremism on social media platforms have remained inadequate and mostly ineffective. Divergent extremist and mainstream contexts challenge machine interpretation, with a particular threat to the precision of classification algorithms. Our context-aware computational approach to the analysis of extremist content on Twitter breaks down this persuasion process into building blocks that acknowledge inherent ambiguity and sparsity that likely challenge both manual and automated classification. We model this process using a combination of three contextual dimensions -- religion, ideology, and hate -- each elucidating a degree of radicalization and highlighting independent features to render them computationally accessible. We utilize domain-specific knowledge resources for each of these contextual dimensions such as Qur'an for religion, the books of extremist ideologues and preachers for political ideology and a social media hate speech corpus for hate. Our study makes three contributions to reliable analysis: (i) Development of a computational approach rooted in the contextual dimensions of religion, ideology, and hate that reflects strategies employed by online Islamist extremist groups, (ii) An in-depth analysis of relevant tweet datasets with respect to these dimensions to exclude likely mislabeled users, and (iii) A framework for understanding online radicalization as a process to assist counter-programming. Given the potentially significant social impact, we evaluate the performance of our algorithms to minimize mislabeling, where our approach outperforms a competitive baseline by 10.2% in precision.
研究の動機と目的
- ソーシャルメディア上での過激主義的ユーザーの正確な同定という課題に取り組む。ここでは、宗教的言語がしばしば過激主義的イデオロギーの目的に歪められるためである。
- 過激主義的コミュニケーションにおける文脈的曖昧さや意味的スパarsity(疎らかさ)を十分に考慮できない既存の分類手法の限界を克服する。
- 宗教、イデオロギー、憎悪を通じて、オンラインでの過激化の段階的で説得的なプロセスをモデル化する、耐障害性の高い多次元フレームワークを構築する。
- ドメイン固有の知識リソースと文脈的手がかりを統合することで、過激主義的でないユーザーが宗教的言語を使用する場合の誤分類を低減する。
- 過激主義的ナラティブが異なる過激化段階でどのように進化するかを詳細に理解することで、効果的な対抗プログラムを支援する。
提案手法
- 研究では、宗教用に『コーラン』、過激主義的イデオローグの文章を用いてイデオロギー用、ソーシャルメディア上の憎悪スピーチコーパスを用いて憎悪用の3つのドメイン固有の知識リソースを構築する。
- ユーザーのコンテンツを、宗教、イデオロギー、憎悪の3つの文脈的次元としてモデル化し、それぞれを分類のための独立した特徴空間として扱う。
- ラベル付きツイートデータセット(これらの次元について注釈済み)を用いて、ランダムフォレスト(RF)およびナイーブベイズ(NB)分類器を用いた教師あり機械学習を採用する。
- 特徴工学には、宗教的・イデオロギー的・憎悪的表現の意味的ニュアンスを捉えるために、ドメイン固有のコーパスから得た文脈的埋め込みを用いる。
- 性能評価には、精度、再現率、F1スコア、AUCを用い、多次元モデルと単一次元ベースラインを比較する。
- 除外戦略として、3つの文脈的次元における一貫性の欠如に基づき、おそらく誤ってラベル付けされたユーザーを削除する。
実験結果
リサーチクエスチョン
- RQ1宗教、イデオロギー、憎悪は、ソーシャルメディア上でのイスラム主義過激主義的コミュニケーションにおいて、どのように独立的ではあるが相互に関連する次元として機能するか?
- RQ2複数の文脈的次元を統合することで、単一次元アプローチと比較して、過激主義的ユーザーの分類精度と信頼性はどの程度向上するか?
- RQ3宗教、イデオロギー、憎悪の相対的貢献度は、オンライン過激化の異なる段階でどのように変化するか?
- RQ4文脈に配慮したモデルは、過激主義的意図なしに宗教的言語を使用する非過激主義的ユーザーの誤分類を低減できるか?
- RQ5伝統的なベースライン手法と比較して、多次元モデリングはTwitter上での過激主義的コンテンツ検出においてどの程度のパフォーマンス向上を達成するか?
主な発見
- 3次元モデルは、ベースライン比で10.2%の精度向上を達成し、非過激主義的ユーザーの誤ラベル付けリスクを顕著に低減した。
- 宗教と憎悪を組み合わせた2次元モデル(RH)は、AUCが0.90を記録し、3次元モデルおよび他の2次元モデルを上回る性能を示した。
- 3次元ランダムフォレストモデルは、偽陽性率0.65で真正陽性率0.93に達し、高い精度制約下でも優れた性能を示した。
- 3つの次元をすべて組み合わせた場合が、全体として最高のパフォーマンスを発揮し、再現率でベースライン比8.5%、F1スコアで10.7%の向上を達成した。
- 3次元NBモデルのROC曲線は、FPR 0.83でTPRが1.0に収束した。一方、2次元モデルはFPR 0.97でTPR 1.0に達し、精度で9.8%の向上を示した。
- 宗教的言語と憎悪的言語が、イデオロギー単体よりも強力な識別子であることが判明し、過激主義的正当化ナラティブにおいて頻繁に共起していることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。