[論文レビュー] Detecting Radical Text over Online Media using Deep Learning
本稿では、61,601件のラベル付きテキスト(過激的、非過激的、関連なし)からなるデータセットを用いて、オンラインメディアにおける過激的コンテンツを検出するLSTMベースのディープラーニングモデルを提案する。この手法は、SVM やランダムフォレストといった従来の機械学習手法を上回り、過激的コンテンツの分類において85.9%の精度を達成した。これは、スケールに応じた極端主義的テキストの同定においてディープラーニングの有効性を示している。
Social Media has influenced the way people socially connect, interact and opinionize. The growth in technology has enhanced communication and dissemination of information. Unfortunately,many terror groups like jihadist communities have started consolidating a virtual community online for various purposes such as recruitment, online donations, targeting youth online and spread of extremist ideologies. Everyday a large number of articles, tweets, posts, posters, blogs, comments, views and news are posted online without a check which in turn imposes a threat to the security of any nation. However, different agencies are working on getting down this radical content from various online social media platforms. The aim of our paper is to utilise deep learning algorithm in detection of radicalization contrary to the existing works based on machine learning algorithms. An LSTM based feed forward neural network is employed to detect radical content. We collected total 61601 records from various online sources constituting news, articles and blogs. These records are annotated by domain experts into three categories: Radical(R), Non-Radical (NR) and Irrelevant(I) which are further applied to LSTM based network to classify radical content. A precision of 85.9% has been achieved with the proposed approach
研究の動機と目的
- SNSプラットフォーム上でのイスラム国(ISIS)やジャハディストコミュニティなどの過激主義グループによるオンラインの過激化の増加する脅威に対処すること。
- 従来の機械学習手法が過激的テキストの意味的ニュアンスを捉えるのに限界を示す中、ディープラーニングによる克服。
- ニュース、ブログ、ソーシャルメディア投稿における過激的コンテンツを自動的かつスケーラブルに検出するシステムの開発。
- 単語埋め込みを用いた長短期記憶ネットワーク(LSTM)を活用することで、既存の技術を上回る分類精度の向上。
- ソーシャルメディアプラットフォームや治安当局が、前もって極端主義的コンテンツを同定・削除するのを支援すること。
提案手法
- 本研究では、過激的コンテンツ検出のための順序的な依存関係をモデル化するため、LSTMベースの順方向ニューラルネットワークを採用する。
- テキスト入力を表現するために単語埋め込み(word embeddings)が使用され、手動による特徴工学の必要性を排除する。
- ニュース、記事、ブログから収集した61,601件の記録からなるデータセットが作成され、分野の専門家によって3つのカテゴリにラベル付けされた:過激的(R)、非過激的(NR)、関連なし(I)。
- モデルは、さまざまなトレーニングセット対テストセット比(例:80:20)を用いて学習され、精度、再現率、Fスコア、カッパ係数を用いて評価された。
- 単語文書行列(term-document matrix)を用いて、SVM、ランダムフォレスト、Maximum Entropy(MaxEnt)分類器といった従来手法と性能を比較した。
- 予測の安定性とモデル収束の評価のため、テスト中に平均二乗誤差(MSE)をモニタリングした。
実験結果
リサーチクエスチョン
- RQ1LSTMベースのディープラーニングモデルは、従来の機械学習アルゴリズムに比べ、オンラインテキストにおける過激的コンテンツの検出において優れているか?
- RQ2単語埋め込みと順序モデリングの導入が、極端主義的テキスト検出の分類精度をどのように向上させるか?
- RQ3過激的テキスト分類において、モデルの一般化と過学習の回避をバランスさせる最適なトレーニングセット比は何か?
- RQ4曖昧または複数の視点が混在するテキストに対し、モデルの性能はどの程度効果的か?
- RQ5多クラス分類において、多様な「関連なし」コンテンツの存在が、モデルの性能にどの程度影響を与えるか?
主な発見
- 提案されたLSTMベースのモデルは、過激的コンテンツ分類において85.96%の精度を達成し、SVM(53.50%)、ランダムフォレスト(73.50%)、MaxEnt(69.50%)を顕著に上回った。
- カッパ係数は0.796を記録し、専門家アノテーター間の著しい一致を示した。
- 80:20のトレーニング対テストセット比で最大73.44%の精度が観察され、この比を超えると過学習が顕著に見られた。
- 3クラス分類(R、NR、I)では、主に「関連なし」カテゴリの高い多様性と曖昧さのため、性能が34.23%に低下した。
- テスト中の平均二乗誤差(MSE)曲線は、過激的コンテンツに対する一貫性のあるモデル性能を示し、予測の安定性を裏付けた。
- セキュリティに敏感なアプリケーションにおいて誤検出を最小限に抑える重要な指標である精度において、本モデルは優れた性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。