Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Threat E-mails using Bayesian Approach

M. Tariq Banday, Jameel A. Qadri|arXiv (Cornell University)|Dec 23, 2011
Spam and Phishing Detection参考文献 9被引用数 6
ひとこと要約

本稿では、単一キーワード、重み付き複数キーワード、および文脈照合を伴う重み付き複数キーワードの3つの手法を用いて脅威メールを分類するナイトヴ・ベイジアン手法を提案する。テロリズム関連のメールコーパスを用いた評価において、文脈に配慮したアプローチは検出精度を顕著に向上させ、法執行部門や諜報活動への脅威メールフィルタリングシステムにおける文脈分析の有効性を示している。

ABSTRACT

Fraud and terrorism have a close connect in terms of the processes that enables and promote them. In the era of Internet, its various services that include Web, e-mail, social networks, blogs, instant messaging, chats, etc. are used in terrorism not only for communication but also for i) creation of ideology, ii) resource gathering, iii) recruitment, indoctrination and training, iv) creation of terror network, and v) information gathering. A major challenge for law enforcement and intelligence agencies is efficient and accurate gathering of relevant and growing volume of crime data. This paper reports on use of established Naïve Bayesian filter for classification of threat e-mails. Efficiency in filtering threat e-mail by use of three different Naïve Bayesian filter approaches i.e. single keywords, weighted multiple keywords and weighted multiple keywords with keyword context matching are evaluated on a threat e-mail corpus created by extracting data from sources that are very close to terrorism.

研究の動機と目的

  • 反テロ活動における膨大な量の脅威関連メールをフィルタリングするという増大する課題に対処すること。
  • ナイトヴ・ベイジアン分類器がテロ関連コンテンツを含むメールを検出する有効性を評価すること。
  • 単一キーワード、重み付き複数キーワード、および文脈に配慮したキーワード照合の3つのベイジアンフィルタリング手法を比較すること。
  • テロリズムに近縁なソースから得た実世界の脅威データを用いて、堅牢なメール分類システムを構築すること。
  • キーワードベースのフィルタリングに文脈的情報を組み込むことで、諜報機関の検出精度を向上させること。

提案手法

  • 本研究では、テロリズムに密接に関連するソースから収集された手動でキュレートされた脅威メールコーパスを用いてトレーニングされたナイトヴ・ベイジアン分類器を採用する。
  • 3つのフィルタリングアプローチを実装する:(1) 単一キーワード照合、(2) 重み付き複数キーワード、(3) 文脈照合を伴う重み付き複数キーワード。
  • キーワードの重みは、頻度および脅威指標との関連性に基づいて割り当てられ、健全なコンテンツと悪意あるコンテンツの区別を向上させる。
  • 文脈照合は、脅威関連キーワードの文法的および意味的近接性を分析することで、分類の正確性を向上させる。
  • モデルは条件付き確率推定を用いて、特徴の存在に基づきメールが脅威である確率を計算する。
  • 性能は、ホールドアウトテストセットを用いた標準的な指標(精度、再現率、F1スコア)で評価される。

実験結果

リサーチクエスチョン

  • RQ1ナイトヴ・ベイジアン分類器は、テロリズム関連コーパスからの脅威メール検出においてどの程度効果的か?
  • RQ2単一キーワードフィルタリングと比較して、キーワード重み付けを組み込むことで検出精度が向上するか?
  • RQ3重み付きキーワードに文脈照合を追加することで、分類性能がどの程度向上するか?
  • RQ43つのフィルタリング手法は、精度、再現率、F1スコアの観点からどのように比較されるか?
  • RQ5文脈分析を組み込むことで、脅威メール検出における誤検出(ファルス・ポジティブ)を低減できるか?

主な発見

  • 重み付き複数キーワード手法は、単一キーワードフィルタリングと比較して、精度およびF1スコアの観点で顕著に優れていた。
  • 重み付きキーワードモデルに文脈照合を組み込むことで、3つの手法の中で最高の検出精度が達成された。
  • 文脈に配慮したモデルは、脅威関連用語の健全な使用と悪意ある使用を効果的に区別することで、誤検出を低減した。
  • 本研究では、キーワード重み付けと文脈分析を組み合わせることで、自動脅威メール検出システムの信頼性が向上することを示した。
  • ドメイン特化された、テロリズムに近縁なデータを用いてトレーニングされたナイトヴ・ベイジアンフレームワークは、脅威メールの分類に有効であることが判明した。
  • 結果は、文脈的特徴を組み込んだベイジアンフィルタリングが、諜報および法執行部門のメール監視のための実用的解決策であると支持するものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。