Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating Classifiers in Detecting 419 Scams in Bilingual Cybercriminal Communities

Alex V. Mbaziira, Ehab Abozinadah|arXiv (Cornell University)|Aug 17, 2015
Spam and Phishing Detection参考文献 19被引用数 6
ひとこと要約

本研究では、英語と現地言語が併存するニジェリア人のサイバー犯罪フォーラムから収集した実世界のデータセットを用いて、419詐欺の検出に、ナイーブベイズ、k近傍法(IBK)、サポートベクターマシン(SVM)を評価する。95%信頼水準において、SVMが他の分類器を顕著に上回り、多言語のサイバー犯罪検出文脈において優れた効果を示した。

ABSTRACT

Incidents of organized cybercrime are rising because of criminals are reaping high financial rewards while incurring low costs to commit crime. As the digital landscape broadens to accommodate more internet-enabled devices and technologies like social media, more cybercriminals who are not native English speakers are invading cyberspace to cash in on quick exploits. In this paper we evaluate the performance of three machine learning classifiers in detecting 419 scams in a bilingual Nigerian cybercriminal community. We use three popular classifiers in text processing namely: Naïve Bayes, k-nearest neighbors (IBK) and Support Vector Machines (SVM). The preliminary results on a real world dataset reveal the SVM significantly outperforms Naïve Bayes and IBK at 95% confidence level.

研究の動機と目的

  • 機械学習分類器の419詐欺検出における有効性を評価すること。
  • 英語と現地言語が併存するニジェリア人のサイバー犯罪フォーラムから収集した実世界のデータセット上で、分類器の性能を評価すること。
  • ナイーブベイズ、IBK、SVMという3つの広く使われているテキスト分類モデルの精度と頑健性を比較すること。
  • 多言語オンライン犯罪環境における詐欺コンテンツ検出に最も効果的な分類器を特定すること。

提案手法

  • 本研究では、英語と現地のナイジェリア言語が併存する二か国語のニジェリア人のサイバー犯罪フォーラムから収集した実世界のデータセットを用いる。
  • テキスト前処理には、トークン化、ストップワードの除去、およびbag-of-words表現を用いた特徴抽出が含まれる。
  • 3つの分類器—ナイーブベイズ、k近傍法(IBK)、サポートベクターマシン(SVM)—をデータセット上で訓練および評価する。
  • 性能は、精度、適合率、再現率、F1スコアといった標準的な指標で測定され、95%信頼水準での統計的有意性も検証される。
  • 結果の頑健性と一般化可能性を確保するため、10分割交差検証を用いて評価を行う。

実験結果

リサーチクエスチョン

  • RQ1二か国語のサイバー犯罪コミュニティ内での419詐欺検出において、どの機械学習分類器が最も優れた性能を示すか?
  • RQ2ナイーブベイズ、IBK、SVMは、多言語詐欺検出タスクにおいて、精度と信頼性の観点でどのように比較されるか?
  • RQ395%信頼水準において、分類器間で統計的に有意な性能差が認められるか?
  • RQ4従来のテキスト分類器は、低リソースで多言語のサイバー犯罪コミュニケーションを処理するのにどの程度効果的か?

主な発見

  • サポートベクターマシン(SVM)は、95%信頼水準において、ナイーブベイズおよびk近傍法(IBK)を顕著に上回る性能を示した。
  • SVM分類器は、二か国語のデータセット上で、3つのモデルの中で最高の精度、適合率、再現率、F1スコアを達成した。
  • ナイーブベイズおよびIBKは低い性能を示し、特にIBKはF1スコアと全体的な頑健性の点で著しく劣っていた。
  • 結果から、SVMは多言語のサイバー犯罪フォーラムに見られる言語的多様性と複雑さに対処するのに適していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。