Skip to main content
QUICK REVIEW

[論文レビュー] Under the Underground: Predicting Private Interactions in Underground Forums

Rebekah Overdorf, Carmela Troncoso|arXiv (Cornell University)|May 11, 2018
Social Capital and Networks被引用数 12
ひとこと要約

本論文では、地下のサイバー犯罪コミュニティにおける公開フォーラム投稿が、どの投稿がプライベートメッセージを引き起こすかを予測するための教師あり機械学習手法を提案している。投稿の内容とユーザーメタデータを特徴量として用い、ランダムな予測をはるかに上回る性能を達成しており、NLP特徴量が予測力の大部分を占めている。また、投稿固有のまたは一般的なプライベートメッセージ発生確率に注目するために閾値パラメータ Θ を調整することで、手作業によるラベル付け作業を削減する自動ラベリング手法を導入している。

ABSTRACT

Underground forums where users discuss, buy, and sell illicit services and goods facilitate a better understanding of the economy and organization of cybercriminals. Prior work has shown that in particular private interactions provide a wealth of information about the cybercriminal ecosystem. Yet, those messages are seldom available to analysts, except when there is a leak. To address this problem we propose a supervised machine learning based method able to predict which public hreads will generate private messages, after a partial leak of such messages has occurred. To the best of our knowledge, we are the first to develop a solution to overcome the barrier posed by limited to no information on private activity for underground forum analysis. Additionally, we propose an automate method for labeling posts, significantly reducing the cost of our approach in the presence of real unlabeled data. This method can be tuned to focus on the likelihood of users receiving private messages, or hreads triggering private interactions. We evaluate the performance of our methods using data from three real forum leaks. Our results show that public information can indeed be used to predict private activity, although prediction models do not transfer well between forums. We also find that neither the length of the leak period nor the time between the leak and the prediction have significant impact on our technique's performance, and that NLP features dominate the prediction power.

研究の動機と目的

  • 地下フォーラム分析において、プライベートメッセージが入手可能なのは稀なリーク時以外にほとんどないという重要なギャップを埋めるため。
  • 公開フォーラム投稿がどの程度プライベートメッセージを引き起こすかを予測する手法を開発し、アナリストが高ポテンシャルなコンテンツに集中できるようにするため。
  • 手作業によるラベル付けの高コストを低減するため、閾値パラメータ Θ を調整することで、投稿固有の発生確率または一般的なメッセージ受容性のどちらに焦点を当てるかを制御できる自動ラベリング手法を導入するため。
  • 予測モデルの異なる地下フォーラム間での移植性を評価し、リークタイミングと期間が性能に与える影響を検証するため。

提案手法

  • 本手法は、テキスト内容およびユーザーメタデータに基づいて、公開フォーラム投稿がプライベートメッセージを引き起こす可能性があるかどうかを分類する教師あり機械学習を用いる。
  • 特徴量には、NLP埋め込み(例:TF-IDF、BERTに類似した表現)、ユーザーアクティビティ指標、投稿長、時系列メタデータが含まれる。
  • 自動ラベリング手法は、類似度閾値 Θ を用いて、プライベートメッセージが特定の公開投稿に返信である可能性を計算し、高値 Θ では即時の返信(高い関連性)に、低値 Θ では一般的なユーザーメッセージ活動に焦点を当てる。
  • モデルは、3つの実際の地下フォーラムからリークされたデータを用いて学習され、プライベートメッセージ–投稿のリンク関係に自動ラベリング手法を適用してラベルが生成された。
  • 異なるフォーラム間および同じフォーラム内での設定を用いて、モデルの移植性とタイミングの変動に対するロバスト性を評価する。
  • 閾値パラメータ Θ によりラベリングの柔軟性が得られ、高値 Θ では投稿公開直後のメッセージに注目し、返信の関連性に関する信頼性を高めることができる。

実験結果

リサーチクエスチョン

  • RQ1地下のサイバー犯罪フォーラムにおいて、公開フォーラム投稿を用いてその後のプライベートメッセージを信頼性高く予測できるか?
  • RQ2自動ラベリング手法は、ラベル品質を維持しつつ、手作業によるアノテーション作業をどの程度削減できるか?
  • RQ3予測モデルの性能は、リーク期間の長さやリーク時刻と予測時刻の間隔に依存するか?
  • RQ4異なるユーザーコミュニティやコンテンツスタイルを有する異なる地下フォーラム間で、学習済みモデルはどの程度移植可能か?
  • RQ5コンテンツベースの特徴量とメタデータベースの特徴量のどちらが、プライベートメッセージ発生の予測においてより予測力が高いか?

主な発見

  • モデルは、ランダムな予測をはるかに上回る性能を示しており、公開情報から非公開活動を推定可能であることを示している。
  • コンテンツベースの特徴量、特にNLP表現が、予測力の大部分を占めており、メタデータ特徴量が個別に有意な信号を提供しているにもかかわらず、その影響は劣っている。
  • リーク期間の長さやリーク時刻と予測時刻の間隔がモデル性能に顕著な影響を及ぼさないため、時間経過に伴うフォーラムのダイナミクスが安定していることが示唆される。
  • あるフォーラムで学習したモデルは、別のフォーラムでテストした場合に性能が著しく低下するため、モデルのフォーラム間での移植性は限定的であり、ターゲットフォーラム固有の学習データが必要であることが示された。
  • 自動ラベリング手法は手作業の負荷を効果的に低減できており、高値 Θ ではタイムリーかつ信頼性の高い返信に注目する一方、低値 Θ では一般のユーザーメッセージ受容性を捉えることができ、手作業による検証で裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。