Skip to main content
QUICK REVIEW

[論文レビュー] No Place to Hide: Catching Fraudulent Entities in Tensors

Yikun Ban, Xin Liu|arXiv (Cornell University)|Oct 15, 2018
Tensor decomposition and applications参考文献 36被引用数 4
ひとこと要約

本稿では、情報共有グラフ(Information Sharing Graphs)として重み付きグラフにテンソルをモデル化することで、密な部分グラフ抽出を用いて不正なエンティティを検出する新規フレームワーク、ISG+D-Spotを提案する。異種の特徴間の値共有パターンを捉え、高速で並列化可能なアルゴリズムを用いることで、実世界のデータセットにおける不正検出において、最先端の手法を上回り、最大11倍の高速化を達成するとともに、最適解の少なくとも1/2の密度を持つ部分グラフを保証する。

ABSTRACT

Many approaches focus on detecting dense blocks in the tensor of multimodal data to prevent fraudulent entities (e.g., accounts, links) from retweet boosting, hashtag hijacking, link advertising, etc. However, no existing method is effective to find the dense block if it only possesses high density on a subset of all dimensions in tensors. In this paper, we novelly identify dense-block detection with dense-subgraph mining, by modeling a tensor into a weighted graph without any density information lost. Based on the weighted graph, which we call information sharing graph (ISG), we propose an algorithm for finding multiple densest subgraphs, D-Spot, that is faster (up to 11x faster than the state-of-the-art algorithm) and can be computed in parallel. In an N-dimensional tensor, the entity group found by the ISG+D-Spot is at least 1/2 of the optimum with respect to density, compared with the 1/N guarantee ensured by competing methods. We use nine datasets to demonstrate that ISG+D-Spot becomes new state-of-the-art dense-block detection method in terms of accuracy specifically for fraud detection.

研究の動機と目的

  • 既存の密ブロック検出手法が、テンソルの次元の部分集合でのみ密な信号が現れる場合に不正を同定できないという限界を解消すること。
  • テンソルベースの不正検出を、すべての密度情報を保持したまま部分グラフの密さ抽出として定式化すること。また、異種のデータ型を適切に処理すること。
  • 高品質な密な部分グラフ検出を保証する理論的近似境界を備えた、スケーラブルで並列化可能なアルゴリズムの開発。
  • 情報理論的手法を用いて、重要な特徴を優先することで、隠れた最密ブロック(不正)と通常の密なブロックを区別すること。
  • 特徴の情報理論的寄与度に基づき自動的に重み付けすることで、ノイズの多い特徴に対して耐性を高めること。

提案手法

  • テンソル内の各値共有インスタンスを重み付きエッジまたはノードに変換することで、情報共有グラフ(ISG)を構築し、すべての密度情報を保持する。
  • 情報理論的指標を用いてエッジの重みを割り当て、分布的有意性の高い特徴(例:IPアドレスやデバイスID)を、単なる年齢や性別のような単純な特徴よりも優先する。
  • D-Spotアルゴリズムを適用し、1回のスキャンで複数の最密部分グラフを検出する。グリーディな反復的手法を用い、密度に関して1/2近似保証を達成する。
  • D-Spotを並列化可能に設計することで、部分グラフを独立して処理でき、大規模なテンソルにおける効率的なスケーリングを実現する。
  • テンソルの1回スキャンでISGを構築することで、エントリ数に比例する線形時間計算量を保証する。
  • 特徴の優先順位付けをグラフ構築段階に統合し、ノイズに自然に耐性を示し、意味的に重要な特徴を強調する。

実験結果

リサーチクエスチョン

  • RQ1密度情報を損なわず、変換されたグラフ表現において、密ブロック検出を密な部分グラフ抽出に再定式化できるか?
  • RQ2従来の探索ベースや分解ベースの手法よりも、部分的なテンソル次元でのみ密な信号を示す「隠れた最密ブロック」を、グラフベースの手法がより効果的に検出できるか?
  • RQ3スケーラブルで並列化可能なアルゴリズムが、不正検出における密な部分グラフ抽出において、高速性と強い理論的保証の両方を達成できるか?
  • RQ4情報理論的特徴重み付けを統合することで、ノイズや無関係な特徴が存在する状況でも、検出精度が向上するか?
  • RQ5実世界の不正検出シナリオにおいて、提案されたISG+D-Spotフレームワークが、最先端の手法をどの程度上回るか?

主な発見

  • ISG+D-Spotは、最先端のアルゴリズムと比較して最大11倍の高速化を達成し、大規模なテンソル解析における顕著な性能向上を示した。
  • D-Spotアルゴリズムは、検出された部分グラフが最適解の少なくとも1/2の密度を持つことを保証しており、同様の条件下で1/Nの密度保証しか達成しない競合手法を上回った。
  • 8つの実世界データセットにおいて、ISG+D-SpotはM-Zoom、M-Biz、D-Cubeなどの既存手法よりも高いAUCスコアを達成した。特に、小規模で隠れた密なブロックの検出において顕著な優位性を示した。
  • 登録データセットでは、5つの特徴を用いてもISG+D-Spotは高いAUC(0.9859)を維持したが、ベースライン手法では著しく低下した(例:M-ZoomのAUCは0.4874に低下)。ノイズへの耐性を示した。
  • ISG構築による値共有信号の強調により、1つのIPサブネットを共有する51名のグループを、従来のベースラインでは検出できなかったが、本手法で正常に検出できた。
  • Amazonのデータセットにおける実行時間のパフォーマンスから、ISG+D-Spotはデータサイズにほぼ線形にスケーリングすることが確認され、実世界での導入可能性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。