Skip to main content
QUICK REVIEW

[論文レビュー] Taming Near Repeat Calculation for Crime Analysis via Cohesive Subgraph Computing

Zhaoming Yin, Xuan Shi|arXiv (Cornell University)|May 18, 2017
Data Visualization and Analytics参考文献 21被引用数 3
ひとこと要約

本稿では、Rツリーインデキシングと凝集的サブグラフ解析(kクランイク、kトラス、kコア、DBSCAN)を用いた、大規模な空間的・時間的犯罪データにおいて近接繰返し犯罪イベント連鎖を効率的に検出する、画期的なグラフベースのフレームワークを提案する。これは、100万件のレコードを含む犯罪データセットを処理し、2件を超える連鎖を検出する最初の試みであり、計算時間の削減により従来のO(n²)のペアワイズ手法を著しく上回り、高次元の空間的・時間的犯罪パターンを明らかにする。

ABSTRACT

Near repeat (NR) is a well known phenomenon in crime analysis assuming that crime events exhibit correlations within a given time and space frame. Traditional NR calculation generates 2 event pairs if 2 events happened within a given space and time limit. When the number of events is large, however, NR calculation is time consuming and how these pairs are organized are not yet explored. In this paper, we designed a new approach to calculate clusters of NR events efficiently. To begin with, R-tree is utilized to index crime events, a single event is represented by a vertex whereas edges are constructed by range querying the vertex in R-tree, and a graph is formed. Cohesive subgraph approaches are applied to identify the event chains. k-clique, k-truss, k-core plus DBSCAN algorithms are implemented in sequence with respect to their varied range of ability to find cohesive subgraphs. Real world crime data in Chicago, New York and Washington DC are utilized to conduct experiments. The experiment confirmed that near repeat is a solid effect in real big crime data by conducting Mapreduce empowered knox tests. The performance of 4 different algorithms are validated, while the quality of the algorithms are gauged by the distribution of number of cohesive subgraphs and their clustering coefficients. The proposed framework is the first to process the real crime data of million record scale, and is the first to detect NR events with size of more than 2.

研究の動機と目的

  • 大規模な犯罪データセットにおける従来のO(n²)の近接繰返し計算の計算不能性に対処すること。
  • 空間的・時間的イベント連鎖のスケーラブルな分析を可能とするために、近接繰返し犯罪イベントをグラフとしてモデル化すること。
  • kクランイク、kトラス、kコア、DBSCANといった凝集的サブグラフアルゴリズムの性能を同定し、比較することにより、意味のあるイベントクラスタを検出すること。
  • MapReduceを活用したKnox検定を用いて、実世界の犯罪データにおける近接繰返し効果の存在を検証すること。
  • リアルタイムの犯罪分析アプリケーション向けに、スケーラブルでインクリメンタルな近接繰返し連鎖検出を可能にすること。

提案手法

  • 空間的・時間的近接性の検出を可能にするために、犯罪イベントをRツリーでインデキシングする。
  • 頂点が犯罪イベントを表し、所定の空間的・時間的ウィンドウ内にあるイベント同士を結ぶエッジを持つ無向グラフを構築する。
  • kクランイク、kトラス、kコア、DBSCANの4つの凝集的サブグラフ検出アルゴリズムを適用し、近接繰返しイベントの密集したクラスタを同定する。
  • 大規模データセット全体にわたり近接繰返し効果の統計的妥当性を検証するため、MapReduceを用いてKnox検定をスケーリングする。
  • 実行時間、凝集的サブグラフの数、クラスタリング係数の分布を用いてアルゴリズムの性能を評価する。
  • AWS上でフレームワークを実装し、シカゴ、ニューヨーク、ワシントンD.C.の実世界の犯罪データを処理する。

実験結果

リサーチクエスチョン

  • RQ1凝集的サブグラフ解析は、大規模な犯罪データにおいて、2件以上のペアワイズ相互作用を超えた近接繰返し犯罪イベント連鎖を効果的に検出できるか?
  • RQ2kクランイク、kトラス、kコア、DBSCANといった異なる凝集的サブグラフアルゴリズムは、近接繰返し検出における計算効率とクラスタリング品質の観点でどのように比較されるか?
  • RQ3近接繰返し効果は、2件のペアではなく、2件を超えるイベント連鎖を分析した場合にも継続的に存在するのか、統計的Knox検定によって確認できるか?
  • RQ4実世界の犯罪データセットにおいて、正確な(kクランイク)と近似の(kトラス、kコア、DBSCAN)サブグラフ検出手法の間には、どのような性能のトレードオフがあるか?
  • RQ5提示されたフレームワークは、インクリメンタル検出機能を備えており、オンラインでストリーミングされる犯罪データにスケーラブルに適用可能か?

主な発見

  • 提示されたフレームワークは、最大100万件のレコードを含む実際の犯罪データを処理でき、2件を超える連鎖を検出する初めての試みに成功した。
  • kトラスは、クラスタリング係数の質においてkコアやDBSCANを上回り、より一貫性があり意味のあるイベント連鎖を示している。
  • DBSCANとkコアは、大きなk値に対しても安定したクラスタリング係数を示しており、高凝集性の閾値でも一貫した空間的・時間的パターンを検出していることが示唆された。
  • 主な計算コストは凝集的サブグラフ検出に起因しており、kクランイクは指数時間の時間計算量のため、大規模なグラフでは実用的でないことが判明した。
  • kトラスとkコアは、特に大規模で密なグラフにおいてkクランイクよりも著しく高速であり、近似手法の利点が顕著に現れた。
  • MapReduceを活用したKnox検定により、シカゴ、ニューヨーク、ワシントンD.C.の3つの実世界データセットすべてで顕著な近接繰返し効果が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。