Skip to main content
QUICK REVIEW

[논문 리뷰] Mining Frequent Patterns in Evolving Graphs

Çiğdem Aslay, Muhammad Anis Uddin Nasir|arXiv (Cornell University)|2018. 09. 02.
Data Mining Algorithms and Applications참고 문헌 33인용 수 5
한 줄 요약

이 논문은 유동적 그래프에서 빈도가 높은 연결 서브그래프를 채취하기 위한 스트리밍 알고리즘을 제안한다. 유량 샘플링과 이웃 기반 패턴 확장을 사용하며, 공간 제약 조건 하에서 빈도가 높은 서브그래프의 대표 샘플을 효율적으로 유지하여, 농도 경계를 통한 확률적 보장을 통해 높은 정확도를 달성한다.

ABSTRACT

Given a labeled graph, the frequent-subgraph mining (FSM) problem asks to find all the $k$-vertex subgraphs that appear with frequency greater than a given threshold. FSM has numerous applications ranging from biology to network science, as it provides a compact summary of the characteristics of the graph. However, the task is challenging, even more so for evolving graphs due to the streaming nature of the input and the exponential time complexity of the problem. In this paper, we initiate the study of the approximate FSM problem in both incremental and fully-dynamic streaming settings, where arbitrary edges can be added or removed from the graph. For each streaming setting, we propose algorithms that can extract a high-quality approximation of the frequent $k$-vertex subgraphs for a given threshold, at any given time instance, with high probability. In contrast to the existing state-of-the-art solutions that require iterating over the entire set of subgraphs for any update, our algorithms operate by maintaining a uniform sample of $k$-vertex subgraphs with optimized neighborhood-exploration procedures local to the updates. We provide theoretical analysis of the proposed algorithms and empirically demonstrate that the proposed algorithms generate high-quality results compared to baselines.

연구 동기 및 목표

  • 모서리가 점진적으로 추가되는 동적이고 변화하는 그래프에서 빈도가 높은 연결 서브그래프를 채굴하는 과제를 해결하기 위해.
  • 모든 서브그래프를 저장하지 않고도 빈도 패턴의 대표 샘플을 유지하는 공간 효율적인 알고리즘을 설계하기 위해.
  • 오차가 제한된 확률적 샘플링을 사용하여 패턴 빈도 추정의 높은 정확도를 보장하기 위해.
  • 대규모 네트워크에서 유동적 그래프 구조의 실시간 분석을 가능하게 하기 위해.
  • 농도 부등식을 사용하여 샘플된 빈도 패턴의 품질에 대한 이론적 보장을 제공하기 위해.

제안 방법

  • 새로운 모서리가 도착함에 따라 업데이트되는 고정 크기의 버퍼를 사용하여 빈도가 높은 서브그래프의 유량 샘플을 유지한다.
  • 각 새로운 모서리 (u,v)에 대해, u와 v의 이웃을 다양한 깊이에서 탐색하여 (u,v)로 확장될 수 있는 모든 가능한 연결 서브그래프 H를 탐색한다.
  • h ∈ [0,k-2] 및 j = k-2-h에 대해 H ⊆ Nu,h^{t-1} ∪ Nv,j^{t-1}를 계산하여 G^{t-1}에서 H가 연결되어 있음을 보장한다.
  • 알고리즘은 H가 샘플 집합 S에 이미 존재하는지 확인한다. 만약 존재한다면, H′ = H ∪ {(u,v)}를 유량 샘플링을 사용하여 S에 대체한다.
  • 샘플 크기와 오차 경계를 제어하기 위해 M = log(T_k / δ) · (4+ε)/ε²의 파rameter를 사용하여 유량 샘플링을 적용한다.
  • 이 방법은 H′이 G^t에서 연결되어 있음을 보장하며, 농도 부등식을 통한 확률적 정확도 보장을 유지한다.

실험 결과

연구 질문

  • RQ1증가하는 모서리 업데이트가 있는 동적 그래프에서 빈도가 높은 연결 서브그래프를 어떻게 효율적으로 유지할 수 있는가?
  • RQ2유동적 그래프에서 빈도가 높은 서브그래프의 대표 샘플을 유지하기 위해 필요한 최소 공간 오버헤드는 얼마인가?
  • RQ3스트리밍 환경에서 서브그래프의 빈도 추정에 대해 확률적 오차 경계를 어떻게 강제할 수 있는가?
  • RQ4이웃 깊이와 서브그래프 크기가 패턴 채굴의 정확도와 효율성에 미치는 영향은 무엇인가?
  • RQ5유량 샘플링 전략을 이웃 확장과 효과적으로 조합하여 높은 정확도의 빈도 패턴 탐지를 유지할 수 있는가?

주요 결과

  • 알고리즘은 M = log(T_k / δ) · (4+ε)/ε²로 제한된 크기의 샘플을 유지하여 공간 효율성을 보장한다.
  • 농도 부등식에 의해 보장되듯이, 메서드는 확률 1−δ 이상에서 진짜 서브그래프 빈도의 (1±ε)-근사치를 달성한다.
  • 유량 샘플링 메커니즘은 유효한 서브그래프 H′ = H ∪ {(u,v)}가 샘플 집합 S에 균일한 확률로 유지되도록 보장한다.
  • G^{t-1}에서의 연결성과 S 내 소속 여부를 확인하여 비연결 또는 비빈도 서브그래프를 효율적으로 잘라낸다.
  • 깊이 기반 이웃 색인화(H 및 J)는 완전한 순열 없이도 잠재적 확장의 스케일러블 탐색을 가능하게 한다.
  • 이론적으로 유한한 이웃 크기 조건 하에서, 각 후보 서브그래프에 대해 근사적으로 일정한 시간 내에 처리함으로써 실시간 채굴을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.