Skip to main content
QUICK REVIEW

[논문 리뷰] Compact Neighborhood Index for Subgraph Queries in Massive Graphs

Chemseddine Nabti, T. Mecharnia|arXiv (Cornell University)|2017. 03. 16.
Graph Theory and Algorithms참고 문헌 25인용 수 3
한 줄 요약

이 논문은 주어진 정점의 이웃을 정수로 인코딩하는 Compact Neighborhood Index(CNI)를 사용하여 검색 공간을 효율적으로 줄이는 새로운 부분그래프 동형성 알고리즘인 CNI-Match를 제안한다. 이 방법은 주로 메모리 외부에 의존하지 않으며, 실세계 그래프에서 기존 최고 수준의 접근 방식인 CFL-Match 대비 최대 17배 빠른 속도와 최대 2,343배 높은 메모리 효율성을 달성한다.

ABSTRACT

Subgraph queries also known as subgraph isomorphism search is a fundamental problem in querying graph-like structured data. It consists to enumerate the subgraphs of a data graph that match a query graph. This problem arises in many real-world applications related to query processing or pattern recognition such as computer vision, social network analysis, bioinformatic and big data analytic. Subgraph isomorphism search knows a lot of investigations and solutions mainly because of its importance and use but also because of its NP-completeness. Existing solutions use filtering mechanisms and optimise the order within witch the query vertices are matched on the data vertices to obtain acceptable processing times. However, existing approaches are iterative and generate several intermediate results. They also require that the data graph is loaded in main memory and consequently are not adapted to large graphs that do not fit into memory or are accessed by streams. To tackle this problem, we propose a new approach based on concepts widely different from existing works. Our approach distills the semantic and topological information that surround a vertex into a simple integer. This simple vertex encoding that can be computed and updated incrementally reduces considerably intermediate results and avoid to load the entire data graph into main memory. We evaluate our approach on several real-word datasets. The experimental results show that our approach is efficient and scalable.

연구 동기 및 목표

  • 전체 데이터 그래프를 주로 메모리에 로드해야 하는 기존 부분그래프 동형성 알고리즘의 확장성 한계를 해결한다.
  • 특히 대규모 또는 스트리밍 그래프에서 이웃 기반 필터링의 높은 계산 및 메모리 비용을 줄인다.
  • 완전한 이웃 구조를 저장하지 않고도 위상적 및 의미적 이웃 정보를 캡처하는 경량이고 증분적인 정점 인코딩 기법을 개발한다.
  • 간결하고 업데이트 가능한 인덱스를 사용하여 매칭 과정의 초기 단계에서 검색 공간을 효율적으로 잘라내는 것을 가능하게 한다.
  • 희박한 그래프와 조밀한 그래프 모두에서 높은 성능을 달성하면서 중간 결과의 폭발을 최소화한다.

제안 방법

  • 각 정점의 1단계 이웃을 레이블 빈도와 구조적 특징을 조합하여 단일 정수로 매핑하는 Compact Neighborhood Index(CNI)를 제안한다.
  • CNI를 사용해 글로벌 필터링을 수행한다: 쿼리 정점이 요구하는 이웃 서명과 일치하지 않으면 데이터 정점은 제거된다.
  • 그래프 처리 또는 스트리밍 중에 효율적으로 유지할 수 있도록 CNI에 대한 증분 업데이트 메커니즘을 설계한다.
  • 부분그래프 동형성에 대한 재귀적 백트래킹 알고리즘에 CNI를 통합하여 정점 매칭을 시작하기 전에 필터링을 적용한다.
  • CNI를 확장하기 위해 복합 함수 $ cni_d(u) = g_2(\text{label}(u), cni(u)) $ 를 사용하여 정점 레이블을 포함시켜 더 풍부한 의미적 필터링을 가능하게 한다.
  • 그래프 수준의 CNI를 $ cni(G) = g_{|V(G)|}(cni_d(v_1), cni_d(v_2), ..., cni_d(v_{|V(G)|})) $ 로 구성하여 그래프 데이터베이스 색인에 잠재적으로 활용할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1완전한 이웃 구조를 저장하지 않으면서도 정수 기반의 압축된 정점 이웃 표현이 부분그래프 동형성의 검색 공간을 상당히 줄일 수 있는가?
  • RQ2CNI 기반 필터링은 NLF 및 MND와 같은 기존 방법과 비교해 병렬 필터링 능력과 계산 비용 측면에서 어떻게 성능을 내는가?
  • RQ3CNI 방법은 주로 메모리에 올라가지 않는 대규모 그래프에서 얼마나 잘 확장되는가?
  • RQ4CFL-Match의 CPI와 같은 전통적인 색인 구조에 비해 CNI를 유지하는 데 드는 메모리 및 시간 오버헤드는 어느 정도인가?
  • RQ5CNI는 그래프 데이터베이스 색인을 지원하고, 그래프 컬렉션에서의 유사도 검색 또는 쿼리 처리를 효율적으로 지원할 수 있는가?

주요 결과

  • 희박한 쿼리에 대해 YEAST 데이터셋에서 CNI-Match는 CFL-Match 대비 평균 12배 빠르며, HPRD 데이터셋에선 최대 17배 빠르다.
  • 조밀한 HUMAN 데이터셋에서, CFL-Match가 12시간 이내에 완료되는 쿼리 크기에서는 CNI-Match가 CFL-Match보다 4배 더 빠르다.
  • HPRD 데이터셋에서 CFL-Match는 CNI-Match 대비 최대 2,343배 더 많은 메모리를 사용하며, 작은 쿼리에선 최대 6,000배 더 많이 사용한다.
  • 희박한 쿼리에 대해 CNI-Match는 CFL-Match의 메모리 사용량의 일부분만 차지하며, YEAST와 HPRD에서 각각 675배, 2,343배의 감소를 기록한다.
  • CNI-Match의 메모리 사용량은 쿼리 크기에 따라 증가하지만, CNI 필터를 통과한 정점의 간선만 저장하기 때문에 여전이 관리 가능하다.
  • CNI-Match는 모든 쿼리 세트를 12시간 이내에 처리했지만, CFL-Match는 특히 더 큰 크기의 쿼리에서 밀도 높은 그래프에서 시간 제한을 초과한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.