Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey of Community Search Over Big Graphs

Yixiang Fang, Xin Huang|arXiv (Cornell University)|2019. 04. 29.
Complex Network Analysis Techniques참고 문헌 210인용 수 9
한 줄 요약

이 종합 검토는 대규모 그래프에서 커뮤니티 서치(CS)에 대해 포괄적인 리뷰를 제공하며, k-core, k-truss, k-clique와 같은 밀도 측도를 분석하고 다양한 그래프 유형에서 CS 방법을 평가한다. 효율성, 확장성, 동적 업데이트와 같은 핵심 과제를 규명하고, 대규모, 이질적, 불확실한 그래프를 위한 향후 연구 방향을 제안한다.

ABSTRACT

With the rapid development of information technologies, various big graphs are prevalent in many real applications (e.g., social media and knowledge bases). An important component of these graphs is the network community. Essentially, a community is a group of vertices which are densely connected internally. Community retrieval can be used in many real applications, such as event organization, friend recommendation, and so on. Consequently, how to efficiently find high-quality communities from big graphs is an important research topic in the era of big data. Recently a large group of research works, called community search, have been proposed. They aim to provide efficient solutions for searching high-quality communities from large networks in real-time. Nevertheless, these works focus on different types of graphs and formulate communities in different manners, and thus it is desirable to have a comprehensive review of these works. In this survey, we conduct a thorough review of existing community search works. Moreover, we analyze and compare the quality of communities under their models, and the performance of different solutions. Furthermore, we point out new research directions. This survey does not only help researchers to have a better understanding of existing community search solutions, but also provides practitioners a better judgment on choosing the proper solutions.

연구 동기 및 목표

  • 다양한 그래프 유형과 밀도 측도를 기반으로 대규모 그래프에서 커뮤니티 서치(CS) 기법을 체계적으로 검토하고 비교하기.
  • 실시간 성능, 빌리언 스케일 그래프로의 확장성, 동적 또는 불확실한 그래프 업데이트 지원과 같은 핵심 과제를 규명하기.
  • 특히 이질적, 다차원, 부호가 있는 그래프에 대한 CS 솔루션 부족과 같은 현재 연구의 격차를 부각하기.
  • 재현성과 실용적 도입을 가속화하기 위해 CS 코드 및 데이터셋의 개방형 레포지터리를 설립할 것을 촉구하기.
  • 그래프 특성과 응용 요구사항에 따라 연구자 및 실무자가 적절한 CS 기법을 선택할 수 있도록 안내하기.

제안 방법

  • k-core, k-truss, k-clique, k-ECC와 같은 밀도 측도 기반으로 CS 기법을 분류하고, 그들의 구조적 및 계산적 특성을 분석하기.
  • 2010–2019년 사이의 30개 이상의 연구를 조사하여 그래프 유형(예: 정적, 불확실, 부호가 있는, 다차원, HINs)과 밀도 모델 기반으로 분류하기.
  • 다양한 알고리즘 간의 커뮤니티 품질을 평가하기 위해 연결성, 밀도, 해석 가능성 등의 지표를 사용하여 성능과 품질 평가하기.
  • 메모리가 한계가 되는 빌리언 정점 그래프에 대해 확장 가능한 분산 및 I/O 효율적인 계산 모델 제안하기.
  • 실시간 쿼리 처리를 지원하고, 쿼리 정점과 구조적 속성에 대해 개인화된 제약 조건을 허용하는 온라인 CS 프레임워크 제안하기.
  • 재현 가능성을 보장하고 실용적 도입을 촉진하기 위해 표준화된 벤치마크와 공개된 코드/데이터셋 레포지터리의 필요성을 강조하기.

실험 결과

연구 질문

  • RQ1k-core, k-truss 등의 다양한 밀도 측도가 대규모 그래프에서 커뮤니티 서치의 품질과 효율성에 어떻게 영향을 미치는가?
  • RQ2기존 CS 기법이 불확실성, 동적 변화, 이질성과 같은 실세계 그래프 특성을 다룰 때 겪는 주요 한계는 무엇인가?
  • RQ3메모리에 담을 수 없는 빌리언 정점 그래프에 대해 CS 알고리즘이 어떻게 확장될 수 있는가?
  • RQ4이질적 정보 네트워크(HINs) 및 다차원 그래프와 같은 새로운 그래프 유형에서 커뮤니티 서치를 지원하는 데 있어 열려 있는 과제는 무엇인가?
  • RQ5CS 코드 및 데이터셋의 개방형 레포지터리가 연구 및 산업 현장에서 재현 가능성과 실용적 도입을 어떻게 향상시킬 수 있는가?

주요 결과

  • 대부분의 기존 CS 기법은 정적, 무방향 그래프에 국한되어 있으며, 동적 업데이트, 불확실한 간선, HIN과 같은 복잡한 그래프 유형을 지원하지 않는다.
  • 빌리언 스케일 그래프를 처리하는 연구는 소수에 불과하며, 대부분은 메모리 및 I/O 제약으로 인해 백만 스케일 그래프에 국한되어 있다.
  • k-core 모델은 CS에서 가장 널리 사용되는 밀도 측도이며, 그 다음으로 k-truss와 k-clique가 이어지며, 각각의 경우 밀도와 계산 비용 간의 상충 관계가 다르게 나타난다.
  • 대부분의 조사된 CS 연구에서 공개된 코드와 데이터셋이 부족하여 재현 가능성과 실용적 도입이 저해되고 있다.
  • 분산 계산 플랫폼(예: GraphX)과 I/O 효율적인 디스크 기반 알고리즘은 실세계 대규모 그래프에 대한 CS 확장에 있어 유망한 방향이다.
  • 이전 연구에서 부호가 있는 그래프, 다차원 그래프, 불확실한 그래프에서의 커뮤니티 서치를 다루지 않았으며, 이는 상당한 열린 연구 기회를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.