Skip to main content
QUICK REVIEW

[论文解读] A Survey of Community Search Over Big Graphs

Yixiang Fang, Xin Huang|arXiv (Cornell University)|Apr 29, 2019
Complex Network Analysis Techniques参考文献 210被引用 9
一句话总结

本综述对大规模图上的社区搜索(CS)进行了全面回顾,分析了k-core、k-truss和k-clique等凝聚度度量,并在多种图类型上评估了CS方法。它识别出在效率、可扩展性和动态更新方面的关键挑战,并为大规模、异构及不确定图提出了未来研究方向。

ABSTRACT

With the rapid development of information technologies, various big graphs are prevalent in many real applications (e.g., social media and knowledge bases). An important component of these graphs is the network community. Essentially, a community is a group of vertices which are densely connected internally. Community retrieval can be used in many real applications, such as event organization, friend recommendation, and so on. Consequently, how to efficiently find high-quality communities from big graphs is an important research topic in the era of big data. Recently a large group of research works, called community search, have been proposed. They aim to provide efficient solutions for searching high-quality communities from large networks in real-time. Nevertheless, these works focus on different types of graphs and formulate communities in different manners, and thus it is desirable to have a comprehensive review of these works. In this survey, we conduct a thorough review of existing community search works. Moreover, we analyze and compare the quality of communities under their models, and the performance of different solutions. Furthermore, we point out new research directions. This survey does not only help researchers to have a better understanding of existing community search solutions, but also provides practitioners a better judgment on choosing the proper solutions.

研究动机与目标

  • 系统性地回顾并比较不同图类型和凝聚度度量下大规模图的社区搜索(CS)技术。
  • 识别在实时性能、扩展至百亿规模图以及支持动态或不确定图更新方面的关键挑战。
  • 突出当前研究中的空白,特别是针对异构、多维及带符号图缺乏CS解决方案的问题。
  • 倡导建立开放的CS代码和数据集仓库,以加速基准测试和实际部署。
  • 根据图的特征和应用需求,为研究人员和实践者提供选择合适CS方法的指导。

提出的方法

  • 基于k-core、k-truss、k-clique和k-ECC等凝聚度度量对CS方法进行分类,分析其结构特性和计算属性。
  • 调研2010–2019年间的30余项研究,按图类型(如静态图、不确定图、带符号图、多维图、HINs)和凝聚度模型进行分类。
  • 使用连通性、密度和可解释性等指标,评估不同算法在社区质量与性能方面的表现。
  • 提出分布式和I/O高效的计算模型,以实现对超过单机内存容量的百亿顶点图的可扩展CS计算。
  • 提出一种在线CS框架,支持对查询顶点和结构属性施加个性化约束的实时查询处理。
  • 强调建立标准化基准以及公开的代码/数据集仓库的必要性,以实现可复现性和实际应用。

实验结果

研究问题

  • RQ1不同的凝聚度度量(如k-core、k-truss)如何影响大规模图中社区搜索的质量与效率?
  • RQ2现有CS方法在处理现实图特征(如不确定性、动态性、异构性)方面存在哪些关键局限?
  • RQ3如何将CS算法扩展至无法容纳于主内存的百亿顶点图?
  • RQ4在异构信息网络(HINs)和多维图等新兴图类型上支持社区搜索面临哪些开放挑战?
  • RQ5开放的CS代码与数据集仓库在提升可复现性与工业界及学术界实际部署方面有何作用?

主要发现

  • 大多数现有CS方法仅限于静态、无向图,不支持动态更新、不确定边或复杂图类型(如HINs)。
  • 仅有少数研究(如Fang:TKDE:CSD、Li:vldb:2015)处理百亿规模图,多数仍受限于百万规模图,主要受内存与I/O限制。
  • k-core模型是CS中最广泛使用的凝聚度度量,其次是k-truss和k-clique,三者在密度与计算成本之间各有权衡。
  • 大多数调研的CS研究缺乏公开的代码与数据集,严重阻碍了可复现性与实际应用。
  • 分布式计算平台(如GraphX)以及I/O高效的基于磁盘的算法,是实现CS在现实大规模图中可扩展性的有前景方向。
  • 此前研究均未涉及带符号图、多维图或不确定图中的社区搜索,表明存在显著的开放研究机会。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。