Skip to main content
QUICK REVIEW

[论文解读] Community-based Outlier Detection for Edge-attributed Graphs

Supriya Pandhre, Manish Gupta|arXiv (Cornell University)|Dec 30, 2016
Anomaly Detection Techniques and Applications参考文献 15被引用 3
一句话总结

本文提出 HCODA,一种针对边属性图的基于社区的异常检测方法,通过隐马尔可夫随机场(HMRF)联合建模节点和边属性。通过将异常点视为一个独立社区,并应用期望最大化(EM)算法进行参数学习与社区推断,HCODA 有效识别出在结构和属性上下文中均偏离的全局社区异常点——即同时在结构和属性上异常的节点或边——在合成数据和 DBLP 合作作者数据上优于基线方法。

ABSTRACT

The study of networks has emerged in diverse disciplines as a means of analyzing complex relationship data. Beyond graph analysis tasks like graph query processing, link analysis, influence propagation, there has recently been some work in the area of outlier detection for information network data. Although various kinds of outliers have been studied for graph data, there is not much work on anomaly detection from edge-attributed graphs. In this paper, we introduce a method that detects novel outlier graph nodes by taking into account the node data and edge data simultaneously to detect anomalies. We model the problem as a community detection task, where outliers form a separate community. We propose a method that uses a probabilistic graph model (Hidden Markov Random Field) for joint modeling of nodes and edges in the network to compute Holistic Community Outliers (HCOutliers). Thus, our model presents a natural setting for heterogeneous graphs that have multiple edges/relationships between two nodes. EM (Expectation Maximization) is used to learn model parameters, and infer hidden community labels. Experimental results on synthetic datasets and the DBLP dataset show the effectiveness of our approach for finding novel outliers from networks.

研究动机与目标

  • 填补现有异常检测方法在边属性图上的空白,传统方法虽忽略边层面属性,但这些属性在现实网络中具有重要意义。
  • 检测不仅在节点属性上异常,且在关联边的社区结构上也异常的新颖异常点,此类异常点易被仅关注节点或链接的方法所遗漏。
  • 通过联合推断节点和边的潜在社区,对具有多种关系的异构网络进行建模。
  • 将异常检测形式化为社区检测问题,使异常点形成独立社区,从而实现全局异常识别。
  • 构建一个概率框架,整合节点数据、边属性与网络结构,以提升在复杂真实图中的检测准确性。

提出的方法

  • 使用隐马尔可夫随机场(HMRF)对图进行建模,联合捕捉节点属性、边属性与网络拓扑结构。
  • 定义节点和边社区标签的联合概率分布,整合节点数据、边属性与结构连接关系。
  • 使用期望最大化(EM)算法迭代估计隐藏社区标签(通过 ICM)并学习模型参数,包括节点、边和团项的权重。
  • 在 HMRF 的势函数中引入三个关键组件:节点似然、边似然与三角形团势(用于建模社区内的局部一致性)。
  • 根据合作者频率设置边权重,并通过反合作者数量对边到节点的权重进行归一化,以反映局部连通性。
  • 设定社区数量 K=4(对应四个研究领域)加一个异常社区,并在参数调优中使用 1% 的异常比例。

实验结果

研究问题

  • RQ1是否一种联合概率模型,结合节点属性、边属性与网络结构,能比仅考虑节点或链接的方法更有效地检测异常点?
  • RQ2在异构网络中,引入边属性在多大程度上提升了对全局社区异常点的检测能力?
  • RQ3所提出的基于 HMRF 的方法在合成与真实世界的边属性图上,相较于基线社区异常检测方法(CODA)的性能提升程度如何?
  • RQ4该方法对超参数(如 λ₁(连接权重)、λ₂(节点权重)和 λ₃(三角形团权重))的敏感性如何,最优设置是什么?
  • RQ5该方法能否在真实世界的合作者网络中识别出有意义且可解释的异常点,例如跨学科研究人员或异常合作?

主要发现

  • 在合成数据集上,HCODA 在不同异常注入率下均优于基线方法 CODA,表现出一致的异常检测准确率提升。
  • 在 DBLP 四个研究领域数据集上,HCODA 成功将 1% 的作者识别为异常点,经人工检查验证,排名靠前的候选者 100% 为具有实际意义的跨学科研究人员。
  • 算法将 Sameer K. Antani 和 Ivo Krka 识别为异常点,原因在于他们与不同研究领域合作,其合作行为与其主要发表领域不一致。
  • Anindya Datta 和 Debra E. VanderMeer 被识别为异常点,原因在于他们参与了超出其主要研究领域的合作主题,证实了该方法检测异常合作的能力。
  • Sabyasachi Saha 被标记为异常点,因其在人工智能与信息/知识管理两个领域间积极合作,反映出该方法对多领域参与行为的高度敏感性。
  • 该方法对参数 λ₂ 具有鲁棒性,对 λ₁(连接权重)最为敏感,较低值表现更优,而 λ₃(团权重)在大于 0.5 的取值下表现最佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。