Skip to main content
QUICK REVIEW

[论文解读] Evaluation Metrics for Graph Generative Models: Problems, Pitfalls, and Practical Solutions

Leslie O’Bray, Max Horn|arXiv (Cornell University)|Jun 2, 2021
Data Visualization and Analytics被引用 5
一句话总结

本文揭示了在图生成模型评估中使用最大均值差异(MMD)作为主要度量指标时存在的关键缺陷,表明核函数与参数选择可任意扭曲模型排名。本文提出一种基于扰动的验证协议,以选择对扰动鲁棒的MMD配置,确保对结构差异具有单调敏感性,并提升模型比较的公平性与可复现性。

ABSTRACT

Graph generative models are a highly active branch of machine learning. Given the steady development of new models of ever-increasing complexity, it is necessary to provide a principled way to evaluate and compare them. In this paper, we enumerate the desirable criteria for such a comparison metric and provide an overview of the status quo of graph generative model comparison in use today, which predominantly relies on the maximum mean discrepancy (MMD). We perform a systematic evaluation of MMD in the context of graph generative model comparison, highlighting some of the challenges and pitfalls researchers inadvertently may encounter. After conducting a thorough analysis of the behaviour of MMD on synthetically-generated perturbed graphs as well as on recently-proposed graph generative models, we are able to provide a suitable procedure to mitigate these challenges and pitfalls. We aggregate our findings into a list of practical recommendations for researchers to use when evaluating graph generative models.

研究动机与目标

  • 识别并分析最大均值差异(MMD)作为图生成模型评估主导度量指标的缺陷。
  • 研究MMD中核函数与参数选择如何导致模型排名产生误导性或非单调结果,即使结构差异不断增加。
  • 开发一种实用且可复现的程序,用于选择对扰动鲁棒且对真实分布差异敏感的MMD核函数与参数组合。
  • 为研究人员提供可操作的建议,以实现与具体模型无关的公平且可靠的图生成模型评估。

提出的方法

  • 在三种常见网络模型(Barabási-Albert、Erdős-Rényi 和 Watts-Strogatz)的合成扰动图上系统评估MMD行为。
  • 在多个数据集上应用四种类型的图扰动——边添加、边删除、边重连和节点添加——以模拟结构差异的逐步增加。
  • 以扰动程度与MMD距离之间的皮尔逊相关系数作为可靠性度量,生成热图以可视化不同描述符函数与核参数下的性能表现。
  • 基于与扰动水平最高的相关性选择最优核函数-参数组合,确保对结构变化具有单调且鲁棒的敏感性。
  • 提出一种标准化的扰动实验,以独立于模型特定性能指导核函数选择,从而增强可复现性与公平性。
  • 将该方法集成到模块化评估流程中,实现描述符函数选择与度量评估的解耦,促进研究间的一致性。

实验结果

研究问题

  • RQ1在评估结构相似性时,MMD中核函数与参数的选择如何影响图生成模型的排名?
  • RQ2MMD在多大程度上无法随图分布之间结构差异的增加而单调递增?
  • RQ3基于扰动的验证协议能否可靠识别出对结构变化具有鲁棒性且敏感的MMD核函数-参数组合?
  • RQ4使用次优MMD配置在模型评估中会产生哪些实际后果,以及如何缓解这些问题?
  • RQ5研究人员如何确保基于MMD的评估是公平、可复现的,并且独立于被比较的具体模型?

主要发现

  • 当使用较差的核函数-参数组合时,MMD可能产生与扰动程度非单调甚至相反的相关性,导致模型排名产生误导。
  • 表现最佳的核函数-参数组合与扰动程度的皮尔逊相关系数达到约0.95,而最差组合则表现出-0.35的负相关性,凸显了配置选择的极端敏感性。
  • 诸如聚类系数和度分布等描述符函数表现出不一致的MMD行为,部分组合甚至在扰动增加时出现MMD下降。
  • 所提出的基于扰动的筛选协议成功识别出在所有测试图类型中均能保持与扰动水平高度相关性的鲁棒核函数-参数对。
  • 使用固定且与领域相关的扰动水平(例如5%的边重连)作为核函数选择的基准,可带来比依赖模型特定性能更可靠、更具可比性的评估结果。
  • 该方法通过将核函数选择与模型比较解耦,实现了可复现的评估,减少了偏差,提升了模型基准测试的公平性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。