[论文解读] ProvGen: generating synthetic PROV graphs with predictable structure
ProvGen 是一种 PROV 图生成器,通过使用特定领域的约束语言和种子 provenance 模式,生成具有用户可控结构特性的大规模合成 provenance 图。它利用 Neo4J 的 Cypher 查询引擎,生成的图能紧密模拟现实世界中的 provenance 模式,初步评估显示其在关键指标(如代理关联和贡献)上与真实 Wikipedia provenance 数据具有很强的统计相似性。
This paper introduces provGen, a generator aimed at producing large synthetic provenance graphs with predictable properties and of arbitrary size. Synthetic provenance graphs serve two main purposes. Firstly, they provide a variety of controlled workloads that can be used to test storage and query capabilities of provenance management systems at scale. Secondly, they provide challenging testbeds for experimenting with graph algorithms for provenance analytics, an area of increasing research interest. provGen produces PROV graphs and stores them in a graph DBMS (Neo4J). A key feature is to let users control the relationship makeup and topological features of the graph, by providing a seed provenance pattern along with a set of constraints, expressed using a custom Domain Specific Language. We also propose a simple method for evaluating the quality of the generated graphs, by measuring how realistically they simulate the structure of real-world patterns.
研究动机与目标
- 通过生成具有可控结构特性的合成 PROV 图,解决 provenance 管理系统缺乏标准化、社区认可的基准问题。
- 利用反映现实世界模式的合成工作负载,实现 provenance 存储、查询和分析系统的可扩展测试。
- 为研究人员提供一个可配置的工具,用于生成多样且逼真的 provenance 图工作负载,以支持算法开发与评估。
- 通过将统计特性与真实世界 provenance 数据集进行比较,评估生成图的真实性。
提出的方法
- 用户定义一个种子图,以表示目标 provenance 模式(例如 Wikipedia 中的文档修订),从而引导图的结构。
- 通过自定义领域特定语言(DSL),用户可指定节点和边关系的约束,如基数限制或结构规则。
- 图生成通过 Neo4J 中的 Cypher 查询实现,其中重写规则映射到 CREATE 子句,约束映射到 WHERE 子句。
- 生成过程采用基于循环的迭代机制,持续应用规则和约束,直至达到大小或基数限制,或约束阻止进一步操作。
- 约束在每个节点上局部评估,以避免全局验证的复杂性,确保用户定义的属性得以保留。
- 评估通过比较合成图与真实世界 provenance 图之间的统计特征(如平均代理关联数、每个代理的贡献数)进行。
实验结果
研究问题
- RQ1能否生成具有可预测、用户可控的拓扑和统计特性的合成 PROV 图?
- RQ2ProvGen 生成的合成图在多大程度上能模拟真实世界 provenance 图的结构特征?
- RQ3使用领域特定约束语言在控制生成 provenance 图结构方面的有效性如何?
- RQ4ProvGen 是否能够生成适合用于 benchmarking provenance 管理系统的可扩展、大规模 provenance 图?
主要发现
- ProvGen 生成的合成图在关键统计特性上高度复现了真实 Wikipedia provenance 数据的特征,包括每个代理的平均关联数(2.9 对比真实数据中的 2.4)。
- 合成数据集中每个代理平均贡献的不同实体数量(1.8)接近真实数据中的值(1.1),表明用户贡献模式具有现实感。
- 该生成器成功强制执行了用户定义的约束,例如确保每个实体仅被使用一次,如线性 Wikipedia 修订模式所示。
- 该系统展示了使用 Neo4J 后端生成大规模、结构化图的可行性,尽管由于事务性开销,观察到性能瓶颈。
- 使用与真实世界控制集进行统计比较的评估框架,为评估合成 provenance 图的真实性提供了一种可行的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。