Skip to main content
QUICK REVIEW

[论文解读] Labeling Workflow Views with Fine-Grained Dependencies

Zhuowei Bao, Susan B. Davidson|arXiv (Cornell University)|Aug 1, 2012
Scientific Computing and Data Management参考文献 13被引用 4
一句话总结

本文提出了一种视图自适应的动态标注方案,用于在具有细粒度依赖关系和灰盒视图的工作流证明图中高效评估可达性查询。通过静态标注视图并动态标注执行过程中的数据项,该方法实现了紧凑的对数大小标签和常数时间的查询评估,适用于一大类递归工作流,相较于先前技术在标签大小和查询效率方面均有显著提升,尤其在处理多个视图时表现更优。

ABSTRACT

This paper considers the problem of efficiently answering reachability queries over views of provenance graphs, derived from executions of workflows that may include recursion. Such views include composite modules and model fine-grained dependencies between module inputs and outputs. A novel view-adaptive dynamic labeling scheme is developed for efficient query evaluation, in which view specifications are labeled statically (i.e. as they are created) and data items are labeled dynamically as they are produced during a workflow execution. Although the combination of fine-grained dependencies and recursive workflows entail, in general, long (linear-size) data labels, we show that for a large natural class of workflows and views, labels are compact (logarithmic-size) and reachability queries can be evaluated in constant time. Experimental results demonstrate the benefit of this approach over the state-of-the-art technique when applied for labeling multiple views.

研究动机与目标

  • 为解决在具有细粒度输入-输出依赖关系的工作流中高效回答可达性查询的挑战。
  • 支持多个视图(尤其是抽象视图和安全视图),其中依赖关系可显式建模为白盒、灰盒或黑盒。
  • 克服现有动态标注方案的局限性,后者假设依赖关系为黑盒,无法处理细粒度或视图特定的依赖关系。
  • 在管理多个视图时降低标注开销和索引维护成本,避免对每个视图重新标注数据项。
  • 在自然类别的递归工作流中实现紧凑的对数大小数据标签和常数时间的可达性评估。

提出的方法

  • 提出一种视图自适应的标注方案,将视图规范的静态标注与工作流执行期间数据项的动态标注分离。
  • 使用视图依赖结构的压缩解析树表示,生成紧凑的对数大小数据标签。
  • 通过预计算并存储的可达性矩阵,编码模块输入与输出之间的细粒度依赖关系。
  • 通过允许在视图中添加虚假依赖关系,支持灰盒依赖,从而实现隐私保护的证明建模。
  • 通过比较标签实现常数时间的可达性查询,其中标签比较用于判断一个数据项的标签是否隐含从另一个数据项可达。
  • 通过无矩阵 FVL 优化查询性能,避免在依赖关系完整(即黑盒)时的冗余矩阵乘法。

实验结果

研究问题

  • RQ1能否设计一种标注方案,高效支持在递归工作流中具有细粒度依赖关系的视图的可达性查询?
  • RQ2如何使动态标注具有视图自适应性,以避免对每个视图重新标注数据项?
  • RQ3视图特定依赖关系(如灰盒)对标签大小和查询性能有何影响?
  • RQ4能否为一类自然的工作流实现紧凑的(对数大小)标签,从而实现常数时间的查询评估?
  • RQ5所提方法在视图数量、模块度和嵌套深度增加时的可扩展性如何?

主要发现

  • 对于具有安全视图的一类严格线性递归工作流,所提出的 FVL 方案生成紧凑的对数大小数据标签,支持常数时间的可达性查询。
  • 在 FVL 中,每个数据项的总标签长度在多个视图下保持恒定,而基线 DRL 方法的标签长度随视图数量线性增长。
  • 当视图数量超过三个时,FVL 的标注开销显著低于 DRL,且构建时间更短。
  • FVL 的查询时间在粗粒度视图上约为 DRL 的四倍,但优化后的无矩阵 FVL 变体实现了与 DRL 几乎相同的查询性能。
  • 嵌套深度对数据标签长度具有线性影响,因为其增加了标签构造中使用的压缩解析树的深度。
  • 模块度对查询时间具有近似线性的影响,这是由于标签解码过程中矩阵乘法成本的增加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。