Skip to main content
QUICK REVIEW

[论文解读] A linear parallel algorithm to compute bisimulation and relational coarsest partitions

Jan Martens, Jan Friso Groote|arXiv (Cornell University)|May 25, 2021
Ferroelectric and Negative Capacitance Devices参考文献 25被引用 10
一句话总结

本文提出了一种在CRCW PRAM模型上计算强双similarity和关系最粗划分的首个线性时间并行算法,使用最多max(n, m)个处理器,实现O(n + |Act|)的时间复杂度。该算法针对现代并行架构(如GPU)进行了优化,其实际的CUDA实现展示了在真实硬件上的线性性能。

ABSTRACT

The most efficient way to calculate strong bisimilarity is by calculation the relational coarsest partition on a transition system. We provide the first linear time algorithm to calculate strong bisimulation using parallel random access machines (PRAMs). More precisely, with $n$ states, $m$ transitions and $|\\mathit{Act}|\\leq m$ action labels, we provide an algorithm on $max(n,m)$ processors that calculates strong bisimulation in time $O(n+|\\mathit{Act}|)$ and space $O(n+m)$. The best-known PRAM algorithm has time complexity $O(n\\log n)$ on a smaller number of processors making it less suitable for massive parallel devices such as GPUs. An implementation on a GPU shows that the linear time-bound is achievable on contemporary hardware.

研究动机与目标

  • 开发一种用于计算强双similarity和关系最粗划分的并行算法,使其在现代大规模并行硬件上具有高效的可扩展性。
  • 通过实现最优的O(n + |Act|)时间复杂度,克服先前PRAM算法O(n log n)时间复杂度的局限性。
  • 设计一种实用的、与GPU兼容的实现,以在现代硬件上验证理论性能界限。
  • 将算法扩展至处理带动作标签的转移系统(LTSs),同时保持线性时间复杂度。
  • 证明在高度并行架构上,P-完全问题(如双similarity)的线性时间并行计算是可行的。

提出的方法

  • 该算法基于顺序的Kanellakis-Smolka算法,采用并行划分细化方法,适用于大规模并行计算。
  • 采用CRCW PRAM模型,使用max(n, m)个处理器,支持并发读写操作,以高效地进行块细化。
  • 采用领导者选举机制,为每个细化后的块选择最小索引的代表,确保在并发写入下的确定性结果。
  • 算法并行处理状态和转移,使用共享内存跟踪块成员关系和细化标记。
  • 对于带标签的系统,算法独立处理每个动作标签,并将结果合并以计算最终的双similarity划分。
  • 将PRAM算法转换为CUDA代码以在GPU上执行,实际中保持线性时间复杂度。

实验结果

研究问题

  • RQ1在拥有大量处理器的PRAM模型上,关系最粗划分的并行算法能否实现线性时间复杂度?
  • RQ2在支持具有多个动作标签的转移系统时,能否保持线性时间复杂度?
  • RQ3该PRAM算法的理论线性时间性能是否能在GPU硬件上实际实现?
  • RQ4与现有基于GPU的双similarity工具相比,该算法在时间复杂度和可扩展性方面表现如何?
  • RQ5能否通过引入内部动作的传递闭包,将该算法扩展以处理弱或分支双similarity?

主要发现

  • 所提出的算法在CRCW PRAM模型中使用max(n, m)个处理器实现了O(n + |Act|)的时间复杂度,相较于先前的O(n log n)界限有显著提升。
  • 该算法在工作复杂度上是最优的,其计算工作量不超过顺序的Kanellakis-Smolka算法。
  • 在NVIDIA Titan RTX上的CUDA实现表明,该线性时间复杂度在现代GPU硬件上实际可实现。
  • 通过独立处理每个动作标签,该算法支持带标签的转移系统,同时保持线性时间复杂度。
  • 领导者选举通过并发写入实现,选择最小索引的状态作为块代表,确保在CRCW模型下的正确性。
  • 结果表明,P-完全问题(如双similarity)可在现代大规模并行架构(如GPU)上高效并行化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。