[论文解读] A linear parallel algorithm to compute bisimulation and relational coarsest partitions
本文提出了一种在CRCW PRAM模型上计算强双similarity和关系最粗划分的首个线性时间并行算法,使用最多max(n, m)个处理器,实现O(n + |Act|)的时间复杂度。该算法针对现代并行架构(如GPU)进行了优化,其实际的CUDA实现展示了在真实硬件上的线性性能。
The most efficient way to calculate strong bisimilarity is by calculation the relational coarsest partition on a transition system. We provide the first linear time algorithm to calculate strong bisimulation using parallel random access machines (PRAMs). More precisely, with $n$ states, $m$ transitions and $|\\mathit{Act}|\\leq m$ action labels, we provide an algorithm on $max(n,m)$ processors that calculates strong bisimulation in time $O(n+|\\mathit{Act}|)$ and space $O(n+m)$. The best-known PRAM algorithm has time complexity $O(n\\log n)$ on a smaller number of processors making it less suitable for massive parallel devices such as GPUs. An implementation on a GPU shows that the linear time-bound is achievable on contemporary hardware.
研究动机与目标
- 开发一种用于计算强双similarity和关系最粗划分的并行算法,使其在现代大规模并行硬件上具有高效的可扩展性。
- 通过实现最优的O(n + |Act|)时间复杂度,克服先前PRAM算法O(n log n)时间复杂度的局限性。
- 设计一种实用的、与GPU兼容的实现,以在现代硬件上验证理论性能界限。
- 将算法扩展至处理带动作标签的转移系统(LTSs),同时保持线性时间复杂度。
- 证明在高度并行架构上,P-完全问题(如双similarity)的线性时间并行计算是可行的。
提出的方法
- 该算法基于顺序的Kanellakis-Smolka算法,采用并行划分细化方法,适用于大规模并行计算。
- 采用CRCW PRAM模型,使用max(n, m)个处理器,支持并发读写操作,以高效地进行块细化。
- 采用领导者选举机制,为每个细化后的块选择最小索引的代表,确保在并发写入下的确定性结果。
- 算法并行处理状态和转移,使用共享内存跟踪块成员关系和细化标记。
- 对于带标签的系统,算法独立处理每个动作标签,并将结果合并以计算最终的双similarity划分。
- 将PRAM算法转换为CUDA代码以在GPU上执行,实际中保持线性时间复杂度。
实验结果
研究问题
- RQ1在拥有大量处理器的PRAM模型上,关系最粗划分的并行算法能否实现线性时间复杂度?
- RQ2在支持具有多个动作标签的转移系统时,能否保持线性时间复杂度?
- RQ3该PRAM算法的理论线性时间性能是否能在GPU硬件上实际实现?
- RQ4与现有基于GPU的双similarity工具相比,该算法在时间复杂度和可扩展性方面表现如何?
- RQ5能否通过引入内部动作的传递闭包,将该算法扩展以处理弱或分支双similarity?
主要发现
- 所提出的算法在CRCW PRAM模型中使用max(n, m)个处理器实现了O(n + |Act|)的时间复杂度,相较于先前的O(n log n)界限有显著提升。
- 该算法在工作复杂度上是最优的,其计算工作量不超过顺序的Kanellakis-Smolka算法。
- 在NVIDIA Titan RTX上的CUDA实现表明,该线性时间复杂度在现代GPU硬件上实际可实现。
- 通过独立处理每个动作标签,该算法支持带标签的转移系统,同时保持线性时间复杂度。
- 领导者选举通过并发写入实现,选择最小索引的状态作为块代表,确保在CRCW模型下的正确性。
- 结果表明,P-完全问题(如双similarity)可在现代大规模并行架构(如GPU)上高效并行化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。