[论文解读] Graph Partitioning with Acyclicity Constraints
本文提出了一种针对异构嵌入式多处理器的新型图划分方法,强制实现块间依赖的无环性——这是在资源受限平台上支持顺序执行的关键约束。作者证明该问题为NP完全问题,并提出了高效的启发式算法(简单移动、自适应移动、贪婪移动),显著降低了通信量和执行时间,边割减少高达30%,并在大规模图上展现出良好的可扩展性。
Graphs are widely used to model execution dependencies in applications. In particular, the NP-complete problem of partitioning a graph under constraints receives enormous attention by researchers because of its applicability in multiprocessor scheduling. We identified the additional constraint of acyclic dependencies between blocks when mapping computer vision and imaging applications to a heterogeneous embedded multiprocessor. Existing algorithms and heuristics do not address this requirement and deliver results that are not applicable for our use-case. In this work, we show that this more constrained version of the graph partitioning problem is NP-complete and present heuristics that achieve a close approximation of the optimal solution found by an exhaustive search for small problem instances and much better scalability for larger instances. In addition, we can show a positive impact on the schedule of a real imaging application that improves communication volume and execution time.
研究动机与目标
- 解决现有算法中缺乏对用于计算机视觉和成像应用的异构嵌入式多处理器图划分中无环性约束的问题。
- 识别并形式化图划分问题的一个新变体,其约束为块间依赖必须无环,以支持顺序执行。
- 设计可扩展的启发式算法,在无环性约束下生成高质量的划分,从而改善通信量和执行时间。
- 在真实成像应用中展示所提方法的实际影响,表明其在调度效率方面有可测量的提升,并减少了调度组数量。
提出的方法
- 将来自OpenVX(有向无环图)的应用图转换为同步数据流(SDF)表示,其中节点表示核函数,边表示带大小标注的数据缓冲区。
- 通过确保划分后块之间不存在环路,强制在商图中实现无环性,这对目标硬件上的顺序执行至关重要。
- 设计并实现三种启发式算法——简单移动(SM)、自适应移动(AM)和贪婪移动(GM)——通过最小化边割来迭代改进划分质量,同时遵守无环性约束。
- 每轮启发式算法运行设置一分钟的时间预算,并逐步增加程序大小容忍度(ε),以适应编译器优化带来的最终程序内存使用量减少。
- 以两轮方式应用启发式算法:第一轮将图划分为大小均衡且块间通信最少的块;第二轮将块聚合成调度组,以最小化外部内存传输。
- 使用最多包含2^22个节点的随机几何图(rggX)评估可扩展性,图的方向从编号较小的节点指向较大的节点,以确保无环性,并在不同规模的问题上测量性能。
实验结果
研究问题
- RQ1具有块间无环性约束的图划分问题是否为NP完全问题?
- RQ2能否设计出高效的启发式算法来近似满足该约束下的最优解,尤其是在缺乏现有解决方案的情况下?
- RQ3与真实成像工作负载中的人工划分相比,所提出的启发式算法在降低通信量和执行时间方面有多大程度的改善?
- RQ4随着图规模增大,这些启发式算法在运行时间和边割减少方面的可扩展性如何?
- RQ5由于边割减少导致的调度组数量减少,是否能在带宽非瓶颈的情况下提升执行时间?
主要发现
- 无环性约束的图划分问题被证明为NP完全问题,且难以近似,这为采用启发式方法提供了合理性。
- 所有提出的启发式算法(SM、AM、GM)相比基线,1级边割均至少减少30%,显著降低了通信量。
- 自适应移动(AM)启发式算法因边割更低而减少了调度组数量,即使在计算受限场景下也实现了执行时间的改善。
- 贪婪移动(GM)启发式算法进一步减少了边割,但对计算密集型核函数的负载平衡较差,导致调度时间未见改善。
- 在大规模随机几何图(最多2^22个节点)上,启发式算法与问题规模呈线性可扩展,运行时间成比例增长,且边割改善保持一致。
- 在真实成像应用中,所提启发式算法生成的调度在带宽受限平台上表现更优,且在计算受限平台上可能更快,展现出实际影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。