Skip to main content
QUICK REVIEW

[论文解读] Parallel Local Search: Experiments with a PGAS-based programming model

Rui Machado, Salvador Abreu|arXiv (Cornell University)|Jan 31, 2013
Constraint Satisfaction and Optimization参考文献 13被引用 5
一句话总结

本文提出了一种基于PGAS的自适应搜索局部搜索算法并行化方法,采用GPI编程模型,在大规模系统上实现了高效、可扩展的执行。该方法通过智能传播有前景的配置,使某些基准测试的性能提升最高达2倍,性能增益强烈依赖于问题特异性特征,如邻域密度和局部极小值数量。

ABSTRACT

Local search is a successful approach for solving combinatorial optimization and constraint satisfaction problems. With the progressing move toward multi and many-core systems, GPUs and the quest for Exascale systems, parallelism has become mainstream as the number of cores continues to increase. New programming models are required and need to be better understood as well as data structures and algorithms. Such is the case for local search algorithms when run on hundreds or thousands of processing units. In this paper, we discuss some experiments we have been doing with Adaptive Search and present a new parallel version of it based on GPI, a recent API and programming model for the development of scalable parallel applications. Our experiments on different problems show interesting speedups and, more importantly, a deeper interpretation of the parallelization of Local Search methods.

研究动机与目标

  • 解决大规模、多核系统上局部搜索算法的可扩展性限制。
  • 研究不同问题特征如何影响并行局部搜索的性能。
  • 设计并评估基于GPI编程模型的自适应搜索新型通信与负载均衡策略。
  • 基于在多样化组合问题上的实证结果,深化对局部搜索方法并行化的理解。

提出的方法

  • 作者使用GPI(全局地址空间编程接口)API实现了一种新的自适应搜索算法并行版本,该API基于PGAS模型,支持单边、非阻塞内存操作。
  • 该方法提出一种新颖的通信机制——传播-优化-收集(PoC),通过线程间共享有前景的配置,实现协作式探索。
  • GPI的单边通信和基于RDMA的网络访问支持,可在无CPU干预的情况下实现高效的远程内存访问,提升可扩展性并减少同步开销。
  • 通过选择性传播高质量配置,避免冗余工作,每个线程从接收的状态独立探索。
  • 通过多核线程包(MCTP)使用线程池,高效利用多核架构。
  • 实验在三个基准问题上进行:魔方阵、Costas阵列和全区间序列,性能与独立多路搜索及TDO变体进行对比。

实验结果

研究问题

  • RQ1并行局部搜索在具有不同结构特性的组合问题上的性能表现如何变化?
  • RQ2通过PoC传播配置对局部搜索算法的可扩展性和加速比有何影响?
  • RQ3邻域密度、局部极小值数量和部分重置等特征如何影响协作式并行化的有效性?
  • RQ4GPI编程模型能否有效支持可扩展、高性能的局部搜索,且同步开销最小化?
  • RQ5在负载均衡和冗余方面,独立搜索与配置共享策略之间存在哪些权衡?

主要发现

  • 在魔方阵问题上,PoC变体因邻域密集且局部极小值数量少,实现了最高2倍的加速,有利于有效协作。
  • 在Costas阵列问题上,PoC变体表现较差,因局部极小值数量高且邻域稀疏,导致冗余工作多,配置传播收益有限。
  • 全区间序列问题表现出混合行为:在核心数较少时,PoC因开销过大而表现更差;但在大规模下性能提升,表明通过多样化实现了并行成本的分摊。
  • TDO变体在Costas阵列问题上表现出更好的可扩展性,因为增加核心数可扩大搜索空间覆盖范围,且冗余度不高。
  • 性能增益与问题结构密切相关:邻域密集的问题有利于协作,而稀疏或高度多峰的问题则更适合独立探索。
  • 本研究表明,有效的局部搜索并行化需要将通信策略与问题特异性特征(如邻域密度和局部极小值频率)相匹配。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。