[论文解读] MapSQ: A MapReduce-based Framework for SPARQL Queries on GPU
MapSQ 是一种基于 MapReduce 的 GPU 加速框架,用于在大规模 RDF 数据集上高效处理 SPARQL 查询。它利用 GPU 并行计算实现 MapReduce 风格的连接操作,并采用 CPU-GPU 协同处理模型,相较于基于 CPU 的 gStore 和 gStoreD 引擎,最高可实现 50% 的性能提升。
In this paper, we present a MapReduce-based framework for evaluating SPARQL queries on GPU (named MapSQ) to large-scale RDF datesets efficiently by applying both high performance. Firstly, we develop a MapReduce-based Join algorithm to handle SPARQL queries in a parallel way. Secondly, we present a coprocessing strategy to manage the process of evaluating queries where CPU is used to assigns subqueries and GPU is used to compute the join of subqueries. Finally, we implement our proposed framework and evaluate our proposal by comparing with two popular and latest SPARQL query engines gStore and gStoreD on the LUBM benchmark. The experiments demonstrate that our proposal MapSQ is highly efficient and effective (up to 50% speedup).
研究动机与目标
- 解决在纯 CPU 架构上处理大规模 SPARQL 查询时日益突出的性能瓶颈问题。
- 利用 GPU 并行计算加速 SPARQL 查询评估中计算密集型的连接操作。
- 设计一种混合 CPU-GPU 架构,其中 CPU 负责查询分解,GPU 负责加速结果连接。
- 通过现代异构计算技术,提升大规模 RDF 工作负载下 SPARQL 查询处理的效率与可扩展性。
提出的方法
- 在 GPU 上设计基于 MapReduce 的连接算法,以并行处理 SPARQL 三元组模式产生的中间结果。
- 在 Map 阶段使用基于标志的标记方法(LEFT/RIGHT),以在 Reduce 阶段实现高效的重复项减少。
- 实现一种协同处理策略:CPU 负责分发子查询,GPU 使用 GPU 优化的 MapReduce 执行连接计算。
- 将框架与 gStore 和 gStoreD 集成作为后端引擎,用于 RDF 存储和初始部分匹配。
- 应用 GPU 单指令多数据(SIMD)架构,以加速连接处理过程中的笛卡尔积操作。
- 将框架划分为两个阶段:(1) 由 CPU 执行三元组模式的部分匹配;(2) 由 GPU 加速的 MapReduce 结果连接。
实验结果
研究问题
- RQ1基于 GPU 加速的 MapReduce 框架能否显著提升大规模 RDF 数据集上 SPARQL 查询评估的性能?
- RQ2基于 GPU 的 MapReduce 连接与传统基于 CPU 的连接算法在 SPARQL 引擎中的性能表现如何比较?
- RQ3混合 CPU-GPU 架构在多大程度上能够减少复杂 SPARQL 查询的端到端响应时间?
- RQ4所提出的框架在数据集规模和查询复杂度增加时是否能有效扩展?
主要发现
- 在 LUBM 基准测试中,MapSQ 相较于 gStore 最高实现了 50% 的查询响应时间加速。
- 对于查询 Q4,MapSQ 将响应时间从 gStore 的 635 ms 降低至 339 ms,性能提升达 46.6%。
- 在所有五个基准查询中,该框架均优于 gStoreD,加速比范围为 1.15× 至 2.05×。
- 在中间结果集较大的复杂查询中,性能提升最为显著,凸显了 GPU 的可扩展性优势。
- 基于 GPU 的 MapReduce 连接算法在减少连接时间方面,比 gStore 和 gStoreD 中原生的 CPU 连接更有效。
- 协同处理模型成功将计算密集型的连接操作卸载至 GPU,显著降低 CPU 开销并最大化吞吐量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。