QUICK REVIEW
[论文解读] Fine-grained parallelization of similarity search between protein sequences
Van Hoa Nguyen, Dominique Lavenier|ArXiv.org|Apr 23, 2008
Genomics and Phylogenetic Studies参考文献 15被引用 4
一句话总结
本文提出了PLAST-P、TPLAST-N和PLAST-X——针对多核CPU和GPU高度优化的细粒度并行实现,用于蛋白质和核酸序列相似性搜索算法。通过利用SIMD指令、GPU加速以及基于子集种子的高效索引,这些工具在保持与NCBI BLAST相当的敏感性和输出格式的同时,实现了5倍至10倍的加速。
ABSTRACT
This report presents the implementation of a protein sequence comparison algorithm specifically designed for speeding up time consuming part on parallel hardware such as SSE instructions, multicore architectures or graphic boards. Three programs have been developed: PLAST-P, TPLAST-N and PLAST-X. They provide equivalent results compared to the NCBI BLAST family programs (BLAST-P, TBLAST-N and BLAST-X) with a speed-up factor ranging from 5 to 10.
研究动机与目标
- 应对因数据量呈指数级增长而导致的大规模基因组数据库搜索带来的计算负担日益增加的问题。
- 突破顺序BLAST实现方式在密集序列比对工作负载中的性能瓶颈。
- 开发BLAST的并行化替代方案,在显著缩短执行时间的同时保持敏感性和输出兼容性。
- 利用现代并行硬件(如多核CPU和GPU)实现蛋白质和核酸数据库中高效相似性搜索。
- 通过子集种子索引和细粒度并行化策略,优化内存访问和算法各阶段性能。
提出的方法
- 设计一个受BLAST启发的五阶段流水线:索引构建、命中检测、无间隙延伸、有间隙延伸和回溯。
- 在CPU上使用SIMD指令(SSE)实现细粒度并行化,支持16位和8位整数运算。
- 将关键阶段(尤其是无间隙和小有间隙比对)移植到GPU上,利用CUDA实现大规模并行处理。
- 集成多核与GPU混合执行模型,结合线程级并行与数据级并行。
- 使用子集种子优化命中检测阶段的内存访问,并减少早期过滤阶段的假阳性结果。
- 保持与BLAST的-m 8输出格式向后兼容,便于无缝集成到生物信息学工作流中。
实验结果
研究问题
- RQ1使用SIMD和GPU架构进行细粒度并行化,是否能显著加速蛋白质和核酸相似性搜索,同时不牺牲敏感性?
- RQ2PLAST-P、TPLAST-N和PLAST-X在不同输入大小和硬件配置下,与NCBI BLAST的对应版本相比性能如何?
- RQ3子集种子和优化索引在大规模序列比对中,对内存访问和过滤效率的提升程度如何?
- RQ4与BLAST相比,优化后的PLAST流水线在检测生物相关比对时是否存在敏感性损失?
- RQ5在混合执行模型中结合多核与GPU加速,所能实现的最大加速比是多少?
主要发现
- 在10,000条序列的数据集上,使用多GPU配置时,PLAST-X相较于多核BLAST-X实现了5.5倍至6倍的加速。
- 在10,000条序列的数据集上,GPU加速的PLAST-X将无间隙比对时间从无优化时的1.99秒降低至0.31秒。
- PLAST-X的敏感性与BLAST-X高度一致,10,000条序列在10%阈值下,98.5%的比对被成功恢复。
- 所有实现中,第二阶段(无间隙延伸)的选择性均得以保持,成功率在0.132%至0.168%之间,具体取决于优化程度。
- 多核+GPU混合版本的PLAST-X表现最佳,在10,000条序列数据集上,将总执行时间从BLAST-X的7,550秒减少至1,531秒。
- PLAST-X的8位SIMD优化版本在10,000条序列上,无间隙比对的加速比达到12.05倍,相较于未优化版本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。