[论文解读] Benchmarking 50-Photon Gaussian Boson Sampling on the Sunway TaihuLight
本文在神威·太湖之光超级计算机上实现了对50光子高斯玻色采样(Gaussian Boson Sampling)的高性能经典模拟,128位精度下达到2.78 PFLOPS,256位精度下达到1.27 PFLOPS。通过结合负载均衡的并行方案、基于有向无环图(DAG)的指令调度以及面向架构的多精度定点数设计,作者在128位精度下耗时20小时、256位精度下耗时2天,完成了一次100×100托伦蒂安函数(Torontonian function)的计算,为经典模拟量子采样问题设立了新基准。
Boson sampling is expected to be one of an important milestones that will demonstrate quantum supremacy. The present work establishes the benchmarking of Gaussian boson sampling (GBS) with threshold detection based on the Sunway TaihuLight supercomputer. To achieve the best performance and provide a competitive scenario for future quantum computing studies, the selected simulation algorithm is fully optimized based on a set of innovative approaches, including a parallel scheme and instruction-level optimizing method. Furthermore, data precision and instruction scheduling are handled in a sophisticated manner by an adaptive precision optimization scheme and a DAG-based heuristic search algorithm, respectively. Based on these methods, a highly efficient and parallel quantum sampling algorithm is designed. The largest run enables us to obtain one Torontonian function of a 100 x 100 submatrix from 50-photon GBS within 20 hours in 128-bit precision and 2 days in 256-bit precision.
研究动机与目标
- 建立面向50光子高斯玻色采样(GBS)与阈值探测的高性能经典基准。
- 突破经典超级计算机在高精度量子采样模拟中的计算瓶颈。
- 在神威·太湖之光架构上实现大规模GBS实例模拟的最优性能与足够精度。
- 为未来基于玻色采样的量子优越性演示提供有力的经典基线。
提出的方法
- 采用细粒度负载均衡的并行方案,以最小化缓存存储并最大化神威·太湖之光多核架构下的计算效率。
- 基于有向无环图(DAG)启发式搜索算法的指令级优化策略,用于调度算术操作,实现核内最优执行。
- 利用神威原生大整数指令集,实现面向多精度定点数的算术设计,以支持倒数、开方等高精度运算。
- 采用自适应精度优化框架,通过上下界估计动态选择最优精度模式,兼顾精度与性能。
- 算法全面针对神威·太湖之光的独特架构进行优化,包括对计算核心间同步与数据分布的定制化处理。
- 模拟目标为从50光子GBS实例中提取100×100子矩阵的托伦蒂安函数计算,是量子优越性的重要基准。
实验结果
研究问题
- RQ1经典超级计算机能否以足够精度与性能模拟50光子高斯玻色采样,从而作为量子优越性基准?
- RQ2如何有效结合指令级与数据并行优化,以最大化神威·太湖之光架构上的性能?
- RQ3模拟大规模GBS矩阵的托伦蒂安函数时,需要何种精度水平以确保准确性?该精度如何实现自适应选择?
- RQ4神威·太湖之光上优化后的GBS模拟性能与x86、ARM及GPU平台相比如何?
- RQ5在高精度线性代数核中,负载均衡与指令调度在多大程度上可缓解量子采样计算的性能瓶颈?
主要发现
- 在神威·太湖之光超级计算机上,128位精度下实现2.78 PFLOPS的持续性能,256位精度下实现1.27 PFLOPS。
- 在128位精度下,50光子GBS的100×100子矩阵托伦蒂安函数计算耗时20小时;在256位精度下耗时2天。
- 并行方案在神威·太湖之光的268,800个核心上实现了近乎理想的负载均衡,显著减少了空闲时间与通信开销。
- 基于DAG的指令调度通过优化算术指令排序与减少流水线停顿,有效降低了核内执行时间。
- 自适应精度框架成功平衡了精度与性能,在保持数值可靠性的同时避免了不必要的精度提升。
- 与GPU(Tesla V100)和CPU(x86、ARM)平台相比,基于神威的实现尤其在高精度场景下性能提升三倍以上,212位模式下优势显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。