Skip to main content
QUICK REVIEW

[論文レビュー] Benchmarking 50-Photon Gaussian Boson Sampling on the Sunway TaihuLight

Yuxuan Li, Mingcheng Chen|arXiv (Cornell University)|Sep 2, 2020
Quantum Information and Cryptography参考文献 45被引用数 9
ひとこと要約

本論文は、Sunway TaihuLight スーパーコンピュータ上での50光子ガウシアンボソンサンプリングの高度に最適化された古典的シミュレーションを提示しており、128ビット精度で2.78 PFLOPS、256ビット精度で1.27 PFLOPSの性能を達成した。負荷分散型並列化スキーム、DAGに基づく命令スケジューリング、アーキテクチャ固有の複数精度固定小数点設計を組み合わせることで、100×100のトロントニアン関数を128ビット精度で20時間、256ビット精度で2日間で計算し、量子サンプリング問題の古典的シミュレーションにおける新基準を確立した。

ABSTRACT

Boson sampling is expected to be one of an important milestones that will demonstrate quantum supremacy. The present work establishes the benchmarking of Gaussian boson sampling (GBS) with threshold detection based on the Sunway TaihuLight supercomputer. To achieve the best performance and provide a competitive scenario for future quantum computing studies, the selected simulation algorithm is fully optimized based on a set of innovative approaches, including a parallel scheme and instruction-level optimizing method. Furthermore, data precision and instruction scheduling are handled in a sophisticated manner by an adaptive precision optimization scheme and a DAG-based heuristic search algorithm, respectively. Based on these methods, a highly efficient and parallel quantum sampling algorithm is designed. The largest run enables us to obtain one Torontonian function of a 100 x 100 submatrix from 50-photon GBS within 20 hours in 128-bit precision and 2 days in 256-bit precision.

研究の動機と目的

  • 50光子ガウシアンボソンサンプリング(GBS)に、しきい値検出を伴う高パフォーマンスな古典的ベンチマークを確立すること。
  • 古典的スーパーコンピュータ上で高精度な量子サンプリングをシミュレートする際の計算限界を克服すること。
  • Sunway TaihuLight アーキテクチャ上で大規模なGBSインスタンスをシミュレートするための最適なパフォーマンスと十分な精度を達成すること。
  • ボソンベースのサンプリングを用いた将来の量子優位性の実証に向け、競争力のある古典的ベースラインを提供すること。

提案手法

  • Sunway TaihuLight の多数コアアーキテクチャに最適化された細粒度の負荷分散型並列化スキームを採用し、キャッシュ記憶領域を最小限に抑え、計算効率を最大化した。
  • 算術演算の最適なカーネル実行を実現するため、DAGに基づくヒューリスティック探索アルゴリズムを用いた命令レベル最適化戦略を採用した。
  • Sunway のネイティブな大規模整数命令セットを活用して、逆数や平方根などの高精度演算をサポートする複数精度固定小数点算術設計を実装した。
  • 上界・下界推定を用いた適応的精度最適化フレームワークを構築し、精度とパフォーマンスの最適バランスを図り、不要な精度上昇を回避しながら数値的信頼性を維持した。
  • Sunway TaihuLight の独自アーキテクチャに完全に最適化されたアルゴリズムであり、同期処理やコア間データ配布のカスタム処理を含んでいた。
  • 本シミュレーションは、50光子GBSインスタンスの100×100部分行列に対するトロントニアン関数の計算をターゲットとしており、量子優位性のための重要なベンチマークである。

実験結果

リサーチクエスチョン

  • RQ1古典的スーパーコンピュータは、量子優位性ベンチマークとしての役割を果たすのに十分な精度とパフォーマンスで50光子ガウシアンボソンサンプリングをシミュレートできるか?
  • RQ2Sunway TaihuLight アーキテクチャ上で、命令レベル最適化とデータ並列最適化を効果的に統合することで、パフォーマンスを最大限に引き出せるか?
  • RQ3大規模なGBS行列のトロントニアン関数をシミュレートする際に必要な精度レベルは何か? また、その精度を適応的に選択する方法は何か?
  • RQ4Sunway TaihuLight における最適化されたGBSシミュレーションのパフォーマンスは、x86、ARM、GPUプラットフォームと比較してどの程度優れているか?
  • RQ5負荷分散と命令スケジューリングは、量子サンプリングのための高精度線形代数カーネルにおけるボトルネックをどの程度緩和できるか?

主な発見

  • 本シミュレーションは、Sunway TaihuLight スーパーコンピュータ上で128ビット精度で2.78 PFLOPS、256ビット精度で1.27 PFLOPSの持続的パフォーマンスを達成した。
  • 50光子GBSの100×100部分行列に対するトロントニアン関数は、128ビット精度で20時間、256ビット精度で2日間で計算された。
  • 並列化スキームは、Sunway TaihuLight の268,800コアにわたり、ほぼ理想に近い負荷分散を達成し、無駄な待機時間と通信オーバーヘッドを最小限に抑えた。
  • DAGに基づく命令スケジューリングにより、算術命令の順序最適化とパイipelラインスタールの低減が実現され、カーネル実行時間が短縮された。
  • 適応的精度フレームワークは、精度とパフォーマンスのバランスをうまく保ち、数値的信頼性を維持しながらも、不要な精度上昇を回避した。
  • 特に212ビットモードにおいて、GPU(Tesla V100)およびCPU(x86、ARM)プラットフォームを上回り、3倍以上の性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。