Skip to main content
QUICK REVIEW

[論文レビュー] Conformal Computing: Algebraically connecting the hardware/software boundary using a uniform approach to high-performance computation for software and hardware applications

Lenore Mullin, James E. Raynolds|ArXiv.org|Mar 17, 2008
Quantum Computing Algorithms and Architecture参考文献 2被引用数 8
ひとこと要約

この論文は、Mathematics of Arrays (MoA) および ψ-calculus を用いた形式的代数的アプローチ、すなわちコンフォーマルコンピューティングを紹介する。この手法により、ハードウェアとソフトウェアの最適化を統合し、ψ-還元を用いた数学的に証明可能な高性能コード生成が可能となり、データアクセスパターンの再構築と実装間のアルゴリズム的同等性の証明により、キャッシュ最適化されたFFTで2–4倍の高速化を達成する。

ABSTRACT

We present a systematic, algebraically based, design methodology for efficient implementation of computer programs optimized over multiple levels of the processor/memory and network hierarchy. Using a common formalism to describe the problem and the partitioning of data over processors and memory levels allows one to mathematically prove the efficiency and correctness of a given algorithm as measured in terms of a set of metrics (such as processor/network speeds, etc.). The approach allows the average programmer to achieve high-level optimizations similar to those used by compiler writers (e.g. the notion of "tiling"). The approach presented in this monograph makes use of A Mathematics of Arrays (MoA, Mullin 1988) and an indexing calculus (i.e. the psi-calculus) to enable the programmer to develop algorithms using high-level compiler-like optimizations through the ability to algebraically compose and reduce sequences of array operations. Extensive discussion and benchmark results are presented for the Fast Fourier Transform and other important algorithms.

研究の動機と目的

  • 高性能コンピューティングのための形式的で代数的な枠組みを構築し、ハードウェア/ソフトウェアの境界を統合すること。
  • メモリおよびプロセッサの階層をまたがる配列アルゴリズムの体系的かつ数学的に証明可能な最適化を可能にすること。
  • キャッシュおよび分散メモリに最適化された高性能FFTの実装を通じて、この手法の有効性を示すこと。
  • コード生成、同等性の証明、および将来の量子システムを含むさまざまなアーキテクチャへの移植性をサポートする形式的記述を提供すること。
  • 表現テンプレートなどの既存の高水準プログラミング抽象化に、正しさとパフォーマンスを保証する形式的還元規則を拡張すること。

提案手法

  • 多変数配列およびその操作を形式的代数的枠組みで表現するため、Mathematics of Arrays (MoA) を用いる。
  • ψ-calculus を用いて要素ごとのアクセスとインデクシングを表現し、配列式の代数的合成および還元を可能にする。
  • reshape、transpose、バタフライ再配置といった主要な操作を、ψ-還元を用いて表現・最適化し、操作正規形(ONF)を導出する。
  • ONF は、効率的なコード生成のための数学的指針を提供し、最適化された低レベル実装に直接マッピング可能である。
  • 記述正規形(DNF)および操作正規形(ONF)を用いて、同等性の正式な証明とデータアクセスパターンの最適化を行う。
  • ハイパーキューブインデクシングを用いて、キャッシュラインサイズおよびメモリ帯域幅に適合する形状に配列を再構成し、遅延を最小限に抑え、局所性を最大化する。

実験結果

リサーチクエスチョン

  • RQ1アルゴリズム的論理とハードウェアメモリ階層を同時に記述できる一貫性のある代数的形式的記述をどのように構築できるか?
  • RQ2ψ-還元を用いて、FFT などの最適化された配列アルゴリズムの正式な導出と正しさの証明が可能か?
  • RQ3この形式的記述が、手動で最適化されたライブラリルーチンと同等またはそれ以上のパフォーマンスを達成できる範囲はどの程度か?
  • RQ4量子シミュレーションにおけるような、任意の配列アクセスパターンをサポートするには、この手法をどのように拡張できるか?
  • RQ5MPI や OpenMP、ハードウェアアクセラレータを含む多様なターゲットに対して、このアプローチが最適化されたコードの自動生成を可能にするか?

主な発見

  • コンフォーマルコンピューティングを用いたキャッシュ最適化FFTは、以前に発表された研究および高度に最適化されたライブラリルーチンよりも2〜4倍の高速化を達成した。
  • ψ-還元プロセスにより、操作正規形(ONF)の正式な導出が可能となり、これは直接的に効率的なコード生成を規定する。
  • この手法により、演算の代数的合成によって不要な一時的配列の削除が可能となり、メモリ効率が向上した。
  • ハイパーキューブインデクシングのアプローチにより、キャッシュラインサイズおよびメモリ帯域幅に適合するデータアクセスパターンの効率的再編成が可能となった。
  • 形式的記述により、高水準式と低レベル実装との間のアルゴリズム的同等性の数学的証明が可能となった。
  • このアプローチは、量子シミュレータへの応用においても成功しており、インデックスベクトルの操作を通じて、スパース行列の効率的アクセスとブロック対角化を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。