Skip to main content
QUICK REVIEW

[論文レビュー] Improved Parallel Cache-Oblivious Algorithms for Dynamic Programming and Linear Algebra

Guy E. Blleloch, Yan Gu|arXiv (Cornell University)|Sep 25, 2018
Parallel Computing and Optimization Techniques参考文献 90被引用数 5
ひとこと要約

本稿では、NVRAM などの非対称メモリシステムにおいて、動的計画法および線形代数のキャッシュオーバーサイアスアルゴリズムを統合的・最適化的に扱うための新規な抽象化「k-d グリッド」を導入する。著者らは、下界を確立し、k-d グリッドの書き込み効率の良いアルゴリズムを設計することで、対称的および非対称的キャッシュ複雑性の向上を達成し、APSP や行列乗算、ナップサック再帰など、I/O 効率および並列性において漸近的な改善を実現する。

ABSTRACT

Emerging non-volatile main memory (NVRAM) technologies provide byte-addressability, low idle power, and improved memory-density, and are likely to be a key component in the future memory hierarchy. However, a critical challenge in achieving high performance is in accounting for the asymmetry that NVRAM writes can be significantly more expensive than NVRAM reads. In this paper, we consider a large class of cache-oblivious algorithms for dynamic programming (DP) and linear algebra, and try to reduce the writes in the asymmetric setting while maintaining high parallelism. To achieve that, our key approach is to show the correspondence between these problems and an abstraction for their computation, which is referred to as the $k$-d grids. Then by showing lower bound and new algorithms for computing $k$-d grids, we show a list of improved cache-oblivious algorithms of many DP recurrences and in linear algebra in the asymmetric setting, both sequentially and in parallel. Surprisingly, even without considering the read-write asymmetry (i.e., setting the write cost to be the same as the read cost in the algorithms), the new algorithms improve the existing cache complexity of many problems. We believe the reason is that the extra level of abstraction of $k$-d grids helps us to better understand the complexity and difficulties of these problems. We believe that the novelty of our framework is of interests and leads to many new questions for future work.

研究の動機と目的

  • 書き込みが読み込みよりも著しく高コストであるとされる新興の NVRAM システムにおける性能ボトルネックを解消すること。
  • 非対称メモリ環境下での動的計画法および線形代数のキャッシュオーバーサイアスアルゴリズムの I/O 効率を向上させること。
  • 広範なアルゴリズムクラスにわたる対称的および非対称的キャッシュ複雑性を統一的に分析・最適化するフレームワークを構築すること。
  • 永続メモリワークロードにおいて極めて重要な、高並列性と書き込み回数の最小化を両立させること。
  • APSP や行列乗算、ナップサック再帰といった問題に対する理論的基盤および実用的なアルゴリズム的改善を提供すること。

提案手法

  • 分割統治型動的計画法および線形代数アルゴリズムにおける計算を表現するための統一的モデルとして、k-d グリッド抽象化を導入する。
  • 対称的および非対称的コストモデル下での k-d グリッド計算の I/O 複雑性に対する下界を確立する。
  • 非対称設定下で書き込み回数を最小化しつつ、高い並列性を維持する新しいキャッシュオーバーサイアスアルゴリズムを設計する。
  • APSP や行列乗算といった問題の再帰的・分割統治的構造を活用し、それらを k-d グリッド計算パターンにマッピングする。
  • k-d グリッドのキャッシュ複雑性を用いて、全ペア最短経路や組合せ的行列乗算といった上位レベルの問題に対する境界を導出する。
  • CBCO(定数分岐、キャッシュオーバーサイアス)パラダイムを適用し、妥当な仮定の下で提案アルゴリズムの最適性を証明する。

実験結果

リサーチクエスチョン

  • RQ1非対称メモリシステムにおいて、最適な I/O 複雑性を達成する書き込み効率的でキャッシュオーバーサイアスな動的計画法および線形代数アルゴリズムを設計できるか?
  • RQ2k-d グリッド抽象化は、分割統治型アルゴリズムの広範なクラスの統一的かつ簡素化された分析に十分な力を持つか?
  • RQ3書き込み非対称性を考慮した k-d グリッド計算の I/O 複雑性に対する下界を証明できるか?
  • RQ4提案されたアルゴリズムは、APSP や行列乗算といった問題に対して、対称的および非対称的両設定で漸近的に最適であると証明できるか?
  • RQ5このフレームワークは、正方形でない、あるいは不規則な k-d グリッド形状へと拡張可能か?その場合、テンソル代数その他の応用にどのような影響を及えるか?

主な発見

  • 本稿では、k-d グリッド計算の対称的キャッシュ複雑性が Θ(C / (B M^{1-1/k})) であることを確立している。ここで C はアルゴリズム的命令数を表す。
  • 非対称設定では、キャッシュ複雑性が Θ(ω^{1/k} C / (B M^{1-1/k})) に改善され、最適な書き込み効率が達成されている。ここで ω は書き込みコスト乗数を表す。
  • APSP や行列乗算のための提案アルゴリズムは、最良の既知のキャッシュアウェアアルゴリズムと同等の漸近的 I/O 複雑性を達成しているが、キャッシュパラメータの知識を必要としない。
  • このフレームワークは、対称的ケースにおいても既存のキャッシュオーバーサイアスアルゴリズムを上回っており、k-d グリッド抽象化がアルゴリズム的複雑性のより深い構造的洞察を明らかにしている可能性を示唆している。
  • GAP 再帰に対しては、I/O コストに追加の O((n² log M)/B) 項が生じており、これを除去する問題は未解決のまま残っている。
  • 並列的対称的キャッシュ複雑性は Q₁ + O(p D M / B) で上限づけられており、著者らは k-d グリッドに対してこの加法的項を O(p M / B) に改善できると仮説を立てており、よりタイトな並列 I/O 界の可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。