Skip to main content
QUICK REVIEW

[論文レビュー] SZx: an Ultra-fast Error-bounded Lossy Compressor for Scientific Datasets

Xiaodong Yu, Sheng Di|arXiv (Cornell University)|Jan 31, 2022
Advanced Data Storage Technologies被引用数 6
ひとこと要約

本論文は、ビット操作、加算、減算といった軽量な演算のみを用いて、CPUおよびGPUの両方で極めて高速な圧縮・解処理を実現する、誤差制御付きの超高速損失圧縮手法UFZを提案する。UFZはGPU上で最大264GB/sの圧縮速度と446GB/sの解処理速度を達成し、SZやZFPと比較して2–16倍の高速化を実現した。圧縮比と厳密な誤差制御の両方を維持している。

ABSTRACT

Today's scientific high performance computing (HPC) applications or advanced instruments are producing vast volumes of data across a wide range of domains, which introduces a serious burden on data transfer and storage. Error-bounded lossy compression has been developed and widely used in scientific community, because not only can it significantly reduce the data volumes but it can also strictly control the data distortion based on the use-specified error bound. Existing lossy compressors, however, cannot offer ultra-fast compression speed, which is highly demanded by quite a few applications or use-cases (such as in-memory compression and online instrument data compression). In this paper, we propose a novel ultra-fast error-bounded lossy compressor, which can obtain fairly high compression performance on both CPU and GPU, also with reasonably high compression ratios. The key contributions are three-fold: (1) We propose a novel, generic ultra-fast error-bounded lossy compression framework -- called UFZ, by confining our design to be composed of only super-lightweight operations such as bitwise and addition/subtraction operation, still keeping a certain high compression ratio. (2) We implement UFZ on both CPU and GPU and optimize the performance according to their architectures carefully. (3) We perform a comprehensive evaluation with 6 real-world production-level scientific datasets on both CPU and GPU. Experiments show that UFZ is 2~16X as fast as the second-fastest existing error-bounded lossy compressor (either SZ or ZFP) on CPU and GPU, with respect to both compression and decompression.

研究の動機と目的

  • 科学的HPCワークロードにおける超高速損失圧縮の重要なニーズに対応すること、特にメモリ内処理やリアルタイムの計測データ処理を対象とすること。
  • SZ や ZFP などの既存の誤差制御付き圧縮手法が、処理コストの高い演算(例:乗算、除算)に依存しており、スループットに制限を受けるという性能ボトルネックを克服すること。
  • 予測誤差がユーザー指定の範囲内に収まるよう保証する軽量な誤差制御機構を備え、かつ適正な圧縮比を維持しつつ、ビット操作、加算、減算のみに依存する圧縮フレームワークを設計すること。
  • CPUおよびGPUアーキテクチャに特化したパフォーマンスチューニングとメモリアクセスパターン最適化により、UFZフレームワークを両方の環境で最適化すること。
  • Summit や ThetaGPU といったスーパーコンピュータ上で、実運用レベルの科学的データセットを用いて、UFZの実世界におけるHPC環境における優位性を実証すること。

提案手法

  • ビットシフト、加算、減算といった軽量な演算のみに依存する、新しい圧縮フレームワークUFZを設計する。
  • CPUおよびGPUの両方でUFZを実装し、CPUではSIMD並列処理、GPUではスレッドレベルの並列処理を活用して高いスループットを達成する。
  • 整数演算と固定小数点スケーリングを用いて、予測誤差がユーザー指定の範囲内に収まるよう保証する軽量な誤差制御メカニズムを統合する。
  • 除算を含む複雑な演算を避けるために、誤差しきい値に基づく簡素化された量子化スキームを採用する。
  • GPU向けに、レイテンシの低減とスレッド割り当ての最適化、メモリ帯域幅の最大活用を図るために、メモリアクセスパターンとカーネル起動を最適化する。
  • キャッシュに優しい小さなブロック単位でデータを処理する階層的圧縮戦略を採用し、データ局所性と並列効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ビット操作や算術演算といった軽量な演算のみに依存することで、CPUおよびGPU上で超高速なスループットを達成できる損失圧縮フレームワークは実現可能か?
  • RQ2UFZの圧縮および解処理速度は、異なるハードウェアプラットフォーム上で、最先端の圧縮手法(SZおよびZFP)と比較してどの程度優れているか?
  • RQ3実世界の科学的データセットにおいて、UFZは適正な圧縮比を維持しながらも、厳密な誤差制御をどのように保っているか?
  • RQ4大規模HPCシステムにおけるデータダンプおよびロードパイプラインでUFZを使用した場合、エンド・ツー・エンドのI/Oパフォーマンスにどのような影響を与えるか?
  • RQ5CPUおよびGPUを含む異種アーキテクチャ向けにUFZを効率的に最適化できるか?その際、誤差制御や圧縮品質を損なわないか?

主な発見

  • UFZは1つのGPU(A100)で最大264GB/sの圧縮スループットを達成し、CPUおよびGPUの両方で2–16倍の高速化を実現した。
  • GPU上ではUFZは最大446GB/sの解処理速度に達し、cuSZ や cuZFP が達成する9.7–67GB/sと比べて顕著に優れている。
  • CPU上ではUFZはZFPに比べ2.5–5倍、SZに比べ5–7倍の圧縮速度を達成し、解処理では2–4倍の高速化を実現した。
  • ANL ThetaGPU(64–1024コア)上でエンド・ツー・エンドのデータI/Oパイプラインを実行したところ、UFZはSZおよびZFPと比較してデータダンプおよびロードのパフォーマンスを100–200%向上させた。
  • 予測や変換処理の複雑なステップを回避しているにもかかわらず、UFZは妥当な圧縮比(ZFPに比べ0.3–3倍、SZに比べ3–30倍低い)を達成した。
  • パフォーマンスの向上は、高価な演算の排除と、CPUおよびGPUの両方でアーキテクチャに最適化されたカーネルの使用によるものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。