Skip to main content
QUICK REVIEW

[논문 리뷰] MGARD+: Optimizing Multilevel Methods for Error-bounded Scientific Data Reduction

Xin Liang, Ben Whitney|arXiv (Cornell University)|2020. 10. 12.
Advanced Data Compression Techniques참고 문헌 23인용 수 4
한 줄 요약

MGARD+는 다중 수준 계수 양자화와 적응형 다중 수준 분해를 도입하여 과학 데이터에 대한 고성능, 오차 제한 있는 손실 압축 프레임워크를 제안한다. 이로 인해 동일한 왜곡 수준에서 최대 2배 높은 압축 비율과 70배 빠른 분해/재구성 속도를 달성한다.

ABSTRACT

Data management is becoming increasingly important in dealing with the large amounts of data produced by large-scale scientific simulations and instruments. Existing multilevel compression algorithms offer a promising way to manage scientific data at scale, but may suffer from relatively low performance and reduction quality. In this paper, we propose MGARD+, a multilevel data reduction and refactoring framework drawing on previous multilevel methods, to achieve high-performance data decomposition and high-quality error-bounded lossy compression. Our contributions are four-fold: 1) We propose a level-wise coefficient quantization method, which uses different error tolerances to quantize the multilevel coefficients. 2) We propose an adaptive decomposition method which treats the multilevel decomposition as a preconditioner and terminates the decomposition process at an appropriate level. 3) We leverage a set of algorithmic optimization strategies to significantly improve the performance of multilevel decomposition/recomposition. 4) We evaluate our proposed method using four real-world scientific datasets and compare with several state-of-the-art lossy compressors. Experiments demonstrate that our optimizations improve the decomposition/recomposition performance of the existing multilevel method by up to 70X, and the proposed compression method can improve compression ratio by up to 2X compared with other state-of-the-art error-bounded lossy compressors under the same level of data distortion.

연구 동기 및 목표

  • HPC 시뮬레이션과 실험 장치에서 발생하는 대규모 과학 데이터를 관리하는 데 있어 저장 및 분석 비용이 지나치게 높아지는 문제를 해결한다.
  • 기존의 다중 수준 압축 방법은 고비율에서 성능이 낮고 압축 품질이 최적화되지 않아 발생하는 한계를 극복한다.
  • 오차 제한을 엄격히 유지하면서도 다중 수준 데이터 감소의 압축 비율과 계산 처리량을 모두 향상시킨다.
  • 계층적 구성 요소의 부분적 재구성을 지원함으로써 효율적인 데이터 재구성(Refactoring)을 가능하게 한다. 이는 전체 재구성을 거치지 않고도 경량의 후행 분석을 수행할 수 있도록 한다.
  • 실제 과학 워크로드에 적합한 다중 수준 분해와 최적화된 양자화, 성능 향상 기법을 통합한 프레임워크를 개발한다.

제안 방법

  • 각 다중 수준 해상도의 계수에 대해 다른 오차 허용 범위를 적용하는 수준별 계수 양자화를 도입하여 스케일 간 오차 분포를 최적화한다.
  • 다중 수준 과정을 전처리 조건자(preconditioner)로 사용하고, 충분한 정확도에 도달하면 조기에 종료하는 적응형 분해 전략을 제안하여 계산 비용을 감소시킨다.
  • 메모리 액세스 패턴 최적화, 루프 수준 병렬 처리, 캐시 친화적인 데이터 레이아웃과 같은 알고리즘 최적화를 적용하여 분해 및 재구성 속도를 향상시킨다.
  • 계층적 다중 격자 스타일의 격자를 활용하여 데이터를 다양한 해상도와 척도의 구성 요소로 분리함으로써 오차 제어가 가능한 효율적 압축을 가능하게 한다.
  • 다중 수준 프레임워크를 오차 제한 압축 원칙과 통합하여 유저가 지정한 오차 한계 내에서 파생된 양수들 역시 제한됨을 보장한다.
  • 압축 품질을 향상시키되 성능을 희생시키지 않는 전환 기반 및 예측 기반 압축 통찰을 융합한 하이브리드 접근 방식을 사용한다.

실험 결과

연구 질문

  • RQ1기존 최고 수준의 압축기와 동일한 오차 제한 조건에서 다중 수준 데이터 감소를 어떻게 최적화하여 더 높은 압축 비율을 달성할 수 있는가?
  • RQ2다중 수준 분해 계수에 대해 다양한 오차 허용 범위를 적용할 경우 전체 압축 품질과 성능에 미치는 영향은 어떠한가?
  • RQ3분해 과정을 적응형으로 종료함으로써 성능을 향상시킬 수 있으며, 이는 압축 정밀도를 떨어뜨리지 않는가?
  • RQ4알고리즘 최적화는 과학 데이터 워크로드에서 다중 수준 분해 및 재구성의 처리량을 얼마나 향상시킬 수 있는가?
  • RQ5동일한 왜곡 제약 조건 하에서 MGARD+는 ZFP 및 SZ와 같은 선도적인 오차 제한 압축기와 비교해 성능 및 압축 품질에서 어떤가?

주요 결과

  • 알고리즘 최적화를 통해 MGARD+는 기본 다중 수준 방법의 분해 및 재구성 성능을 최대 70배 향상시켰다.
  • 제안된 수준별 양자화 전략은 동일한 PSNR 왜곡 수준에서 기존 최고 수준의 오차 제한 압축기들(예: ZFP, SZ)보다 최대 2배 높은 압축 비율을 달성할 수 있다.
  • 적응형 분해 방법은 과도한 계산을 방지하고 최적의 수준에서 과정을 종료함으로써 오차 제한을 훼손하지 않으면서도 효율성을 향상시킨다.
  • 네 가지 실제 과학 데이터셋에 대한 실험을 통해 MGARD+는 점별 및 파생된 양수 모두에 대해 стрict한 오차 제어를 유지함을 확인하였으며, 이는 많은 기존 방법들과의 핵심적 우월성이다.
  • 계층적 구성 요소의 부분적 재구성을 지원하여 전체 재구성을 거치지 않고도 축소된 표현에서 효율적인 후행 분석을 수행할 수 있다.
  • MGARD+는 ZFP와 SZ를 융합한 하이브리드 접근 방식보다 뛰어난 압축 품질을 달성하면서도 높은 계산 오버헤드를 피했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.