Skip to main content
QUICK REVIEW

[논문 리뷰] Minimod: A Finite Difference solver for Seismic Modeling

Jie Meng, Andreas Atle|arXiv (Cornell University)|2020. 07. 12.
Seismic Imaging and Inversion Techniques참고 문헌 20인용 수 10
한 줄 요약

Minimod는 고성능 컴퓨팅(HPC) 플랫폼을 벤치마킹하기 위한 프oxy 애플리케이션으로 설계된 이식성 있고 자가 포함된 유한차분 해법기이다. CPU 및 GPU 아키텍처를 위한 최적화된 및 비최적화된 커널을 모두 지원하여 현대 HPC 시스템에서 강한 스케일링 및 약한 스케일링 테스트를 통해 성능를 평가할 수 있으며, 결과적으로 IBM 파wr 시스템에서는 최대 63%의 이상적 스케일링 성능를 기록했고, Fujitsu A64FX 시스템에서는 60%의 성능를 기록하였다.

ABSTRACT

This article introduces a benchmark application for seismic modeling using finite difference method, which is namedMiniMod, a mini application for seismic modeling. The purpose is to provide a benchmark suite that is, on one hand easy to build and adapt to the state of the art in programming models and changing high performance hardware landscape. On the other hand, the intention is to have a proxy application to actual production geophysical exploration workloads for Oil & Gas exploration, and other geosciences applications based on the wave equation. From top to bottom, we describe the design concepts, algorithms, code structure of the application, and present the benchmark results on different current computer architectures.

연구 동기 및 목표

  • 실제 지구물리학 워크로드를 반영하는 경량이고 이식 가능한 지반 모델링 프록시 애플리케이션을 제공하기 위해.
  • 다중 스레딩 및 GPU 오프로딩을 포함한 신규 HPC 하드웨어 및 프로그래밍 모델의 벤치마킹을 지원하기 위해.
  • IBM 파워 및 Fujitsu A64FX와 같은 다양한 아키텍처에서 노드 수준 및 분산 메모리 병렬 성능 평가를 위해.
  • HPCToolkit와 같은 통합 프로파일링 도구를 통해 성능 분석 및 최적화를 가능하게 하기 위해.
  • 파동방정식 기반 지반 이미징 워크로드에 대한 측정 가능한 성능 추세를 제공하여 HPC 구매 결정을 안내하기 위해.

제안 방법

  • 3차원에서 음향파 방정식을 구조적 격자에서 유한차분법(FDM)을 사용해 풀며, 일정 밀도 및 가변 밀도 수식을 모두 지원한다.
  • 세 가지 격자 유형을 구현: 동일 위치 격자, Yee 이격 격자, Lebedev 이격 격자로 다양한 수치 스텐실 및 정밀도 수준을 지원한다.
  • CPU(OpenMP) 및 GPU(OpenACC) 실행을 위한 비최적화 및 최적화된 계산 커널을 제공하여 성능 비교를 가능하게 한다.
  • 파동 반사 최소화를 위해 완벽하게 매칭된 계층(PML)을 사용해 경계 조건을 흡수한다.
  • MPI를 사용해 분산 메모리 시스템에서 강한 스케일링 및 약한 스케일링 테스트를 수행하며, 강한 스케일링에는 고정된 문제 크기, 약한 스케일링에는 비례 증가하는 문제 크기를 사용한다.
  • CPU 및 GPU 실행 추적의 상세 프로파일링을 위해 HPCToolkit를 사용하며, 호출 경로 분석 및 커널 서브루틴에서 소비된 시간을 포함한다.

실험 결과

연구 질문

  • RQ1Minimod의 성능는 IBM 파워 및 Fujitsu A64FX 시스템을 포함한 다양한 HPC 아키텍처에서 어떻게 스케일링되는가?
  • RQ2최적화된 커널은 비최적화된 버전 대비 현대 CPU 및 GPU 플랫폼에서 성능 향상에 얼마나 기여하는가?
  • RQ3격자 이격 방식(동일 위치, Yee, Lebedev)의 선택은 지반파 모델링에서 수치 정확도와 계산 효율성에 어떤 영향을 미치는가?
  • RQ4문제 크기 및 MPI 랭크 수는 Minimod의 분산 메모리 구현에서 약한 스케일링과 강한 스케일링에 어떤 영향을 미치는가?
  • RQ5Minimod의 계산 커널에서 성능 저하 요인은 무엇이며, CPU와 GPU 실행 간에 이는 어떻게 다를까?

주요 결과

  • 256개의 MPI 랭크를 사용한 강한 스케일링 테스트에서 Minimod는 IBM 파워 시스템에서 이상적 스케일링의 63%를 달성했고, Fujitsu A64FX 시스템에서는 60%를 기록하였다.
  • 약한 스케일링 효율성은 8개의 MPI 랭크까지 높은 수준을 유지하며, 더 작은 문제 크기로 인해 성능 비율이 100%를 초과하지만, 더 높은 랭크에서 감소한다.
  • HPCToolkit를 통한 프로파일링 결과, PML(완벽하게 매칭된 계층) 구현이 실행 시간의 가장 큰 비중을 차지하며, 특히 CPU 및 GPU에서 두드러진다.
  • GPU 프로파일링 결과, 장치 실행 중에 공백 시간이 발생함을 확인하여, 커널 실행 및 데이터 전송 스케줄링 최적화의 잠재적 여지를 시사한다.
  • 순차적 커널 프로파일링 결과, 내부 스텐실 계산 및 PML 경계 처리가 주요 계산 단계로 지배적이다.
  • 최적화된 커널은 CPU 및 GPU 양쪽에서 성능 향상을 크게 이룩하여, 새로운 프로그래밍 모델 및 하드웨어 평가에 효과적으로 활용할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.