Skip to main content
QUICK REVIEW

[논문 리뷰] Model-based optimization of MPDATA on Intel Xeon Phi through load imbalancing

Alexey Lastovetsky, Łukasz Szustak|arXiv (Cornell University)|2015. 07. 05.
Parallel Computing and Optimization Techniques참고 문헌 25인용 수 6
한 줄 요약

이 논문은 Intel Xeon Phi에서 MPDATA 성능을 향상시키기 위해 의 intensional workload imbalance를 유도하는 모델 기반 최적화 기법을 제안한다. 이는 전통적인 지식인 '로드 밸런싱이 항상 성능을 최적화한다'는 믿음을 도전한다. 기능적 성능 모델을 사용해 비균일한 데이터 분할을 찾음으로써, 이전에 최적화된 로드 밸런싱 구성 대비 15%의 성능 향상을 달성한다.

ABSTRACT

Load balancing is a widely accepted technique for performance optimization of scientific applications on parallel architectures. Indeed, balanced applications do not waste processor cycles on waiting at points of synchronization and data exchange, maximizing this way the utilization of processors. In this paper, we challenge the universality of the load-balancing approach to optimization of the performance of parallel applications. First, we formulate conditions that should be satisfied by the performance profile of an application in order for the application to achieve its best performance via load balancing. Then we use a real-life scientific application, MPDATA, to demonstrate that its performance profile on a modern parallel architecture, Intel Xeon Phi, significantly deviates from these conditions. Based on this observation, we propose a method of performance optimization of scientific applications through load imbalancing. We also propose an algorithm that finds the optimal, possibly imbalanced, configuration of a data parallel application on a set of homogeneous processors. This algorithm uses functional performance models of the application to find the partitioning that minimizes its computation time but not necessarily balances the load of the processors. We show how to apply this algorithm to optimization of MPDATA on Intel Xeon Phi. Experimental results demonstrate that the performance of this carefully optimized load-balanced application can be further improved by 15\% using the proposed load-imbalancing optimization.

연구 동기 및 목표

  • 병렬 과학 응용 프로그램에서 로드 밸런싱이 항상 성능을 최적화한다는 가정을 도전하기 위해.
  • 로드 밸런싱이 계산 시간을 최소화하는 조건을 규명하고, 실세계 응용 프로그램인 Xeon Phi에서의 MPDATA가 이러한 조건을 만족하지 못함을 보여주기 위해.
  • 동일한 프로세서를 위한 최적의(가능성이 불균형한) 데이터 분할을 찾기 위해 성능 모델링을 활용하는 새로운 최적화 방법을 개발하기 위해.
  • 이 방법을 Intel Xeon Phi에서의 MPDATA에 적용하고, 로드 밸런싱 구성보다 측정 가능한 성능 향상을 입증하기 위해.

제안 방법

  • 성능 프로파일 특성에 기반해 로드 밸런싱이 계산 시간을 최소화하는 조건을 수립하기 위해.
  • 다양한 워크로드에서 비균일한 성능 행동을 반영하기 위해 Intel Xeon Phi에서의 MPDATA에 대한 기능적 성능 모델을 구축하기 위해.
  • 성능 모델을 활용해 프로세서 간에 데이터를 비균일하게 분배함으로써 총 계산 시간을 최소화하는 분할 알고리즘을 설계하기 위해.
  • 다양한 도메인 오프셋(Δm)을 사용해 불균형 구성 탐색 및 최적 구성 식별을 위해 알고리즘을 MPDATA에 적용하기 위해.
  • Xeon Phi에서 다양한 분할 방식에 대해 실행 시간을 측정함으로써 모델 예측을 실험적으로 검증하기 위해.
  • 이론적 예측과 실험적 측정을 비교하여, 총 실행 시간과 스피드업에 중점을 두고 균형 잡힌 vs. 불균형 구성의 성능를 평가하기 위해.

실험 결과

연구 질문

  • RQ1병렬 응용 프로그램에서 로드 밸런싱이 계산 시간을 최소화하는 조건은 무엇인가?
  • RQ2Intel Xeon Phi에서의 MPDATA 성능 프로파일은 로드 밸런싱이 최적임을 위한 이상 조건에서 얼마나 벗어나는가?
  • RQ3의도적으로 워크로드 불균형을 유도함으로써, 로드 밸런싱 구성보다 성능을 추가로 향상시킬 수 있는가?
  • RQ4기능적 성능 모델은 계산 시간을 최소화하는 데 최적의 비균일 분할을 얼마나 정확하게 예측할 수 있는가?
  • RQ5Intel Xeon Phi에서의 MPDATA에 대해 모델 기반 로드 불균형을 통해 달성 가능한 최대 성능 향상은 얼마인가?

주요 결과

  • Intel Xeon Phi에서의 MPDATA 성능 프로파일은 로드 밸런싱이 계산 시간을 최소화하기 위한 이상 조건에서 크게 이격되어 있다.
  • 워크로드 불균형을 허용하는 모델 기반 최적화 방법이, 철저히 최적화된 로드 밸런싱 구성 대비 15%의 성능 향상을 달성한다.
  • 480×480×128 도메인의 경우 최적 불균형 구성(Δm = 20)이 균형 잡힌 구성의 6.140초에서 실행 시간을 5.338초로 줄여 1.15배의 스피드업을 달성했다.
  • 이론적 성능 모델은 최적 구성 예측을 정확하게 수행했으며, 예측 오차는 3%를 초과하지 않았다.
  • 모델이 비최적 구성 예측를 내더라도 실험 결과는 항상 불균형 분할에서 성능 향상을 보였으며, 더 작은 도메인의 경우 Δm = 9에서 최대 스피드업이 달성되었다.
  • 측정 오버헤드가 상호 팀 간 동기화 지연를 포함하지 않기 때문에 총 실행 시간은 항상 최대 개별 팀 시간보다 略로 길었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.