Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging GPU batching for scalable nonlinear programming through massive Lagrangian decomposition

Youngdae Kim, François Pacaud|arXiv (Cornell University)|2021. 06. 28.
Parallel Computing and Optimization Techniques참고 문헌 38인용 수 14
한 줄 요약

이 논문은 배치 처리된 비선형 프로그래밍 문제에 대해 GPU 가속을 받는 trust-region Newton 해법인 ExaTron을 제안한다. 이는 CPU-GPU 데이터 전송 없이 GPU에서 완전히 실행되며, 대량의 GPU 스레드 배치와 효율적인 커널 설계를 통해 AC 최적 운전 전력 흐름 분해 문제에서 6개 GPU 대비 40개 CPU에 비해 35배 이상의 성능 향상을 달성한다. 이는 배치 크기와 GPU 수에 따라 선형 스케일링을 보여준다.

ABSTRACT

We present the implementation of a trust-region Newton algorithm ExaTron for bound-constrained nonlinear programming problems, fully running on multiple GPUs. Without data transfers between CPU and GPU, our implementation has achieved the elimination of a major performance bottleneck under a memory-bound situation, particularly when solving many small problems in batch. We discuss the design principles and implementation details for our kernel function and core operations. Different design choices are justified by numerical experiments. By using the application of distributed control of alternating current optimal power flow, where a large problem is decomposed into many smaller nonlinear programs using a Lagrangian approach, we demonstrate computational performance of ExaTron on the Summit supercomputer at Oak RidgeNational Laboratory. Our numerical results show the linear scaling with respect to the batch size and the number of GPUs and more than 35 times speedup on 6 GPUs than on 40 CPUs available on a single node.

연구 동기 및 목표

  • 대규모 소형 비선형 프로그래밍 문제의 배치를 해결할 때 발생하는 성능 저하 문제를 해결하기 위해 CPU-GPU 데이터 전송을 제거한다.
  • 메모리 기반 환경에서 대규모 GPU 병렬 처리를 활용해 확장 가능하고 고처리량의 비선형 프로그래밍 문제를 해결할 수 있도록 한다.
  • 하이브리드 CPU-GPU 실행을 피하고 데이터 이동에 의한 지연을 줄이는 완전히 GPU 기반의 trust-region Newton 알고리즘을 설계한다.
  • 초고성능 컴퓨팅 플랫폼에서 배치 크기와 GPU 수에 따라 계산 시간이 선형적으로 증가하는지 확인한다.
  • 라그랑주 분해를 사용한 실제 최적 전력 흐름 문제에 대해 CPU 기반 구현 대비 뚜렷한 성능 향상을 달성한다.

제안 방법

  • CPU-GPU 데이터 전송이 전혀 없는 배치 제약 비선형 프로그래밍 문제를 위한 완전한 GPU 기반 trust-region Newton 알고리즘을 구현한다.
  • 비선형 프로그래밍에서 발생하는 소형, 희소, 대칭 불확실한 KKT 시스템을 고려해 최적화된 커널을 설계한다.
  • 모든 문제를 한 번에 하나의 스레드 블록에 매핑함으로써 GPU 전체 병렬 처리 능력을 극대화하기 위해 대규모 스레드 배치를 활용한다.
  • ADMM를 통한 라그랑주 분해를 통해 대규모 AC 최적 운전 전력 흐름 문제를 수천 개의 더 작은 하위 문제로 분할한다.
  • Summit 슈퍼컴퓨터의 노드당 6개 GPU를 활용해 효율적인 GPU 간 통신을 통해 여러 GPU에 걸쳐 계산을 확장한다.
  • 메모리 액세스 패턴과 커널 실행 구성 설정을 최적화하여 GPU 아키텍처에서 지연을 최소화하고 할당률을 극대화한다.

실험 결과

연구 질문

  • RQ1완전히 GPU 기반의 비선형 프로그래밍 해법이 소형 문제의 대규모 배치에서 CPU 기반 구현 대비 뚜렷한 성능 향상을 달성할 수 있는가?
  • RQ2메모리 기반 비선형 프로그래밍 워크로드에서 CPU-GPU 데이터 전송이 없는 경우 성능에 어떤 영향을 미치는가?
  • RQ3GPU 배치가 비선형 최적화에서 배치 크기와 GPU 수에 따라 선형 스케일링을 얼마나 잘 달성할 수 있는가?
  • RQ4수천 개의 소형, 희소 비선형 프로그래밍 문제를 동시에 해결할 때 GPU 활용도를 극대화하고 부하 불균형을 최소화하기 위한 설계 원칙은 무엇인가?
  • RQ5단일 고성능 노드에서 GPU 기반 해법의 성능이 CPU 기반 MPI 병렬화 구현 대비 어떻게 다른가?

주요 결과

  • ExaTron은 AC 최적 운전 전력 흐름 분해 문제에서 단일 Summit 노드에서 6개 GPU 대비 40개 CPU에 비해 35배 이상의 성능 향상을 달성했다.
  • 계산 시간이 배치 크기와 GPU 수에 따라 선형적으로 증가하여 강력한 병렬 효율성을 확인했다.
  • 19402goc 문제는 GPU 간 부하 균형이 가장 우수했으며, 평균 불균형 지표는 단지 9.04%에 그쳤다. 이는 뛰어난 성능 향상에 기여했다.
  • 13659pegase 문제에서는 심각한 부하 불균형이 발생했으며, 두 개의 GPU가 나머지 GPU들보다 거의 두 배 가까이 더 오래 걸렸다. 이로 인해 문제 크기가 더 크더라도 성능 향상이 제한되었다.
  • ADMM 반복의 히트맵 시각화를 통해 GPU 간 계산 시간 격차가 일관되게 나타나 부하 불균형이 확인되었다.
  • 이 연구는 메모리 기반 소형 문제의 대량 배치 환경에서 CPU-GPU 데이터 전송을 제거하는 것이 성능 향상에 필수적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.