Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Tuning of Local Memory Use on GPGPUs

Tianyi David Han, Tarek S. Abdelrahman|arXiv (Cornell University)|2014. 12. 22.
Parallel Computing and Optimization Techniques참고 문헌 13인용 수 11
한 줄 요약

이 논문은 GPGPU에서 OpenCL 커널에 국소 메모리 최적화를 적용할지 자동으로 결정하기 위해 Random Forest를 사용하는 기계학습 접근법을 제안한다. 56만 개의 합성 벤치마크로 훈련된 모델은 합성 데이터에서 95%의 페널티 가중 정확도를 기록하고 실제 커널에서는 거의 95%의 정확도를 달성하며, 히우리스틱과 분석 모델을 능가한다.

ABSTRACT

The use of local memory is important to improve the performance of OpenCL programs. However, its use may not always benefit performance, depending on various application characteristics, and there is no simple heuristic for deciding when to use it. We develop a machine learning model to decide if the optimization is beneficial or not. We train the model with millions of synthetic benchmarks and show that it can predict if the optimization should be applied for a single array, in both synthetic and real benchmarks, with high accuracy.

연구 동기 및 목표

  • 국소 메모리 최적화가 GPU 커널 성능을 향상시키는지 여부를 판단하는 신뢰할 수 있는 히우리스틱의 부족을 해결하기 위해.
  • 캐싱된 배열 영역을 국소 메모리에 저장할 경우 성능 향상이 유의미한지 예측하는 자동화된 데이터 기반 방법을 개발하기 위해.
  • 다양한 메모리 액세스 패턴을 포괄하는 대규모 합성 벤치마크 세트를 사용해 강건한 기계학습 모델을 훈련하기 위해.
  • 선형 대수학 및 이미지 처리와 같은 도메인의 실제 커널을 대상으로 모델의 일반화 능력을 평가하기 위해.
  • 합성 벤치마크가 실제 GPU 성능 튜닝을 위한 고정확도 자동 튜닝 모델 훈련에 효과적으로 활용될 수 있음을 보여주기 위해.

제안 방법

  • 밀도 높은 선형 대수학 및 구조적 격자에서 흔히 나타나는 데이터 액세스 패턴을 커버하는 대규모 합성 벤치마크 세트(560만 개의 커널 인스턴스)를 생성한다.
  • 모델 훈련을 위해 데이터 재사용, 메모리 코ales싱, 레지스터 사용량, 병렬성 영향 등의 커널 특징을 추출한다.
  • 10%의 합성 데이터를 사용해 20개의 트리와 노드당 4개의 특성으로 구성된 Random Forest 분류기를 훈련하여 최적화 이점 예측.
  • 모델 훈련 및 평가를 위해 성능 데이터(국소 메모리 사용 유무 포함)를 오라클 기반 참값으로 사용한다.
  • 세 가지 지표를 사용해 모델 정확도를 평가한다: 카운트 기반 정확도와 페널티 가중 정확도(예측 오류로 인한 성능 손실을 고려함).
  • 실제 커널에 훈련된 모델을 적용하여 일반화 능력과 강건성을 평가한다.

실험 결과

연구 질문

  • RQ1다양한 GPU 워크로드에서 국소 메모리 최적화가 커널 성능을 향상시키는지 기계학습 모델이 정확하게 예측할 수 있는가?
  • RQ2합성 벤치마크로 훈련된 모델은 실제 OpenCL 커널에 대해 얼마나 잘 일반화되는가?
  • RQ3자동 튜닝 결정에서 예측 오류의 실질적 영향을 가장 잘 반영하는 성능 지표는 무엇인가?
  • RQ4메모리 비코ales싱, 데이터 재사용, 병렬성 감소 등의 요소가 최적화의 이점에 미치는 영향은 어떠한가?
  • RQ5합성 벤치마크는 고정확도 자동 튜닝 모델 훈련을 위한 실제 벤치마크를 효과적으로 대체할 수 있는가?

주요 결과

  • 모델은 미리 보지 않은 합성 커널 인스턴스에서 86%의 카운트 기반 정확도와 94.8%의 페널티 가중 정확도를 기록한다.
  • 실제 커널에서는 거의 95%의 페널티 가중 정확도를 달성했으며, 최소 인스턴스 점수 30%는 드물지만 고도로 영향을 미치는 잘못된 예측가 존재함을 시사한다.
  • 모델의 실제 커널에서의 성능는 선형 대수학, 컬러리션, MRI 격자화 등 다양한 도메인에서 일관되게 유지된다.
  • 합성 벤치마크의 사용은 고차원 특징 공간 모델링에 필수적인 대규모이고 다양한 데이터셋을 훈련에 활용할 수 있게 한다.
  • 모델는 복잡한 커널 특성과 성능 영향 간의 상호작용을 포착함으로써 전통적인 히우리스틱과 분석 모델을 능가한다.
  • 본 연구는 합성 데이터로 훈련된 기계학습 모델이 실제 GPU 워크로드로 일반화될 수 있음을 입증하며, 국소 메모리 사용의 정확한 자동 튜닝을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.