Skip to main content
QUICK REVIEW

[논문 리뷰] Multitask and Transfer Learning for Autotuning Exascale Applications

Wissam M. Sid-Lakhdar, Mohsen Mahmoudi Aznaveh|arXiv (Cornell University)|2019. 08. 15.
Machine Learning and Data Classification참고 문헌 29인용 수 4
한 줄 요약

이 논문은 다중작업 및 전이학습 프레임워크를 제안하여 엑사스케일 응용 프로그램의 오토튜닝을 위해 이전 튜닝 작업에서의 지식을 활용하여 최적화를 가속화한다. 오토튜너인 OpenTuner 및 HpBandSter와 같은 최신 기술 대비 평균적으로 1.5배 빠른 런타임 성능을 달성하였으며, 저비용 설정에서도 자원 제약 조건이 엄격한 환경에서도 표준 방법보다 뛰어난 성능을 발휘한다.

ABSTRACT

Multitask learning and transfer learning have proven to be useful in the field of machine learning when additional knowledge is available to help a prediction task. We aim at deriving methods following these paradigms for use in autotuning, where the goal is to find the optimal performance parameters of an application treated as a black-box function. We show comparative results with state-of-the-art autotuning techniques. For instance, we observe an average $1.5x$ improvement of the application runtime compared to the OpenTuner and HpBandSter autotuners. We explain how our approaches can be more suitable than some state-of-the-art autotuners for the tuning of any application in general and of expensive exascale applications in particular.

연구 동기 및 목표

  • 각 실행당 높은 계산 비용으로 인해 튜닝 예산이 제한된 엑사스케일 응용 프로그램을 최적화하는 데 도전한다.
  • 고비용 엑사스케일 환경에서 브루트포스 격자 탐색 및 표준 오토튜너의 비효율성을 해결한다.
  • 다양한 워크로드를 통해 이전에 튜닝된 문제로부터의 지식을 재사용하여 더 빠르고 정확한 오토튜닝을 가능하게 한다.
  • 다양한 튜닝 메트릭, 자원 제약 조건, 점진적 학습을 지원하는 확장 가능하고 적응형 프레임워크를 개발한다.
  • 진화하는 하드웨어와 응용 프로그램 워크로드에 걸쳐 성능 이식성과 장기적인 튜닝 효율성을 향상시킨다.

제안 방법

  • 다양한 문제 인스턴스를 동시에 공동 최적화하는 다중작업 학습 접근법(MLA)을 도입하여 작업 간 정보 공유를 통해 수렴 속도를 향상시킨다.
  • 이전 튜닝 작업에서 사전 학습된 모델을 활용하여 최소 또는 전혀 새로운 실행이 필요 없는 새로운 튜닝 작업을 가속화하는 전이학습 알고리즘(TLA1 및 TLA2)을 개발한다.
  • 성능 지표의 변화를 효율적으로 표현하기 위해 가우시안 프로세스 기반의 서rogate 모델을 사용하여 베이지안 최적화를 가능하게 한다.
  • 입력 파라미터, 자원 제약 조건, 최적화 메트릭을 노출하는 블랙박스 오토튜닝 인터페이스를 설계하여 응용 프로그램 컴포onent 간 모듈화되고 조합 가능한 튜닝을 가능하게 한다.
  • 초기 모델 학습(MLA)을 수행한 후, 새로운 작업에 대해 빠르고 저비용의 추론(TLA1/TLA2)을 수행하는 계층적 튜닝 파이프라인을 구현한다.
  • 추가 평가가 거의 또는 전혀 필요 없이 사전 학습된 모델을 새로운 문제 인스턴스에 적응시키는 전이 메커니즘을 통합하여 고비용 함수 호출에 대한 의존도를 낮춘다.

실험 결과

연구 질문

  • RQ1다양한 문제 인스턴스를 가진 엑사스케일 응용 프로그램에서 다중작업 학습이 오토튜닝의 효율성과 정확도를 향상시킬 수 있는가?
  • RQ2전이학습을 통해 최적의 파라미터 설정을 위한 고비용 응용 프로그램 실행 수를 얼마나 줄일 수 있는가?
  • RQ3저비용 조건에서 다중작업 및 전이학습 방법이 OpenTuner 및 HpBandSter와 같은 최신 오토튜너와 비교해 어떻게 성능을 내는가?
  • RQ4재학습 없이도 이전 튜닝 작업에서의 지식을 새로운, 볼 수 없는 문제 인스턴스에 효과적으로 전이할 수 있는가?
  • RQ5엑사스케일 워크로드에서 흔히 나타나는 노이즈, 비정상성, 비연속적인 성능 메트릭 환경에서 이러한 방법은 어떻게 성능을 내는가?

주요 결과

  • 제안된 다중작업 학습 접근법(MLA)은 테스트된 케이스의 66%에서 OpenTuner를 능가하며, 응용 프로그램 런타임에서 최대 40% 향상을 달성한다.
  • 실행 없이 전이하는 TLA1은 OpenTuner 및 HpBandSter가 찾은 설정과 비교해 경쟁적인 성능을 보이며, 이를 충족하거나 초월한다.
  • 100회의 응용 프로그램 실행만을 사용하는 TLA2는 500×500 ScaLAPACK QR 분해에서 최적의 런타임 5.67e-3초를 달성하여, OpenTuner가 100회 실행으로 달성한 7.00e-3초를 뛰어넘고, 격자 탐색(5.15e-3초)에 가까운 성능을 보였다.
  • 프레임워크는 OpenTuner 및 HpBandSter 대비 평균 응용 프로그램 런타임을 1.5배 빠르게 하여 뚜렷한 효율성 향상을 입증했다.
  • 이러한 방법은 특히 저비용 조건에서 매우 효과적이며, 고비용 엑사스케일 응용 프로그램에 대한 표준 오토튜너보다 더 적합하다.
  • 실험 결과는 전이학습이 최소 또는 전혀 새로운 평가 없이도 정확한 튜닝 예측을 가능하게 하여 프레임워크의 확장성과 적응 가능성의 타당성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.