Skip to main content
QUICK REVIEW

[논문 리뷰] Fusion of Array Operations at Runtime

Mads Ruben Burgdorff Kristensen, Simon Andreas Frimann Lund|arXiv (Cornell University)|2016. 01. 20.
Embedded Systems Design Techniques참고 문헌 25인용 수 9
한 줄 요약

이 논문은 가중치 부여된 서브루틴 분할(Weighted Subroutine Partition, WSP) 문제를 소개하며, 런타임에 배열 연산, 루프, 조합자들을 통합하기 위한 통합 프레임워크를 제안한다. 이는 사용자 정의 비용 함수를 가진 그래프 분할 문제로 융합을 모델링한다. 최적의 융합을 위한 브랜치 앤 바운드 알고리즘과 JIT 컴파일에 적합한 빠른 근사 알고리즘을 제안하며, 15개의 벤치마크에서 2배에서 30배의 빠른 성능 향상을 입증하였다. 최적 방법와 근사 방법 간 성능 차이는 미미하였다.

ABSTRACT

We address the problem of fusing array operations based on criteria such as shape compatibility, data reusability, and communication. We formulate the problem as a graph partition problem that is general enough to handle loop fusion, combinator fusion, and other types of subroutines.

연구 동기 및 목표

  • 루프 융합, 배열 연산 융합, 조합자 융합을 하나의 공식적 프레임워크로 통합하는 것.
  • 데이터 국소성, 메모리 접근, 통신 및 기타 최적화 목표를 반영할 수 있는 탄력적인 비용 함수를 사용해 융합 결정을 모델링하는 것.
  • 고성능 계산을 위한 JIT 컴iles에서 사용 가능한 효율적인 알고리즘—최적 및 근사—을 개발하는 것.
  • 다양한 비용 모델과 융합 전략이 실제 벤치마크에 미치는 영향을 평가하는 것.
  • 빠른 근사 알고리즘이 최적 방법의 대부분의 성능 향상을 달성할 수 있음을 입증하는 것.

제안 방법

  • 혼합 그래프 위에서 서브루틴을 정점으로, 방향 있는 간선은 의존성을, 무방향 간선은 융합 가능성을 나타내는 가중치 부여된 서브루틴 분할(WSP) 문제로 융합 문제를 공식화한다.
  • 데이터 접근, 메모리 사용, 통신을 페널티로 삼는 단조 비용 함수를 정의하며, 융합은 비용이 변하지 않거나 유리한 것으로 간주한다.
  • WSP가 NP-난해임을 증명하여 효율적인 알고리즘의 필요성을 정당화한다.
  • 비용 한계 기반의 가지치기를 통해 최적의 융합 분할을 계산하는 브랜치 앤 바운드 알고리즘을 구현한다.
  • JIT 컴파일당 20회 이내의 반복으로 실행되며, 오버헤드를 분산 처리하는 근사 알고리즘을 설계한다.
  • 모든 알고리즘을 보헤리움 프레임워크에 통합하여, 다양한 비용 모델을 사용한 15개의 실제 벤치마크에서 융합 성능을 평가한다.

실험 결과

연구 질문

  • RQ1일관된 최적화 프레임워크 내에서 루프 융합, 배열 연산 융합, 조합자 융합을 하나의 형식적 체계로 통합할 수 있는가?
  • RQ2사용자 정의 비용 함수의 포함이 융합 전략의 표현력과 성능에 어떤 영향을 미치는가?
  • RQ3성능과 컴파일 오버헤드 측면에서 브랜치 앤 바운드를 통한 최적 융합과 근사 알고리즘을 통한 빠른 근사 융합 간의 상호 교환 관계는 어떠한가?
  • RQ4Max Locality, Max Contract, Robinson 등의 다양한 비용 모델이 다양한 벤치마크에서 실제로 어떻게 비교되는가?
  • RQ5실제 워크로드에서 근사 알고리즘이 최적 해에 얼마나 가까운 성능을 달성하는가?

주요 결과

  • WSP 공식화는 사용자 정의 비용 함수를 가진 단일 그래프 분할 모델을 통해 루프, 배열, 조합자 융합을 성공적으로 통합하였다.
  • 브랜치 앤 바운드 알고리즘은 15개의 벤치마크 중 10개에서 합리적인 시간 내에 최적 해를 찾았으며, 컴파일러에서의 실현 가능성을 입증하였다.
  • 그리디 근사 알고리즘은 실질적으로 최적 성능에 근접했으며, 최적 방법 대비 최고 성능 벤치마크(게임 오브 라이프)에서 뿐다 1.3배의 성능 향상 차이를 보였다.
  • 근사 알고리즘이 대부분의 성능 향상을 제공하여, 정확도 향상에 대한 추가 최적화는 수익 감소 효과를 보였다.
  • Max Contract 비용 모델은 다른 모델이 데이터 국소성을 우선시하면서도 수축 기회를 놓칠 수 있는 상황에서 유일하게 배열 수축을 최대화하였다.
  • 전반적으로 융합은 데이터 접근 횟수를 줄였으며, 모든 벤치마크에서 2배에서 30배의 성능 향상을 이끌어냈으며, 대부분의 경우 비용 모델 간 성능 차이는 미미하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.