Skip to main content
QUICK REVIEW

[논문 리뷰] Analysis of Randomized Work Stealing with False Sharing

Richard Cole, Vijaya Ramachandran|arXiv (Cornell University)|2011. 03. 21.
Optimization and Search Problems참고 문헌 9인용 수 4
한 줄 요약

이 논문은 캐시 일관성 프로토콜로 인한 성능 저하 원인인 가짜 공유(false sharing)에 초점을 맞춰 병렬 계산에서의 랜덤화된 워크 스틸링(RWS)을 분석한다. 계층적 트리 알고리즘 계열과 그 하위 계열인 HBP 알고리즘을 도입하여 현실적인 가정 하에서 개선된 캐시 미스 경계를 유도하며, 알고리즘이 프로세서 간 경쟁을 최소화하도록 구조화되어 있을 경우 RWS가 가짜 공유가 존재하더라도 거의 최적의 성능을 달성할 수 있음을 보여준다.

ABSTRACT

This paper analyzes the cache miss cost of algorithms when scheduled using randomized work stealing (RWS) in a parallel environment, taking into account the effects of false sharing. First, prior analyses (due to Acar et al.) are extended to incorporate false sharing. However, to control the possible delays due to false sharing, some restrictions on the algorithms seem necessary. Accordingly, the class of Hierarchical Tree algorithms is introduced and their performance analyzed. In addition, the paper analyzes the performance of a subclass of the Hierarchical Tree Algorithms, called HBP algorithms, when scheduled using RWS; improved complexity bounds are obtained for this subclass. This class was introduced in a companion paper with efficient resource oblivious computation in mind. Finally, we note that in a scenario in which there is no false sharing the results in this paper match prior bounds for cache misses but with reduced assumptions, and in particular with no need for a bounding concave function for the cost of cache misses as in prior work by Frigo and Strumpen. This allows non-trivial cache miss bounds in this case to be obtained for a larger class of algorithms.

연구 동기 및 목표

  • 랜덤화된 워크 스틸링(RWS)을 위한 병렬 알고리즘에서 가짜 공유가 캐시 미스 비용에 미치는 영향을 분석하는 것.
  • RWS 스케줄링에서 가짜 공유와 그 성능 비용을 최소화하는 알고리즘적 구조를 규명하는 것.
  • 이전의 캐시 복잡도 경계를 보다 적은 가정 하에 확장하여, 특히 볼록 함수에 대한 상한을 요구하지 않는 방식으로 가짜 공유 영향을 포함하는 것.
  • RWS 스케줄링 하에서 행렬 곱셈, FFT, 정렬과 같은 HBP 알고리즘에 대해 더 날카운 복잡도 경계를 제공하는 것.
  • 가짜 공유를 알고리즘적 제약 조건을 통해 고려할 경우 RWS가 더 넓은 범위의 알고리즘에서 거의 최적의 성능을 달성할 수 있음을 보여주는 것.

제안 방법

  • 인터프로세서 쓰기 경쟁을 최소화하여 가짜 공유를 줄이는 방식으로 계산을 구성하는 계층적 트리 알고리즘 계열을 도입한다.
  • HBP(Hierarchically Balanced Parallel) 알고리즘의 하위 집합을 분석하며, 도난 및 가짜 공유로 인한 블록 미스를 고려한 정교한 모델을 사용한다.
  • 균일한 무작위 도난 선택 조건 하에서 확률적 분석을 통해 성공적인 도난 수 $ S $ 의 경계를 유도하며, 고확률적으로 $ S = O(p(\frac{b+s}{s}\text{depth} + \frac{b}{s}B\text{depth}))(1+a) $ 라고 유도한다.
  • 캐시 미스 비용을 $ S $ 의 함수로 모델링하며, 순차적 캐시 미스와 가짜 공유로 인한 추가 블록 미스를 포함한다. 블록 미스 비용은 $ O(S \times B) $ 로 경계된다.
  • 행렬 곱셈, FFT, 정렬, 리스트 랭킹 등의 특정 알고리즘에 분석을 적용하며, 연산 수 $ W $, 순차적 캐시 미스 수 $ Q $, 깊이 $ T_{\text{infty}} $ 를 유도한 후 도난 수와 결합한다.
  • HBP 알고리즘에 대해 $ C(S,n) = O(S) $ 와 정렬에 대해 $ C(S,n) = O(2^j n / (M^{1/2^j}) \times \text{log} n / \text{log} M) $ 라는 경계를 적용하여 캐시 미스와 블록 미스의 조합 비용을 날카럽게 유도한다.

실험 결과

연구 질문

  • RQ1가짜 공유는 병렬 알고리즘의 랜덤화된 워크 스틸링(RWS)에서 캐시 미스 비용에 어떻게 영향을 미치는가?
  • RQ2알고리즘의 어떤 구조적 특성이 가짜 공유를 최소화하고 RWS 성능을 향상시킬 수 있는가?
  • RQ3캐시 복잡도 함수에 볼록 상한을 요구하지 않고도 RWS에 대해 더 날카운 캐시 미스 경계를 도출할 수 있는가?
  • RQ4HBP 알고리즘에 대해 RWS 하에서의 캐시 미스와 블록 미스의 조합 비용은 무엇이며, 어떤 조건에서 순차적 성능과 일치하는가?
  • RQ5가짜 공유가 존재할 경우 성공적인 도난 수는 프로세서 수와 알고리즘 깊이에 따라 어떻게 증가하는가?

주요 결과

  • 행렬 곱셈과 같은 $ \log^2 n $ 깊이 알고리즘의 경우, 고확률적으로 성공적인 도난 수는 $ O(p \log n [\log n + B]) $ 이며, $ p(\log^2 n + B \log n) \leq n^3 / M^{3/2} $ 이고 $ B^2 \leq M $ 라면 이는 최적이다.
  • 행렬 전치, FFT와 같은 HBP 알고리즘의 경우, $ pB(\log n + B) \leq n $ 라면 조건 하에서 조합된 캐시 및 블록 미스 비용이 순차적 캐시 미스 비용과 일치한다. 이때 $ s = \Theta(b) $ 이고 $ a = O(1) $ 라는 가정이 성립한다.
  • 정렬 알고리즘의 경우, $ pB \log M (\log \log n + B / \log B) \max\{B, M^{1/2^j}\} \leq n $ 이고 $ j = O(1) $ 라면 조합 비용이 순차적 성능과 일치한다. 동일한 가정 조건 하에서 성립한다.
  • 이전 연구에 비해 캐시 복잡도 함수에 볼록 상한이 필요 없도록 하여 더 넓은 범위의 알고리즘에 비의미 없는 경계를 도출할 수 있도록 개선되었다.
  • 리스트 랭킹 알고리즘은 정렬을 $ O(\log n) $ 번 반복하므로 총 문제 크기가 $ O(n \log n) $ 이므로 정렬의 경계보다 최악의 경우 $ O\left(\log n\right) $ 배 이상 나쁘지 않다.
  • 연결 요소 알고리즘은 리스트 랭킹을 $ O(\log n) $ 번 반복하므로 리스트 랭킹의 경계를 그대로 이어받으며, 반복 간 문제 크기는 동일하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.