[논문 리뷰] Compression and Sieve: Reducing Communication in Parallel Breadth First Search on Distributed Memory Systems
이 논문은 분산 메모리 시스템에서 메시지 압축과 분산 크로스 디렉터리를 사용하는 새로운 체계를 결합하여 통신 최적화된 병렬 BFS를 제안한다. 전행 비트맵을 압축하고 체계를 통해 중복 메시지를 제거함으로써, 통신 시간을 79.0% 감소시키고 6,144코어 클러스터에서 Graph500 기준 대비 2.2배의 성능 향상을 달성하여 초당 12.1 GTEPS를 기록한다.
For parallel breadth first search (BFS) algorithm on large-scale distributed memory systems, communication often costs significantly more than arithmetic and limits the scalability of the algorithm. In this paper we sufficiently reduce the communication cost in distributed BFS by compressing and sieving the messages. First, we leverage a bitmap compression algorithm to reduce the size of messages before communication. Second, we propose a novel distributed directory algorithm, cross directory, to sieve the redundant data in messages. Experiments on a 6,144-core SMP cluster show our algorithm outperforms the baseline implementation in Graph500 by 2.2 times, reduces its communication time by 79.0%, and achieves a performance rate of 12.1 GTEPS (billion edge visits per second)
연구 동기 및 목표
- 공유 메모리 시스템에서 대규모 분산 BFS의 확장성에 제약을 주는 높은 통신 비용을 해결하기 위해.
- 특히 전행 데이터와 같은 메시지 크기를 줄여 통신 오버헤드를 최소화하기 위해.
- 분산 BFS에서 메시지 형식과 전송 중복을 최적화하여 성능을 향상시키기 위해.
- 실제 워크로드에서 대규모 스케일에서의 압축 및 체계 기법의 효과를 평가하기 위해.
제안 방법
- 전행 집합을 표현하기 위해 비트맵 압축을 적용하여 통신 전 메시지 크기를 줄임.
- 전송 이전에 중복 메시지를 탐지하고 제거하기 위해 '크로스 디렉터리'라고 불리는 새로운 분산 디렉터리 도입.
- 크로스 디렉터리를 활용하여 프로세서 간 중복 또는 불필요한 메시지를 걸러내는 체계 메커니즘 사용.
- 비트맵 데이터에 최적화된 공간-시간 트레이드오프를 도출하기 위해 다양한 압축 알고리즘(예: Zlib, 비트 수준 압축) 평가.
- 성능 및 통신 감소를 측정하기 위해 최적화된 BFS를 6,144코어 SMP 클러스터에 구현.
- 체계와 압축 기법을 파이프라인으로 조합: 먼저 체계 적용 후 압축을 통해 통신 감소를 최대화.
실험 결과
연구 질문
- RQ1비트맵 기반 메시지 압축은 분산 BFS에서 통신 볼륨을 얼마나 효과적으로 줄이는가?
- RQ2분산 체계 메커니즘이 얼마나 중복 메시지를 제거하여 추가로 통신을 줄일 수 있는가?
- RQ3압축과 체계 기법의 조합이 대규모 BFS에서 종단 간 통신 시간과 성능에 미치는 통합적 영향은 어떠한가?
- RQ4다양한 압축 알고리즘이 BFS 전행 데이터에 대해 압축 비율과 런타임 오버헤드 측면에서 어떻게 비교되는가?
- RQ5기존 최적화 기법(예: 2차원 그래프 분할)과 제안된 기법을 효과적으로 조합할 수 있는가?
주요 결과
- 제안된 압축 기법만으로도 통신 시간을 52.4% 감소시키고 기준 대비 성능을 1.7배 향상시켰다.
- 분산 크로스 디렉터리를 사용하는 체계 기법은 추가로 통신 시간을 55.9% 감소시키며 성능을 1.3배 향상시켰다.
- 압축과 체계 기법을 조합한 방식은 Graph500 기준 대비 총 통신 시간을 79.0% 감소시켰다.
- 최적화된 알고리즘은 6,144코어 클러스터에서 성능 속도를 12.1 GTEPS(초당 빈번한 간선 방문 수)에 도달했다.
- Zlib는 압축 비율이 낮고 런타임 오버헤드가 높아 비트맵 압축에 부적합하다고 밝혀졌다.
- 공간-시간 트레이드오프 분석 결과, 비트 수준 압축이 대규모 BFS 워크로드에 가장 적합한 균형을 이룬다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.