Skip to main content
QUICK REVIEW

[논문 리뷰] Social Hash Partitioner: A Scalable Distributed Hypergraph Partitioner

Igor Kabiljo, Brian Karrer|arXiv (Cornell University)|2017. 07. 20.
VLSI and FPGA Design Techniques참고 문헌 10인용 수 7
한 줄 요약

이 논문은 확률적 팬아웃을 최소화하기 위해 局소 검색 히وري스틱을 사용하는 확장 가능한 분산 초그래프 분할기인 Social Hash Partitioner(SHP)를 소개한다. 이는 수십억 개의 정점과 초간선을 가진 초그래프를 효율적으로 처리할 수 있도록 한다. SHP는 동일한 하드웨어에서 기존의 최상위 단일 머신 및 분산 분할기 수준의 해를 달성하면서도, 기존 분할기의 100배 더 큰 초그래프를 처리할 수 있다.

ABSTRACT

We design and implement a distributed algorithm for balanced $k$-way hypergraph partitioning that minimizes fanout, a fundamental hypergraph quantity also known as the communication volume and ($k-1$)-cut metric, by optimizing a novel objective called probabilistic fanout. This choice allows a simple local search heuristic to achieve comparable solution quality to the best existing hypergraph partitioners. Our algorithm is arbitrarily scalable due to a careful design that controls computational complexity, space complexity, and communication. In practice, we commonly process hypergraphs with billions of vertices and hyperedges in a few hours. We explain how the algorithm's scalability, both in terms of hypergraph size and bucket count, is limited only by the number of machines available. We perform an extensive comparison to existing distributed hypergraph partitioners and find that our approach is able to optimize hypergraphs roughly $100$ times bigger on the same set of machines. We call the resulting tool Social Hash Partitioner (SHP), and accompanying this paper, we open-source the most scalable version based on recursive bisection.

연구 동기 및 목표

  • 대규모 분산 시스템에서의 확장 가능한 초그래프 분할이 요구되는 문제를 해결하기 위해, 특히 데이터베이스의 스토리지 스파닝을 위한 것이다.
  • 기존 초그래프 분할기들이 페이스북 소셜 그래프와 같은 대규모 실세계 그래프를 처리할 때 겪는 확장성 한계를 극복하기 위해이다.
  • 분산 데이터 배치에서 쿼리 성능의 핵심 메트릭인 팬아웃(통신 볼륨)을 최소화하기 위해이다.
  • 버킷 간의 하이퍼엣지 스트레칭을 최소화하면서도 버킷 간에 부하 균형을 유지하는 분산 알고리즘을 설계하기 위해이다.
  • 증분 업데이트와 다차원 부하 균형 히وري스틱을 통해 실무 환경에서의 구현 가능성을 높이기 위해이다.

제안 방법

  • 분할 과정을 이끄는 데 효과적인 局소 검색 최적화를 가능하게 하기 위해, 새로운 목적 함수인 확률적 팬아웃(p-fanout)을 제안한다.
  • Apache Giraph 프레임워크를 기반으로 한 분산 알고리즘을 구현하며, 공간, 계산, 통신 복잡도를 철저히 제어한다.
  • 이득 계산에 기반해 정점들을 버킷 간에 이동시키는 것으로 품질을 점진적으로 향상시키는 局소 검색 히وري스틱을 사용한다.
  • 마스터-워커 아키텍처를 도입하여, 마스터가 이동을 조율하고 부하를 균형 잡고, 워커들이 할당된 정점 부분집합에서 국소 계산을 수행하도록 한다.
  • 이전 분할 결과에서 초기화하고, 이동 이득을 조정하여 과도한 재할당을 방지함으로써 증분 업데이트를 지원한다.
  • c·k개의 일시적 버킷(c > 1)을 생성하여 느슨한 균형 제약 조건을 만들고, 이후 이를 k개의 최종 버킷으로 통합하여 모든 자원 제약 조건을 충족시키는 다차원 부하 균형 히وري스틱을 적용한다.

실험 결과

연구 질문

  • RQ1새로운 목적 함수를 최적화할 때, 단순한 局소 검색 히وري스틱이 최신 기술 수준의 초그래프 분할기 수준의 해 품질을 달성할 수 있는가?
  • RQ2제안된 확률적 팬아웃 목적 함수가 확장 가능하고 효율적인 분산 초그래프 분할을 얼마나 잘 가능하게 하는가?
  • RQ3초그래프 크기와 버킷 수가 증가함에 따라 알고리즘의 성능은 어떻게 변화하는가?
  • RQ4실세계 워크로드에서 수십억 개의 정점과 초간선을 처리하면서도 부하 균형과 낮은 팬아웃을 유지할 수 있는가?
  • RQ5대규모 초그래프에서 기존의 단일 머신 및 분산 분할기와 비교해, 알고리즘의 해 품질은 어떻게 되는가?

주요 결과

  • SHP는 팬아웃 최소화 측면에서 기존 최상위 단일 머신 및 분산 초그래프 분할기(Zoltan, Mondriaan 포함)와 비교해 유사한 해 품질을 달성한다.
  • 동일한 머신 세트에서, SHP는 기존 분산 분할기가 처리할 수 있는 초그래프의 약 100배 더 큰 초그래프를 최적화할 수 있다.
  • 알고리즘은 수십억 개의 정점과 수억에서 수십억 개의 초간선을 가진 초그래프를 몇 시간 내에 정상적으로 처리한다.
  • 공간, 계산, 통신 복잡도를 철저히 제어함으로써, 알고리즘의 확장성은 사용 가능한 머신 수에 의해만 제한된다.
  • SHP는 가끔 최고의 해를 생성하지만, Zoltan 및 Mondriaan과 같은 다른 도구들이 더 낮은 팬아웃을 달성하는 경우가 많아, 목적 함수 설계의 향후 개선 여지가 있음을 시사한다.
  • p-fanout를 목적 함수로 사용함으로써 효과적인 局소 검색이 가능하고, 대규모에서 높은 해 품질을 유지할 수 있어, 대규모 분산 시스템에 적합함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.