Skip to main content
QUICK REVIEW

[논문 리뷰] A New Combinatorial Coded Design for Heterogeneous Distributed Computing

Nicholas Woolsey, Rong‐Rong Chen|arXiv (Cornell University)|2020. 07. 21.
Stochastic Gradient Optimization Techniques참고 문헌 37인용 수 6
한 줄 요약

이 논문은 저장 및 계산 능력이 상이한 노드를 수용하면서도 통신 부하를 줄이는 비정형 분산 계산을 위한 새로운 조합적 코딩 설계를 제안한다. 조합적 군집 설계를 활용하여 필요한 입력 파일 수와 멀티캐스팅 그룹 수를 최소화함으로써, 원래의 코딩된 분산 계산(CDC) 기법과 유사한 곱셈적 통신 부하 감소를 달성하면서도 복잡도는 훨씬 낮고 이질적 환경에서 渐近 최적성에 도달한다.

ABSTRACT

Coded Distributed Computing (CDC) introduced by Li et al. in 2015 offers an efficient approach to trade computing power to reduce the communication load in general distributed computing frameworks such as MapReduce and Spark. In particular, increasing the computation load in the Map phase by a factor of r can create coded multicasting opportunities to reduce the communication load in the Shuffle phase by the same factor. However, the CDC scheme is designed for the homogeneous settings, where the storage, computation load and communication load on the computing nodes are the same. In addition, it requires an exponentially large number of input files (data batches), reduce functions and multicasting groups relative to the number of nodes to achieve the promised gain. We address the CDC limitations by proposing a novel CDC approach based on a combinatorial design, which accommodates heterogeneous networks where nodes have varying storage and computing capabilities. In addition, the proposed approach requires an exponentially less number of input files compared to the original CDC scheme proposed by Li et al. Meanwhile, the resulting computation-communication trade-off maintains the multiplicative gain compared to conventional uncoded unicast and asymptotically achieves the optimal performance proposed by Li et al.

연구 동기 및 목표

  • 노드의 저장, 계산, 통신 능력이 상이한 이질적 네트워크에서 기존 코딩된 분산 계산(CDC) 기법의 한계를 해결한다.
  • 실제 구현에 장애가 되는 기존 CDC 기법에서의 지수적 증가하는 필요 입력 파일 수, 필요 함수 수, 멀티캐스팅 그룹 수를 줄인다.
  • 원래 CDC 기법과 유사한 곱셈적 성능 향상을 이이지면서도 이질적 환경에서 계산-통신 간의 트레이드오프를 달성한다.
  • 이전 CDC 기법의 높은 코드 생성 오버헤드를 피하는 저복잡도 구현을 설계한다.

제안 방법

  • 해결 가능한 균형 불완전 블록 설계(BIBD)를 기반으로 한 조합적 설계를 제안하여 파일 배치 및 코딩된 멀티캐스팅 그룹을 체계화한다.
  • 각 중간 값이 r개의 노드에서 계산되도록 파일과 감소 함수를 노드에 할당함으로써 셰플 단계에서 코딩된 멀티캐스팅을 가능하게 한다.
  • 전송 순서를 순열 기반으로 정의하여 필요한 중간 값의 엔트로피를 제한하고, 통신 부하의 하한을 유도한다.
  • 노드별 파일 집합(M_k)과 필요 함수 집합(W_k)을 정의하여 이질적 능력을 모델링한다.
  • 중간 값의 조건부 엔트로피에 대한 정보이론적 부등식을 사용하여 최적 통신 부하 L*에 대한 하한을 유도한다.
  • 제안된 기법이 r ≥ 2일 때 L_c / L* ≤ 4임을 입증하여 근사 최적성임을 보여준다.

실험 결과

연구 질문

  • RQ1저장 및 처리 능력이 상이한 이질적 분산 시스템에서 효율적으로 작동하는 코딩된 분산 계산 기법을 설계할 수 있는가?
  • RQ2원래 CDC 기법에 비해 필요한 입력 파일 수와 멀티캐스팅 그룹 수를 줄일 수 있는가, 동시에 통신 부하 감소 성능을 유지할 수 있는가?
  • RQ3어떤 조합적 구조가 이질적 네트워크에서 효율적인 파일 배치 및 코딩된 멀티캐스팅을 가능하게 하는가?
  • RQ4제안된 기법이 이질적 환경에서 이론적 하한에 가까운 통신 부하를 달성할 수 있는가?
  • RQ5이질적 노드 제약 조건 하에서 계산 부하와 통신 부하 간의 트레이드오프는 어떠한가?

주요 결과

  • 제안된 기법은 필요 입력 파일 수와 멀티캐스팅 그룹 수를 노드 수에 대해 다항식 수준으로 줄여 실용적 구현을 가능하게 한다.
  • 기존 CDC 기법과 동일한 곱셈적 통신 부하 감소 요인 r을 달성하여 통신 부하를 r 배 감소시킨다.
  • 제안된 기법의 통신 부하는 최적 하한에 대해 최대 4배 이내이며, r ≥ 2일 때 L_c / L* ≤ 4임을 입증한다.
  • 동질적 조건 하에서 Li 등이 제안한 원래 CDC 기법의 최적 성능을 渐近적으로 달성한다.
  • 정보이론적 하한이 도출되었고, 제안된 설계 하에서 이 하한이 날카로워지며 근사 최적성임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.