Skip to main content
QUICK REVIEW

[논문 리뷰] MDS coding is better than replication for job completion times

Ken R. Duffy, Seva Shneer|arXiv (Cornell University)|2019. 07. 25.
Cooperative Communication and Network Coding참고 문헌 31인용 수 5
한 줄 요약

이 논문은 큐 상태가 디스patcher에게 가시하지 않은 다중 서버 환경에서, 최대 거리 분리(MDS) 코드화가 복제보다 작업 완료 시간을 줄이는 데 더 우수하다는 것을 보여준다. n개의 작업을 무작위 서버에 전송하는 n+m개의 선형 조합으로 인코딩함으로써, 어떤 n개의 인코딩된 작업이 완료되면 배치가 완료되며, 이는 m에 대해 선형 스케일링을 제공한다. 반면 복제는 d개의 복제본에 따라 곱셈적 비용을 지닌다. 이는 특히 스트래글러가 많은 환경에서 훨씬 더 빠르고 신뢰할 수 있는 성능을 제공한다.

ABSTRACT

In a multi-server system, how can one get better performance than random assignment of jobs to servers if queue-states cannot be queried by the dispatcher? A replication strategy has recently been proposed where $d$ copies of each arriving job are sent to servers chosen at random. The job's completion time is the first time that the service of any of its copies is complete. On completion, redundant copies of the job are removed from other queues so as not to overburden the system. For digital jobs, where the objects to be served can be algebraically manipulated, and for servers whose output is a linear function of their input, here we consider an alternate strategy: Maximum Distance Separable (MDS) codes. For every batch of $n$ digital jobs that arrive, $n+m$ linear combinations are created over the reals or a large finite field, and each coded job is sent to a random server. The batch completion time is the first time that any $n$ of the $n+m$ coded jobs are served, as the evaluation of $n$ original jobs can be recovered by Gaussian elimination. If redundant jobs can be removed from queues on batch completion, we establish that in order to get the improved response-time performance of sending $d$ copies of each of $n$ jobs via the replication strategy, with the MDS methodology it suffices to send $n+d$ jobs. That is, while replication is multiplicative, MDS is linear.

연구 동기 및 목표

  • 디스패처가 큐 상태에 접근할 수 없는 다중 서버 시스템에서 작업 완료 시간을 최소화하는 데 도전하는 것.
  • 이러한 제약 조건 하에서 복제(복제본 d개 전송)와 MDS 코드화(작업을 n+m개의 선형 조합으로 인코딩)의 성능을 비교하는 것.
  • 특히 尾부 지연을 줄이고 스트래글러 문제를 완화함으로써 MDS 코드화가 더 나은 응답 시간 성능을 제공한다는 것을 입증하는 것.
  • 크기가 충분히 큰 m에 대해, MDS 코드화가 복제보다 완료 시간 분포를 확률적으로 더 우수하게 만든다는 것을 공식적으로 분석하고 증명하는 것.

제안 방법

  • 시스템은 실수 또는 큰 유한체 위에서 n개의 원본 작업을 n+m개의 무작위 선형 조합으로 인코딩하고, 각 인코딩된 작업을 무작위로 선택된 서버에 배포한다.
  • 배치 완료 시간은 n+m개의 인코딩된 작업 중 어느 n개가 완료되는 첫 번째 시간으로 정의되며, 가우스 소거법을 통해 원본 n개의 작업을 복구할 수 있다.
  • 분석은 작업 체류 시간을 동일한 분포 F_W(t)를 가진 i.i.d. 랜덤 변수로 모델링하고, i.i.d. 랜덤 변수의 순서통계량을 이용해 완료 시간 분포의 尾부 행동을 유도한다.
  • 논문은 기존의 순서통계량 결과를 활용하고, 비복원 응답 시간의 꼬리 생존함수에 대한 미분방정식을 유도한다. 이는 작업량과 지수 분포 서비스 시간을 포함한다.
  • m ≥ 4일 때, MDS 완료 시간 분포가 모든 시간점에서 복제보다 확률적으로 지배됨을 증명한다. 이는 꼬리 영역 뿐 아니라 전체 분포에 걸쳐 성립한다.
  • 증명은 생존함수의 渐近 분석에 기반하며, 꼬리에서 지수 감쇠가 일어남을 보이고, 충분히 큰 m에 대해 MDS 응답 시간이 복제보다 확률적으로 작다는 것을 입증한다.

실험 결과

연구 질문

  • RQ1큐 상태가 알려지지 않은 상황에서 MDS 코드화가 복제보다 더 나은 작업 완료 시간 성능을 제공하는가?
  • RQ2복제가 복제본 수 d에 의존하는 것과는 대비하여, MDS 코드화의 성능은 부가적인 인코딩된 작업 수 m에 따라 어떻게 스케일링되는가?
  • RQ3MDS 코드화가 완료 시간 분포에서 복제를 확률적으로 지배하기 시작하는 시점은 언제인가?
  • RQ4분산 컴퓨팅 환경에서 MDS 코드화는 복제보다 스트래글러 문제를 더 효과적으로 줄일 수 있는가?
  • RQ5MDS 코드화와 복제 하에서의 완료 시간 꼬리 행동 간의 수학적 관계는 무엇인가?

주요 결과

  • MDS 코드화는 부가적인 복제 작업 수에 대해 지수적으로 증가하는 개선을 통해 배치 완료 시간 분포의 꼬리를 줄임으로써 복제보다 더 나은 성능을 달성한다.
  • m ≥ 4일 때, MDS 배치 완료 시간 분포는 모든 시간점에서 복제보다 확률적으로 작다. 이는 꼬리 영역 뿐 아니라 전체 분포에 걸쳐 성립한다.
  • 성능 향상은 m에 대해 선형적이다: d개의 복제본의 응답 시간을 따라잡기 위해 MDS는 오직 n + d개의 인코딩된 작업만 필요하며, 이는 복제의 곱셈적 스케일링보다 더 효율적이다.
  • MDS 하의 완료 시간은 n+m개의 i.i.d. 체류 시간 중 n번째 순서통계량에 의해 결정되며, 이는 복제 시 d개의 i.i.d. 시간 중 최소값보다 꼬리가 더 빨리 감쇠함을 의미한다.
  • 분석은 MDS 응답 시간의 생존함수가 지수적으로 감쇠하며, 그 감쇠 속도는 부가적인 복제 작업 수에 따라 달라지며, 큰 m에 대해 복제보다 더 빠르게 감쇠됨을 입증한다.
  • 논문은 MDS 코드화가 꼬리에서 뿐 아니라 m ≥ 4일 때 전체 분포에서 복제를 지배함을 확립하여, 모든 성능 영역에서의 우수성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.