Skip to main content
QUICK REVIEW

[논문 리뷰] Repair Pipelining for Erasure-Coded Storage: Algorithms and Evaluation

Xiaolu Li, Zuoru Yang|arXiv (Cornell University)|2019. 08. 05.
Advanced Data Storage Technologies인용 수 4
한 줄 요약

이 논문은 복구 파이프라인화를 제안하며, 작은 데이터 슬라이스를 노드 간에 파이프라인 방식으로 스케줄링하여 단일 블록 에러코드 저장소의 복구 시간을 일반 읽기와 거의 동일하게 줄이는 기법이다. 이는 이질적, 계층적, 다중 블록 복구 환경 전반에서 거의 최적에 가까운 복구 성능을 달성하며, HDFS 및 QFS에서의 평가 결과 뚜렷한 성능 향상을 보였다.

ABSTRACT

We propose repair pipelining, a technique that speeds up the repair performance in general erasure-coded storage. By carefully scheduling the repair of failed data in small-size units across storage nodes in a pipelined manner, repair pipelining reduces the single-block repair time to approximately the same as the normal read time for a single block in homogeneous environments. We further design different extensions of repair pipelining algorithms for heterogeneous environments and multi-block repair operations. We implement a repair pipelining prototype, called ECPipe, and integrate it as a middleware system into two versions of Hadoop Distributed File System (HDFS) (namely HDFS-RAID and HDFS-3) as well as Quantcast File System (QFS). Experiments on a local testbed and Amazon EC2 show that repair pipelining significantly improves the performance of degraded reads and full-node recovery over existing repair techniques.

연구 동기 및 목표

  • 에러코드 저장소의 높은 복구 비용으로 인해 저장 효율성은 높지만 핫 데이터에선 사용이 제한되는 문제를 해결하기 위해.
  • 과도한 데이터 읽기와 대역폭 소비로 인해 단일 블록 복구가 일반 읽기보다 느린 문제를 해결하기 위해.
  • 복구 시간을 일반 읽기 수준으로 줄여 핫 데이터에 대한 에러코드를 가능하게 하여 저장 효율성은 유지하면서 액세스 속도를 희생시키지 않기 위해.
  • 이종 환경, 계층적 데이터 센터, 다중 블록 복구 작업을 지원하기 위해 복구 파이프라인화를 확장하기 위해.
  • 기존 분산 저장소 시스템(HDFS 및 QFS 등)에 통합 가능한 실용적인 미들웨어 시스템(ECPipe)을 설계하고 구현하기 위해.

제안 방법

  • 각 블록을 작은 크기의 슬라이스로 분해하여 다수의 저장소 노드를 통해 세밀한 수준의 파이프라인 복구를 가능하게 하기 위해.
  • 웜홀 라우팅 유사한 파이프라인 방식으로 슬라이스 복구를 스케줄링하여 대역폭 사용을 균형 잡고 노드 간의 유휴 시간을 최소화하기 위해.
  • 이종 환경에서 링크 대역폭이 상이할 경우 병렬 읽기와 가중 경로 선택을 적용하여 복구를 최적화하기 위해.
  • HDFS-RAID, HDFS-3, QFS에 ECPipe라는 미들웨어 프로토타입을 통합하여 역호환성을 확보하기 위해.
  • 리드-솔로몬 및 로컬 복구 코드를 포함한 다양한 에러코드를 지원하여 광범위한 적용 가능성을 확보하기 위해.
  • 병렬 처리와 계층적 토폴로지 인식 기능을 활용하여 전체 노드 복구 및 다중 블록 복구에 대해 접근을 확장하기 위해.

실험 결과

연구 질문

  • RQ1복구 파이프라인화는 단일 블록에 대해 에러코드 저장소의 복구 시간을 일반 읽기와 거의 동일하게 줄일 수 있는가?
  • RQ2다양한 네트워크 대역폭을 가진 이종 환경에 대해 복구 파이프라인화는 어떻게 확장될 수 있는가?
  • RQ3계층적 데이터 센터 토폴로지에 대해 복구 파이프라인화를 효과적으로 적용하여 레이크 간 복구 트래픽을 최소화하면서 복구 지연을 줄일 수 있는가?
  • RQ4다중 블록 복구 시나리오에서 복구 파이프라인화는 어떻게 성능을 발휘하는가? 특히 스트라이프 내에서 다수의 블록이 동시에 장애가 발생할 경우 어떻게 되는가?
  • RQ5실제 생산 환경 시스템인 HDFS 및 QFS에 통합된 복구 파이프라인화의 실제 성능 향상은 어떠한가?

주요 결과

  • 복구 파이프라인화는 동일한 환경에서 단일 블록 복구 시간을 일반 읽기 시간과 거의 동일하게 줄였다.
  • 이 기법은 열악한 읽기 성능에서 뚜렷한 성능 향상을 이끌어내어 기존 복구 방법 대비 복구 지연을 최대 70%까지 감소시켰다.
  • 아마존 EC2 실험에서 복구 파이프라인화는 표준 에러코드 복구 대비 전체 노드 복구에서 최대 5.2배의 성능 향상을 달성했다.
  • ECPipe 프로토타입은 HDFS-RAID 및 HDFS-3에 성공적으로 통합되어 낮은 오버헤드와 기존 시스템과의 원활한 호환성을 입증했다.
  • 계층적 토폴로지에서 복구 파이프라인화는 레이크 간 복구 트래픽을 최소화하면서도 복구 시간을 추가로 단축시켜 이전의 토폴로지 인식 기반 기법(CAR 및 LAR)을 능가했다.
  • 평가 결과 복구 파이프라인화는 이전에 복구 지연으로 인해 핫 데이터에 제한되었던 에러코드의 사용을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.