Skip to main content
QUICK REVIEW

[论文解读] Optimal Repair Layering for Erasure-Coded Data Centers: From Theory to Practice

Yuchong Hu, Xiaolu Li|arXiv (Cornell University)|Apr 12, 2017
Advanced Data Storage Technologies参考文献 53被引用 11
一句话总结

本文提出 DoubleR,一种用于纠删码数据中心的实际修复分层框架,通过采用分层块放置和两类双再生码(DRC),最小化跨机架修复流量。该框架在 HDFS 部署中实现了最优的跨机架修复流量,同时在节点恢复性能和降级读取性能方面优于当前最先进的再生码。

ABSTRACT

Repair performance in hierarchical data centers is often bottlenecked by cross-rack network transfer. Recent theoretical results show that the cross-rack repair traffic can be minimized through repair layering, whose idea is to partition a repair operation into inner-rack and cross-rack layers. However, how repair layering should be implemented and deployed in practice remains an open issue. In this paper, we address this issue by proposing a practical repair layering framework called DoubleR. We design two families of practical double regenerating codes (DRC), which not only minimize the cross-rack repair traffic, but also have several practical properties that improve state-of-the-art regenerating codes. We implement and deploy DoubleR atop Hadoop Distributed File System (HDFS), and show that DoubleR maintains the theoretical guarantees of DRC and improves the repair performance of regenerating codes in both node recovery and degraded read operations.

研究动机与目标

  • 通过最小化跨机架修复流量,解决分层数据中心中跨机架网络带宽的瓶颈问题。
  • 弥合理论修复分层与纠删码存储系统实际部署之间的差距。
  • 设计实用的双再生码(DRC),在保持理论上的跨机架修复最优性的同时,支持真实环境部署。
  • 在真实 HDFS 环境中评估 DRC 的性能,重点关注节点恢复和降级读取操作。
  • 分析最小化跨机架流量与降低机架级容错能力之间的权衡。

提出的方法

  • 通过将修复过程拆分为机架内和跨机架两个阶段,引入修复分层,以减少对受限跨机架带宽的依赖。
  • 提出分层块放置,即每条数据条带的多个块存储于每个机架中,从而实现在机架内进行局部部分修复。
  • 设计两类双再生码(DRC),在保持 MDS 性质和修复最优性的同时,实现最小的跨机架修复流量。
  • 采用两阶段修复流程:首先在每个机架内使用本地块进行部分修复,随后将部分结果通过跨机架传输至目标节点。
  • 在 Hadoop 分布式文件系统(HDFS)上实现 DoubleR,以评估实际性能并验证理论保证。
  • 使用数值分析和可靠性分析,量化减少机架容错能力与最小化跨机架流量之间的权衡。

实验结果

研究问题

  • RQ1与现有再生码相比,修复分层是否能显著减少分层数据中心中的跨机架修复流量?
  • RQ2在分层纠删码中,最小化跨机架修复流量与降低机架级容错能力之间的权衡是什么?
  • RQ3能否构建出实用的双再生码(DRC),使其在实现理论上的跨机架修复最优性的同时,支持高效实现?
  • RQ4在真实 HDFS 部署中,DoubleR 在节点恢复吞吐量和降级读取时间方面的表现如何?
  • RQ5在何种网络带宽条件下,DRC 优于传统再生码和 RS 码?

主要发现

  • 通过修复分层和 DRC 构造,DoubleR 将跨机架修复流量减少至理论最小值。
  • 在 HDFS 中的原型实现表明,与当前最先进的再生码相比,DoubleR 提升了节点恢复吞吐量并减少了降级读取时间。
  • DRC 的第一类需要从磁盘读取 n−1 个块以实现最小的跨机架修复流量,此方面效率与 MSR 码相当。
  • DRC 的总修复流量(包括机架内和跨机架)高于 MSR 码,但跨机架部分被最小化,因此在跨机架带宽受限条件下达到最优。
  • 当跨机架带宽充足时(例如 2 Gb/s 网关),DRC 的修复优势减弱,证实其优势在带宽受限条件下最为显著。
  • 可靠性分析表明,当机架故障较少时,降低的机架级容错能力是可以接受的,从而合理化为提升修复性能所作的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。