Skip to main content
QUICK REVIEW

[论文解读] PACEMAKER: Avoiding HeART attacks in storage clusters with disk-adaptive redundancy

Saurabh Kadekodi, Francisco Maturana|arXiv (Cornell University)|Mar 15, 2021
Advanced Data Storage Technologies被引用 6
一句话总结

PACEMAKER 是一种主动冗余编排系统,通过智能组织数据布局并提前启动转换,消除了存储集群中的转换过载问题,将峰值 IO 使用率降低至 5% 以下,同时在不损害数据保护的前提下实现了 14–20% 的空间节省。

ABSTRACT

Data redundancy provides resilience in large-scale storage clusters, but imposes significant cost overhead. Substantial space-savings can be realized by tuning redundancy schemes to observed disk failure rates. However, prior design proposals for such tuning are unusable in real-world clusters, because the IO load of transitions between schemes overwhelms the storage infrastructure (termed transition overload). This paper analyzes traces for millions of disks from production systems at Google, NetApp, and Backblaze to expose and understand transition overload as a roadblock to disk-adaptive redundancy: transition IO under existing approaches can consume 100% cluster IO continuously for several weeks. Building on the insights drawn, we present PACEMAKER, a low-overhead disk-adaptive redundancy orchestrator. PACEMAKER mitigates transition overload by (1) proactively organizing data layouts to make future transitions efficient, and (2) initiating transitions proactively in a manner that avoids urgency while not compromising on space-savings. Evaluation of PACEMAKER with traces from four large (110K-450K disks) production clusters show that the transition IO requirement decreases to never needing more than 5% cluster IO bandwidth (0.2-0.4% on average). PACEMAKER achieves this while providing overall space-savings of 14-20% and never leaving data under-protected. We also describe and experiment with an integration of PACEMAKER into HDFS.

研究动机与目标

  • 解决磁盘自适应冗余中的关键问题——转换过载,即反应式转换会持续占用集群 100% 的 IO 带宽长达数周,导致数据保护不足的风险。
  • 克服现有反应式方法的局限性,这些方法仅在检测到 AFR 增加后才触发紧急且高 IO 的转换。
  • 通过最小化 IO 开销并最大化在各种磁盘部署模式(渐进式与阶梯式部署)下的空间节省,实现磁盘自适应冗余的实用化部署。
  • 通过避免转换阶段的数据保护不足,确保数据可靠性始终得到维持。
  • 设计一种系统,主动组织数据并调度转换,与以往方法相比,将总转换 IO 降低 90% 以上。

提出的方法

  • 主动重新组织数据布局,将具有相似故障率和部署模式的磁盘分组,以支持高效的批量转换。
  • 采用非参数核密度估计(Epanechnikov 核,带宽为 30 天)来追踪故障率,无需假设参数分布。
  • 基于观测到的 AFR 趋势进行预测建模,在故障率阈值达到之前提前启动转换。
  • 将转换分解为低影响类型:清空磁盘(类型 1)、批量校验码重新计算(类型 2)和部分数据迁移(类型 3),优先执行低 IO 操作。
  • 通过在低活动时段调度转换并均匀分配工作负载,将转换 IO 控制在集群带宽的 5% 以内。
  • 与 HDFS 集成,以证明其在真实环境中的可行性,并在类似生产环境的条件下评估端到端性能。

实验结果

研究问题

  • RQ1磁盘自适应冗余系统中转换过载的根本原因是什么?为何现有反应式方法在真实集群中失效?
  • RQ2不同的磁盘部署模式(渐进式与阶梯式部署)如何影响冗余转换的 IO 成本与时间安排?
  • RQ3主动数据布局与转换调度能否在保持数据可靠性的同时显著降低总转换 IO 并实现显著的空间节省?
  • RQ4在不损害数据保护的前提下,系统可承受的最大 IO 开销是多少?如何强制执行该限制?
  • RQ5该系统在具有不同磁盘群体与故障率行为的多样化生产规模集群中表现如何?

主要发现

  • 转换过载是磁盘自适应冗余的主要障碍:现有反应式系统在转换期间会持续占用高达 100% 的集群 IO 带宽长达数周。
  • PACEMAKER 将峰值转换 IO 降低至集群带宽的 5% 以下,平均 IO 仅为 0.2–0.4%,在所有评估的集群中彻底消除了转换过载。
  • 在四个大规模集群(110K–450K 块磁盘)中,系统实现了平均 14–20% 的空间节省,其中 Google Cluster2 节省了超过 10 万块磁盘(带来数百万的成本节省)。
  • 在 Backblaze 集群(渐进式部署)中,由于采用渐进且主动的转换策略,转换 IO 连续分布在 6 年以上,未出现大的 IO 峰值。
  • 通过主动布局与调度,超过 90% 的总转换 IO 被消除,其中在阶梯式部署集群中,98% 的转换通过高效的批量校验码重新计算完成。
  • PACEMAKER 通过在故障率阈值达到前启动转换,将数据保护不足的风险保持为零,确保了持续的数据保护。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。