Skip to main content
QUICK REVIEW

[论文解读] A Robust Fault-Tolerant and Scalable Cluster-wide Deduplication for Shared-Nothing Storage Systems

Awais Khan, Chang-Gyu Lee|arXiv (Cornell University)|Mar 21, 2018
Advanced Data Storage Technologies参考文献 13被引用 3
一句话总结

本文提出了一种可扩展、容错且适用于共享无依赖存储系统(如 Ceph)的集群范围去重框架,采用基于内容的指纹识别与带标签的一致性机制,消除元数据瓶颈并确保事务完整性。该方法在性能开销极小的情况下实现高存储效率,并具备强大的故障恢复能力。

ABSTRACT

Deduplication has been largely employed in distributed storage systems to improve space efficiency. Traditional deduplication research ignores the design specifications of shared-nothing distributed storage systems such as no central metadata bottleneck, scalability, and storage rebalancing. Further, deduplication introduces transactional changes, which are prone to errors in the event of a system failure, resulting in inconsistencies in data and deduplication metadata. In this paper, we propose a robust, fault-tolerant and scalable cluster-wide deduplication that can eliminate duplicate copies across the cluster. We design a distributed deduplication metadata shard which guarantees performance scalability while preserving the design constraints of shared- nothing storage systems. The placement of chunks and deduplication metadata is made cluster-wide based on the content fingerprint of chunks. To ensure transactional consistency and garbage identification, we employ a flag-based asynchronous consistency mechanism. We implement the proposed deduplication on Ceph. The evaluation shows high disk-space savings with minimal performance degradation as well as high robustness in the event of sudden server failure.

研究动机与目标

  • 解决共享无依赖存储系统(SN-SS)中可扩展且容错的去重机制缺失的问题,此类系统传统上在故障情况下易出现元数据瓶颈与一致性问题。
  • 克服集中式去重元数据服务器与低效的数据库分片方法的局限性,后者在存储再平衡期间导致广播式查找与高 I/O 开销。
  • 在不依赖昂贵的日志记录或检查点机制的前提下,确保事务一致性与垃圾数据块的检测。
  • 设计一种保持共享无依赖架构的同时,实现集群范围去重检测与高效元数据管理的系统。

提出的方法

  • 使用数据块的内容指纹确定其在集群中的全局位置,避免在所有分片间广播元数据查找。
  • 实现一个与对象存储服务器共置的分布式去重元数据分片(DM-Shard),保持共享无依赖特性并支持水平扩展。
  • 引入一种异步带标签一致性机制,通过每个块或对象的提交标志追踪事务状态,避免阻塞 I/O 或需要事务锁。
  • 利用 Ceph 中的 CRUSH 数据放置机制,确保负载均匀分布,并通过指纹高效解析块位置。
  • 设计系统以自动检测并清理失败事务产生的垃圾块,利用带标签一致性模型。
  • 将解决方案集成至 Ceph,并通过不同工作负载与故障场景的真实测试平台进行评估。

实验结果

研究问题

  • RQ1如何在共享无依赖存储系统中实现去重元数据的可扩展与去中心化,同时避免引入中心瓶颈或过高的 I/O 开销?
  • RQ2在突发存储服务器故障的情况下,何种机制可确保分布式去重系统中的事务一致性与容错性?
  • RQ3在集群范围去重环境中,基于内容的块指纹识别如何提升元数据查找效率并减少广播查询?
  • RQ4与传统的基于锁或日志的一致性模型相比,所提出的带标签一致性机制在性能开销方面降低了多少?
  • RQ5随着磁盘数量的增加,所提出的集群范围去重方法与基于本地磁盘的去重相比,在存储效率方面表现如何?

主要发现

  • 在 1 至 8 块磁盘的场景下,集群范围去重方法实现了 85% 的存储空间节省;而基于磁盘的去重在 8 块磁盘时效率下降至 61%,原因在于缺乏跨磁盘重复检测。
  • 在 32 个客户端线程下,集中式去重方法因元数据服务器争用导致带宽降至 200 MB/s,而所提出的集群范围方法保持可扩展性,并随并发增加而提升带宽。
  • 与块级和对象级一致性模型相比,异步带标签一致性机制的性能开销可忽略不计;后者因事务锁导致性能下降超过 15%。
  • 系统在突发服务器故障下表现出高度鲁棒性,能正确识别并处理垃圾块,无需额外监控或日志记录。
  • 可扩展性分析表明,在高 I/O 竞争环境下,所提系统优于集中式去重,得益于分布式的元数据与基于负载感知的 CRUSH 放置,带宽随客户端线程数增加而提升。
  • 该解决方案消除了对集中式元数据服务器的依赖,避免了广播式元数据查找,从而在共享无依赖架构中实现高效且可扩展的集群范围去重。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。