Skip to main content
QUICK REVIEW

[论文解读] TOFEC: Achieving Optimal Throughput-Delay Trade-off of Cloud Storage Using Erasure Codes

Guanfeng Liang, Ulaş C. Kozat|arXiv (Cornell University)|Jul 30, 2013
Advanced Data Storage Technologies参考文献 22被引用 4
一句话总结

TOFEC 是一种自适应擦除编码策略,通过动态调整云存储中的分块大小和冗余级别,实现最优的吞吐量-延迟权衡。通过监控本地积压情况,它在轻载时采用高分块/并行处理,在重载时降低冗余度,与延迟优化的静态策略相比,延迟降低高达 2.5 倍,与吞吐量优化策略相比,请求容量提升 3 倍。

ABSTRACT

Our paper presents solutions using erasure coding, parallel connections to storage cloud and limited chunking (i.e., dividing the object into a few smaller segments) together to significantly improve the delay performance of uploading and downloading data in and out of cloud storage. TOFEC is a strategy that helps front-end proxy adapt to level of workload by treating scalable cloud storage (e.g. Amazon S3) as a shared resource requiring admission control. Under light workloads, TOFEC creates more smaller chunks and uses more parallel connections per file, minimizing service delay. Under heavy workloads, TOFEC automatically reduces the level of chunking (fewer chunks with increased size) and uses fewer parallel connections to reduce overhead, resulting in higher throughput and preventing queueing delay. Our trace-driven simulation results show that TOFEC's adaptation mechanism converges to an appropriate code that provides the optimal delay-throughput trade-off without reducing system capacity. Compared to a non-adaptive strategy optimized for throughput, TOFEC delivers 2.5x lower latency under light workloads; compared to a non-adaptive strategy optimized for latency, TOFEC can scale to support over 3x as many requests.

研究动机与目标

  • 解决因固定擦除编码参数导致云存储系统吞吐量-延迟权衡不佳的问题。
  • 克服非自适应策略的局限性,这些策略要么牺牲系统容量(高冗余度),要么导致高延迟(低冗余度)。
  • 设计一种动态自适应机制,利用积压作为反馈信号响应工作负载变化。
  • 在所有工作负载条件下实现延迟-吞吐量性能的理论下包络线。
  • 为键值型云存储系统(如 Amazon S3)提供一种实用且可外部部署的解决方案,无需修改底层系统内部结构。

提出的方法

  • 使用 MDS 码 (n,k) 进行擦除编码,将文件拆分为 k 个原始块和 n−k 个冗余块,实现并行传输。
  • 采用基于积压的自适应算法,通过监控系统队列长度来确定最优分块和冗余级别。
  • 在轻载工作负载下,动态增加分块数量(更高 k)和并行连接数,以最小化延迟。
  • 在重载工作负载下,减少分块数量(更低 k)和并行连接数,以降低协议和网络开销,最大化吞吐量。
  • 将云存储视为共享资源,实施准入控制,根据观察到的系统状态实时调整编码参数。
  • 与现有云存储 API 集成,作为外部代理层运行,无需修改底层存储系统。

实验结果

研究问题

  • RQ1自适应擦除编码策略能否在不同工作负载下动态平衡云存储的吞吐量与延迟?
  • RQ2在使用擦除编码的键值型云存储系统中,吞吐量与延迟之间的最优权衡是什么?
  • RQ3在真实世界 trace 中,动态调整分块大小和冗余级别与固定或启发式自适应策略相比表现如何?
  • RQ4基于积压的反馈机制能否有效引导编码参数自适应,以实现接近最优的性能?
  • RQ5动态作业大小和冗余度对系统容量和延迟可变性有何影响?

主要发现

  • TOFEC 在所有工作负载下均达到延迟-吞吐量性能的下包络线,在容量区域的每个点上均与最佳静态策略表现一致。
  • 在轻载情况下,TOFEC 相较于延迟优化的静态策略,平均延迟降低 2.5 倍。
  • 在重载情况下,TOFEC 支持的请求数量超过吞吐量优化的静态策略的 3 倍,同时保持高系统容量。
  • TOFEC 的自适应过程平滑且集中:超过 80% 的请求在每个工作负载级别下仅使用两个相邻的 k 值,确保服务质量稳定。
  • 相比之下,贪婪启发式策略在 k=1 和 k=6 之间频繁跳变,导致延迟标准差高出 2–3 倍。
  • TOFEC 能够快速适应工作负载变化,在到达率变化后数秒内收敛到最优编码参数,而静态策略则会积累大量积压。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。