Skip to main content
QUICK REVIEW

[论文解读] Worldwide Fast File Replication on Grid Datafarm

Osamu Tatebe, Satoshi Sekiguchi|ArXiv.org|Jun 14, 2003
Distributed and Parallel Computing Systems参考文献 1被引用 15
一句话总结

本文提出了一种基于Grid Datafarm架构的高性能文件复制系统,适用于千万亿字节级数据密集型计算,利用高速TCP协议结合网络分条与跨地理分布集群的速率控制并行流,实现了跨太平洋复制平均741 Mbps的带宽,展示了在长距离、高带宽-延迟网络中可扩展且稳定的性能表现。

ABSTRACT

The Grid Datafarm architecture is designed for global petascale data-intensive computing. It provides a global parallel filesystem with online petascale storage, scalable I/O bandwidth, and scalable parallel processing, and it can exploit local I/O in a grid of clusters with tens of thousands of nodes. One of features is that it manages file replicas in filesystem metadata for fault tolerance and load balancing. This paper discusses and evaluates several techniques to support long-distance fast file replication. The Grid Datafarm manages a ranked group of files as a Gfarm file, each file, called a Gfarm file fragment, being stored on a filesystem node, or replicated on several filesystem nodes. Each Gfarm file fragment is replicated independently and in parallel using rate-controlled HighSpeed TCP with network striping. On a US-Japan testbed with 10,000 km distance, we achieve 419 Mbps using 2 nodes on each side, and 741 Mbps using 4 nodes out of 893 Mbps with two transpacific networks.

研究动机与目标

  • 在千万亿字节级数据密集型工作负载下,实现高效、可扩展且具备容错能力的全球网格基础设施文件复制。
  • 解决在地理分布集群之间长距离数据复制中高带宽-延迟积网络带来的挑战。
  • 通过结合网络分条与优化的TCP拥塞控制,克服单个存储节点的I/O瓶颈。
  • 利用应用层速率控制与高速TCP,在跨太平洋链路(如美国-日本)上实现稳定、高吞吐量的复制。
  • 通过SC2002大会大规模测试平台,在真实世界条件下评估文件复制的性能表现,涵盖多个国际站点。

提出的方法

  • 利用Grid Datafarm架构,在数万个集群节点上虚拟化一个全球并行文件系统,实现联邦式本地存储管理。
  • 通过元数据系统管理文件副本,跟踪多个文件系统节点上的Gfarm文件片段,以实现容错与负载均衡。
  • 通过在多个节点间使用网络分条技术,实现多个独立TCP流的并行、独立文件片段复制。
  • 采用高速TCP协议,提升大拥塞窗口下的拥塞控制性能,实现更快的拥塞窗口增长与高带宽-延迟积网络中的更好公平性。
  • 在ATM基础的跨太平洋链路上,应用层速率控制用于稳定吞吐量,因高速TCP协议本身不足以满足需求。
  • 在1U服务器(四块120GB IDE磁盘)上使用RAID-0分条技术,实现约110 MB/s的磁盘I/O性能,与1 Gbps网络带宽相当。

实验结果

研究问题

  • RQ1如何在长距离、高带宽-延迟积网络(如跨太平洋链路)中最大化文件复制性能?
  • RQ2高速TCP在千万亿字节级数据网格中实现稳定、高吞吐量复制中发挥何种作用?
  • RQ3与单流传输相比,使用多条并行TCP流进行网络分条在提升复制带宽方面有多大改善?
  • RQ4在ATM基础的长距离链路上使用高速TCP时,应用层速率控制对稳定性与吞吐量的影响如何?
  • RQ5在类似SC2002网格数据农场这样的真实世界大规模国际测试平台中,可实现的复制带宽是多少?

主要发现

  • 在美国-日本测试平台(距离10,000公里)上,每站点使用2个节点时达到419 Mbps,使用4个节点时达到741 Mbps,占理论峰值893 Mbps的83%。
  • 在SC2002展台使用12个节点时,10秒平均带宽达到1.40 Gbps(出站)与0.526 Gbps(入站),总计1.926 Gbps。
  • 在0.1秒平均测量中,峰值带宽达到1.691 Gbps(出站)与0.595 Gbps(入站),总计2.286 Gbps,覆盖12个节点。
  • 在OC-12 POS网络上,高速TCP表现良好,单节点对使用两条流时,5秒平均达到529 Mbps。
  • 在OC-12 ATM网络上,仅靠原始高速TCP无法稳定并最大化吞吐量,必须依赖应用层速率控制。
  • 网络分条、高速TCP与速率控制的结合,实现了跨多个跨太平洋路径的稳定、可扩展复制,其中北部路径(AIST N)达到44.0 MB/s,南部路径(AIST S)达到10.6 MB/s,每节点对使用16条流。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。