Skip to main content
QUICK REVIEW

[논문 리뷰] Worldwide Fast File Replication on Grid Datafarm

Osamu Tatebe, Satoshi Sekiguchi|ArXiv.org|2003. 06. 14.
Distributed and Parallel Computing Systems참고 문헌 1인용 수 15
한 줄 요약

이 논문은 고성능 파일 복제 시스템을 제안하며, 그리드 데이터팜 아키텍처를 활용하여 지리적으로 분산된 클러스터 간에 페타스케일 데이터 집약적 계산 환경에서 고속 TCP를 사용하고 네트워크 스틸링 및 병렬 스트림의 비율 제어를 통해 고성능을 달성한다. 각 사이트에 4개의 노드를 사용하여 태평양 횡단 복제에서 평균 대역폭 741 Mbps를 달성하며, 장거리 고대역폭-지연 네트워크에서 확장 가능하고 안정적인 성능을 보여준다.

ABSTRACT

The Grid Datafarm architecture is designed for global petascale data-intensive computing. It provides a global parallel filesystem with online petascale storage, scalable I/O bandwidth, and scalable parallel processing, and it can exploit local I/O in a grid of clusters with tens of thousands of nodes. One of features is that it manages file replicas in filesystem metadata for fault tolerance and load balancing. This paper discusses and evaluates several techniques to support long-distance fast file replication. The Grid Datafarm manages a ranked group of files as a Gfarm file, each file, called a Gfarm file fragment, being stored on a filesystem node, or replicated on several filesystem nodes. Each Gfarm file fragment is replicated independently and in parallel using rate-controlled HighSpeed TCP with network striping. On a US-Japan testbed with 10,000 km distance, we achieve 419 Mbps using 2 nodes on each side, and 741 Mbps using 4 nodes out of 893 Mbps with two transpacific networks.

연구 동기 및 목표

  • 페타스케일 데이터 집약적 워크로드를 위한 글로벌 그룹 인fra구조에서 효율적이고 확장 가능하며 장애에 강한 파일 복제를 가능하게 하기 위해.
  • 지리적으로 분산된 클러스터 간 장거리 데이터 복제에서 고대역폭-지연 제품 네트워크의 과제를 해결하기 위해.
  • 개별 스토리지 노드의 I/O 병목을 해결하기 위해 네트워크 스틸링과 최적화된 TCP 혼잡 제어를 조합하기 위해.
  • 응용 프로그램 수준의 비율 제어와 HighSpeed TCP를 사용하여 태평양 횡단 링크(예: 미국-일본)에서 안정적이고 고대역폭 복제를 달성하기 위해.
  • SC2002에서 실시한 대규모 테스트베드를 활용하여 실제 조건에서 파일 복제 성능을 평가하기 위해.

제안 방법

  • 수천만 개의 클러스터 노드에 걸쳐 퍼블릭 로컬 스토리지와 연동된 글로벌 병렬 파일시스템을 가상화하기 위해 그리드 데이터팜 아키텍처를 사용하기 위해.
  • 장애 내성과 로드 밸런싱을 위해 메타데이터 시스템을 통해 여러 파일시스템 노드에 분산된 Gfarm 파일 조각을 추적하기 위해.
  • 다중 TCP 스트림을 사용하고 여러 노드에 걸쳐 네트워크 스틸링을 적용하여 Gfarm 파일 조각을 병렬로 독립적으로 복제하기 위해.
  • 큰 혼잡 창을 위한 고속 TCP를 도입하여 혼잡 제어를 향상시키고, 고대역폭-지연 네트워크에서 더 빠른 램프업과 더 나은 공정성 확보하기 위해.
  • HighSpeed TCP만으로는 충분하지 않은 ATM 기반의 태평양 횡단 링크에서 대역폭 안정성을 확보하기 위해 응용 프로그램 수준의 비율 제어를 적용하기 위해.
  • 1U 서버(4개의 120GB IDE 디스크)에 RAID-0 스틸링을 적용하여 1 Gbps 네트워크 대역폭과 유사한 디스크 I/O 성능(~110 MB/s)을 달성하기 위해.

실험 결과

연구 질문

  • RQ1장거리 고대역폭-지연 네트워크(예: 태평양 횡단 링크)에서 파일 복제 성능을 최대화하는 방법은 무엇인가요?
  • RQ2페타스케일 데이터 그룹에서 안정적이고 고대역폭 복제를 달성하는 데 HighSpeed TCP가 수행하는 역할은 무엇인가요?
  • RQ3단일 스트림 전송 대비 다중 병렬 TCP 스트림을 사용한 네트워크 스틸링이 복제 대역폭을 얼마나 향상시키나요?
  • RQ4HighSpeed TCP를 ATM 기반 장거리 링크에서 사용할 경우, 응용 프로그램 수준의 비율 제어가 안정성과 대역폭에 미치는 영향은 무엇인가요?
  • RQ5실제 대규모 국제 테스트베드인 SC2002 그리드 데이터팜에서의 실현 가능한 복제 대역폭는 얼마인가요?

주요 결과

  • 10,000km 거리의 미국-일본 테스트베드에서 각 사이트에 2개의 노드를 사용할 경우 419 Mbps, 4개의 노드를 사용할 경우 741 Mbps를 달성하였으며, 이는 이론적 최대값 893 Mbps에 비해 높은 성능을 보였다.
  • SC2002 전시 부스에서 12개의 노드를 사용한 결과, 평균 10초 동안의 대역폭은 1.40 Gbps( outgoing) 및 0.526 Gbps( incoming)로 총 1.926 Gbps를 기록하였다.
  • 0.1초 평균 측정치에서 피크 대역폭은 1.691 Gbps( outgoing) 및 0.595 Gbps( incoming)로 총 2.286 Gbps를 기록하였으며, 이는 12개의 노드에서 측정된 결과이다.
  • OC-12 POS 네트워크에서 HighSpeed TCP는 우수한 성능을 보였으며, 단일 노드 쌍에서 두 개의 스트림을 사용해 5초 평균 기준 529 Mbps를 달성하였다.
  • OC-12 ATM 네트워크에서는 HighSpeed TCP만으로는 충분하지 않아 응용 프로그램 수준의 비율 제어가 대역폭 안정성과 최적화를 위해 필수적이었다.
  • 네트워크 스틸링, HighSpeed TCP, 비율 제어의 조합이 여러 태평양 횡단 경로에서 안정적이고 확장 가능한 복제를 가능하게 하였으며, 북부 경로(AIST N)는 16개의 스트림을 사용해 44.0 MB/s, 남부 경로(AIST S)는 10.6 MB/s를 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.