Skip to main content
QUICK REVIEW

[논문 리뷰] Performance and Fault Tolerance in the StoreTorrent Parallel Filesystem

Federico D. Sacerdoti|arXiv (Cornell University)|2010. 01. 21.
Advanced Data Storage Technologies참고 문헌 21인용 수 4
한 줄 요약

StoreTorrent는 일반 하드웨어에서 소규모 데이터 레코드를 효율적으로 처리하기 위해 설계된 병렬 파일시스템으로, 응용프로그램-OS 파이프라인 처리와 피어 투 피어 복제 인덱스 공유를 통해 성능과 장애 내성 능력을 향상시킨다. 70개 노드에서 병렬 소작업 쓰기 성능은 1.69 GB/s, 네트워크 읽기 성능은 8.47 GB/s를 기록하여 PVFS와 Gluster를 모두 능가했다.

ABSTRACT

With a goal of supporting the timely and cost-effective analysis of Terabyte datasets on commodity components, we present and evaluate StoreTorrent, a simple distributed filesystem with integrated fault tolerance for efficient handling of small data records. Our contributions include an application-OS pipelining technique and metadata structure to increase small write and read performance by a factor of 1-10, and the use of peer-to-peer communication of replica-location indexes to avoid transferring data during parallel analysis even in a degraded state. We evaluated StoreTorrent, PVFS, and Gluster filesystems using 70 storage nodes and 560 parallel clients on an 8-core/node Ethernet cluster with directly attached SATA disks. StoreTorrent performed parallel small writes at an aggregate rate of 1.69 GB/s, and supported reads over the network at 8.47 GB/s. We ported a parallel analysis task and demonstrate it achieved parallel reads at the full aggregate speed of the storage node local filesystems.

연구 동기 및 목표

  • 일반 하드웨어를 사용하여 테라바이트 규모의 데이터셋을 비용 효율적이고 신속하게 분석할 수 있도록 하기 위해.
  • 분산 파일시스템에서 소규모 레코드 I/O 성능 저하 요인을 해결하기 위해.
  • 장애 상태에서도 I/O 성능을 희생시키지 않고 장애 내성 능력을 향상시키기 위해.
  • 병렬 분석 중 데이터 전송을 제거하기 위해 피어 투 피어 통신을 통해 복제 위치 인덱스를 공유하기 위해.
  • 실세계 병렬 워크로드에서 종단 간 성능 향상을 입증하기 위해.

제안 방법

  • 응용프로그램 수준의 I/O와 OS 수준의 시스템 콜 간의 겹침을 통해 소작업 쓰기의 지연을 감소시키기 위한 응용프로그램-OS 파이프라인 처리.
  • 소규모 레코드 메타데이터의 빠른 검색과 업데이트를 최적화한 특수 메타데이터 구조.
  • 저장소 노드 간 피어 투 피어 통신을 통해 복제 위치 인덱스를 공유하여 병렬 읽기 중 데이터 전송 없이 데이터 접근을 가능하게 하기 위해.
  • 노드 간 메타데이터와 데이터의 복제를 통해 가용성과 장애 내성 능력을 확보하기 위해.
  • 직접 연결된 SATA 디스크를 사용하는 70노드, 8코어 이더넷 클러스터에 파일시스템 통합.
  • 560개의 병렬 클라이언트를 사용하여 쓰기 및 읽기 성능을 평가하기 위해 PVFS와 Gluster와의 벤치마킹 수행.

실험 결과

연구 질문

  • RQ1응용프로그램-OS 파이프라인 처리는 분산 파일시스템에서 소규모 레코드 쓰기 성능을 크게 향상시킬 수 있는가?
  • RQ2피어 투 피어로 복제 위치 인덱스를 공유함으로써, 장애 상태일지라도 병렬 분석 중 데이터 전송을 완전히 제거할 수 있는가?
  • RQ3일반 하드웨어 기반 병렬 파일시스템이 소형 파일에 대해 달성할 수 있는 통합 I/O 성능은 어느 정도인가?
  • RQ4StoreTorrent는 PVFS와 Gluster와 같은 기존 시스템과 비교해 쓰기 및 읽기 스루풋 측면에서 어떤가?
  • RQ5장애 내성 파일시스템은 노드 장애나 네트워크 성능 저하 상태에서도 높은 성능을 유지할 수 있는가?

주요 결과

  • StoreTorrent는 70개 노드에서 병렬 소작업 쓰기 성능을 총 1.69 GB/s로 달성하여 기준 시스템 대비 뚜렷한 성능 향상을 입증했다.
  • 시스템은 저장소 노드의 통합 로컬 파일시스템 대역폭에 가까운 8.47 GB/s의 네트워크 기반 병렬 읽기 성능을 유지했다.
  • 피어 투 피어 복제 인덱스 공유 기술 덕분에 일부 노드가 장애 상태이거나 고장 났을 경우에도 병렬 분석이 데이터 전송 없이 진행될 수 있었다.
  • 응용프로그램-OS 파이프라인 처리와 최적화된 메타데이터 구조가 소작업 I/O 연산에서 1~10배의 성능 향상을 이끌어냈다.
  • 이식된 병렬 분석 작업은 로컬 저장소 서브시스템의 전체 통합 속도로 데이터 읽기 속도를 달성하여 종단 간 성능 효율성을 확인했다.
  • 동일한 테스트 조건에서 StoreTorrent는 쓰기 및 읽기 워크로드 양측에서 모두 PVFS와 Gluster를 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.