Skip to main content
QUICK REVIEW

[논문 리뷰] A Flexible High Demand Storage System for MAGIC-I and MAGIC-II using GFS

E. Carmona, J. A. Coarasa|arXiv (Cornell University)|2009. 07. 06.
Astrophysics and Cosmic Phenomena참고 문헌 3인용 수 3
한 줄 요약

이 논문은 레드햇 클러스터 위에 구축된 글로벌 파일 시스템(GFS)을 사용하여 MAGIC-I 및 MAGIC-II 측광망원경에 대한 확장성 있고 신뢰성 있으며 유연한 고성능 스토리지 시스템을 제안한다. 시스템은 지속적인 DAQ 쓰기 속도가 1.2 kHz 이상을 유지하며, 압축, 테이핑, 온라인 분석과 같은 동시 데이터 처리를 가능하게 하며, RAID5, 멀티패스 I/O, 자동 펜싱을 통해 고장 내성 보장을 한다. 이로 인해 최소한의 정지 시간으로 야간에 1TB 이상의 데이터 스토리지가 가능하며, 스케일링이 원활하게 이뤄진다.

ABSTRACT

MAGIC-I is currently the Imaging Cherenkov Telescope with the worldwide largest reflector currently in operation. The initially achieved low trigger threshold of 60 GeV has been further reduced by means of a novel trigger that allows the telescope to record gamma ray showers down to 25 GeV. The high trigger rate combined with the 2 GHz signal sampling rate results in large data volumes that can reach 1 TByte per night for MAGIC-I and even more with the second MAGIC telescope coming soon into operation. To deal with the large storage requirements of MAGIC-I and MAGIC-II, we have installed the distributed file system GFS and a cluster of computers with concurrent access to the same shared storage units. The system can not only handle a sustained DAQ write rate above 1.2 kHz for MAGIC-I, but also allows other nodes to perform simultaneous concurrent access to the data on the shared storage units. Various simultaneous tasks can be used at any time, in parallel with data taking, including data compression, taping, on-line analysis, calibration and analysis of the data. The system is designed to quickly recover after the failure of one node in the cluster and to be easily extended as more nodes or storage units are required in the future.

연구 동기 및 목표

  • SUM 트리거 작동 중 최대 60 MB/s의 데이터 속도를 발생시키는 MAGIC 망원경에서 발생하는 높은 데이터 볼륨과 I/O 요구를 충족시키기 위해.
  • 압축, 테이핑, 온라인 분석과 같은 동시 데이터 처리 작업을 지원하기 위해 여러 노드 간 일관된 공유 파일 시스템을 제공하기 위해.
  • RAID5, 멀티패스 I/O, 장애 노드 자동 펜싱을 통해 고신뢰성을 확보하기 위해.
  • 향후 출시 예정인 MAGIC-II 망원경(1039픽셀, 이중 데이터 속도)을 수용하기 위해 동적 자원 할당과 시스템 확장성을 보장하기 위해.
  • 데이터 손상 없이 노드 또는 스토리지 장애 발생 시 신속한 복구를 지원하기 위해.

제안 방법

  • 각 노드가 직접 읽기/쓰기 접근이 가능한 공유 파이버 채널 연결 RAID 스토리지 유닛을 사용한 7개 노드의 레드햇 클러스터 스위트 배포.
  • 모든 클러스터 노드 간 일관된 공유 파일 시스템 뷰를 제공하기 위해 글로벌 파일 시스템(GFS) 구현.
  • 클러스터 메시징(CMAN)을 위한 전용 1 Gbps 이더넷 네트워크와 스토리지 I/O를 위한 별도의 파이버 채널 네트워크 사용.
  • 디스크 장애 발생 시 자동 장애 복구를 보장하기 위해 예비 디스크를 포함한 RAID5 어레이 구성.
  • 중복된 파이버 채널 경로를 통해 연결성을 유지하기 위해 멀티패스 데몬을 사용한 멀티패스 I/O 활성화.
  • CMAN 및 펜싱 서비스를 활용해 장애 노드를 자동으로 감지하고 격리하여 공유 스토리지에 대한 액세스를 차단함으로써 데이터 손상 방지.

실험 결과

연구 질문

  • RQ1고조도 트리거율을 가진 측광망원경에서 야간 1TB 이상의 데이터를 처리할 수 있는 고성능, 확장성 있고 신뢰성 있는 스토리지 시스템을 설계하는 방법은 무엇인가?
  • RQ2여러 노드가 동시에 공유 스토리지에 액세스할 경우 데이터 일관성과 고장 내성 보장을 위한 메커니즘은 무엇인가?
  • RQ3I/O 병목 현상 없이 동시에 압축, 테이핑, 온라인 분석 등의 데이터 처리 작업을 지원하기 위해선 어떤 전략이 필요한가?
  • RQ4더 높은 데이터 속도를 가진 두 번째 망원경으로 업그레이드할 경우, 스케일링을 원활하게 지원하기 위한 전략은 무엇인가?
  • RQ5노드 및 스토리지 장애를 자동으로 감지하고 격리하여 데이터 손상 방지를 위한 방법은 무엇인가?

주요 결과

  • MAGIC-I에서 DAQ 쓰기 속도가 1.2 kHz 이상을 지속적으로 유지되었으며, 고트리거율 관측 시 최대 60 MB/s를 처리하였다.
  • 고수요 조건 하에서 야간 1TB 이상의 데이터 볼륨을 달성하였으며, SUM 트리거 작동 중 원시 데이터 속도가 60 MB/s에 도달하였다.
  • GFS 기반 클러스터는 압축, 테이핑, 온라인 분석, 캘리브레이션을 위한 동시 액세스를 가능하게 하였으며, I/O 성능이 DAQ 쓰기 속도와 동일하게 유지되었다.
  • 자동 펜싱과 CMAN를 활용해 몇 초 내에 노드 장애로부터 복구되었으며, 데이터 손상 없이 안정적으로 운영되었다.
  • Fibre Channel 스위치 포트의 30% 미만이 현재 사용 중이어서, 향후 최대 100개 노드까지 동적 확장이 가능하도록 스토리지 아키텍처가 설계되었다.
  • 예비 디스크 자동 교체와 멀티패스 I/O를 통한 RAID5 사용으로 고신뢰성이 확보되었으며, 디스크 또는 경로 장애 발생 시 데이터 손실 없이 운영되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.