Skip to main content
QUICK REVIEW

[논문 리뷰] GridMonitor: Integration of Large Scale Facility Fabric Monitoring with Meta Data Service in Grid Environment

Richard S. Baker, Dantong Yu|ArXiv.org|2003. 06. 13.
Distributed and Parallel Computing Systems참고 문헌 10인용 수 4
한 줄 요약

GridMonitor는 대규모 시설 모니터링과 그리드 메타데이터 서비스(MDS)를 통합하여 지리적으로 분산된 시설에서 이질적인 컴퓨팅, 스토리지 및 네트워크 자원에 대한 실시간, 적응형 모니터링을 가능하게 하는 확장성 있는 사다리꼴 아키텍처를 제안한다. 이는 기존의 도구인 NWS, SNMP, GMA를 활용하며, 자원 상태의 표준화되고 동적인 탐색 및 게시를 위해 MDS를 사용하여 브루크헤븐 국립연구소의 10개 클러스터 시설에서 1,000개 이상의 노드에 걸쳐 구현되었다.

ABSTRACT

Grid computing consists of the coordinated use of large sets of diverse, geographically distributed resources for high performance computation. Effective monitoring of these computing resources is extremely important to allow efficient use on the Grid. The large number of heterogeneous computing entities available in Grids makes the task challenging. In this work, we describe a Grid monitoring system, called GridMonitor, that captures and makes available the most important information from a large computing facility. The Grid monitoring system consists of four tiers: local monitoring, archiving, publishing and harnessing. This architecture was applied on a large scale linux farm and network infrastructure. It can be used by many higher-level Grid services including scheduling services and resource brokering.

연구 동기 및 목표

  • 그리드 환경에서 대규모, 이질적이고 동적으로 변화하는 컴퓨팅 시설을 모니터링하는 데 도전하는 문제를 해결하기 위해.
  • 수천 개의 지리적으로 분산된 노드에서 시스템 오버헤드를 줄이고 확장성을 향상시키기 위해.
  • 저수준의 시설 모니터링과 작업 스케줄러 및 자원 브로커와 같은 고수준 그리드 서비스 간의 원활한 통합을 가능하게 하기 위해.
  • 유연하고 확장 가능한 모니터링 인프라를 제공하여 자원의 동적 참가 및 이탈을 지원하기 위해.
  • MDS와 GMA를 통해 표준화되고 접근 가능한 모니터링 데이터를 제공함으로써 장애 탐지, 성능 튜닝 및 자원 스케줄링을 향상시키기 위해.

제안 방법

  • 시스템은 로컬 모니터링, 아카이빙, 게재, 활용의 네 계층 아키텍처를 사용하여 모듈화되고 확장 가능한 데이터 수집 및 배포를 가능하게 한다.
  • 로컬 모니터링 에이전트는 노드에서 실시간 메트릭(CPU, 디스크, 네트워크)을 수집하여 텔레메트리 데이터베이스를 통해 중앙 집중식 데이터 저장소로 전달한다.
  • 네트워크 날씨 서비스(NWS)는 활성 프로빙과 역사적 데이터를 사용하여 CPU 가용성, 지연 시간, 대역폭에 대한 단기 성능 예측을 제공한다.
  • SNMP 기반 센서는 가벼운 부담으로 확장 가능한 네트워크 및 장치 모니터링을 위해 널리 보급된 표준을 활용하여 광범위한 하드웨어 호환성을 확보한다.
  • 모니터링 데이터는 LDAP 기반 계층적 저장소를 사용한 모니터링 및 탐색 서비스(MDS)를 통해 게재되어 자원의 동적 등록 및 탐색이 가능하다.
  • 그리드 모니터링 아키텍처(GMA)는 스트리밍 퍼블리시/서브스크립션 통신을 지원하여 스케줄러 및 장애 탐지 시스템과 같은 소비자에게 실시간 이벤트 전달을 가능하게 한다.

실험 결과

연구 질문

  • RQ1대규모 컴퓨팅 시설에서 여러 클러스터에 걸쳐 1,000개 이상의 이질적 노드를 효율적으로 모니터링할 수 있는 시스템은 어떻게 설계할 수 있는가?
  • RQ2저수준의 시설 모니터링과 MDS와 같은 고수준 그리드 메타데이터 서비스 간의 원활한 통합을 가능하게 하는 아키텍처 패턴은 무엇인가?
  • RQ3노드가 풀에 참가하거나 이탈하는 동적인 그리드 자원의 특성을 어떻게 처리할 수 있는가?
  • RQ4기존 도구인 NWS, SNMP, GMA가 견고하고 확장 가능하며 저오버헤드 모니터링 인프라를 구축하는 데 어떤 역할을 하는가?
  • RQ5표준화된 퍼블리시/서브스크립션 기반 모니터링이 분산된 그리드 환경에서 자원 탐색, 스케줄링 및 장애 탐지에 얼마나 기여할 수 있는가?

주요 결과

  • GridMonitor는 브루크헤븐 국립연구소의 10개 클러스터에서 1,000개 이상의 노드를 성공적으로 모니터링하여 대규모 리눅스 팜과 네트워크 인fra에서의 확장성을 입증했다.
  • NWS 통합으로 활성 프로빙과 역사적 데이터를 활용하여 네트워크 성능의 정확한 단기 예측이 가능해졌으며, 종단 간 지연 시간과 대역폭을 포함한 성능을 예측할 수 있었다.
  • SNMP 기반 센서는 최소한의 시스템 오버헤드로 네트워크 및 장치 상태를 효과적으로 모니터링하여 광범위한 하드웨어 호환성을 확보했다.
  • MDS의 사용으로 자원의 동적 등록 및 탐색이 가능해져 새로운 노드와 서비스가 그리드 정보 시스템에 자동으로 탐지되고 게재될 수 있었다.
  • GMA 기반 스트리밍 모델은 소비자에게 실시간 이벤트 전달을 지원하여 풀링 기반 모델 대비 스케줄링 및 장애 탐지에 대한 반응성을 향상시켰다.
  • 사다리꼴 아키텍처는 시설 모니터링을 그리드 수준의 운영에서 분리하여 모니터링 도구와 그리드 서비스의 독립적 진화를 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.