Skip to main content
QUICK REVIEW

[논문 리뷰] From Facility to Application Sensor Data: Modular, Continuous and Holistic Monitoring with DCDB

Alessio Netti, Micha Mueller|arXiv (Cornell University)|2019. 06. 18.
Advanced Data Storage Technologies참고 문헌 32인용 수 9
한 줄 요약

DCDB는 HPC 시스템을 위한 모듈식이며 확장 가능하고 확장 가능한 모니터링 프레임워크로, 시설, 시스템, 런타임, 응용 프로그램 수준의 센서 데이터를 분산형 NoSQL 스토어에 통합한다. 이는 최소한의 오버헤드로 종합적이고 지속적인 모니터링을 가능하게 하며, 생산용 HPC 시스템에 대한 구현과 에너지 관리 및 시스템 특성 분석 등의 사용 사례를 통해 입증되었다.

ABSTRACT

Today's HPC installations are highly-complex systems, and their complexity will only increase as we move to exascale and beyond. At each layer, from facilities to systems, from runtimes to applications, a wide range of tuning decisions must be made in order to achieve efficient operation. This, however, requires systematic and continuous monitoring of system and user data. While many insular solutions exist, a system for holistic and facility-wide monitoring is still lacking in the current HPC ecosystem. In this paper we introduce DCDB, a comprehensive monitoring system capable of integrating data from all system levels. It is designed as a modular and highly-scalable framework based on a plugin infrastructure. All monitored data is aggregated at a distributed noSQL data store for analysis and cross-system correlation. We demonstrate the performance and scalability of DCDB, and describe two use cases in the area of energy management and characterization.

연구 동기 및 목표

  • 모든 계층—시설, 시스템, 런타임, 응용 프로그램—의 데이터를 통합하는 종합적이고 시설 전체를 아우르는 HPC 시스템의 모니터링 부족 문제를 해결한다.
  • 인프라나 응용 프로그램 수준 메트릭에만 집중하는 고립된 모니터링 도구의 한계를 극복한다.
  • 지속적인 데이터 수집과 교차 계층 상관관계 분석을 지원하는 통합적이고 확장 가능하며 확장 가능한 프레임워크를 제공함으로써 시스템 최적화를 가능하게 한다.
  • 이질적인 아키텍처와 동적 튜닝 메커니즘을 가진 다양한 HPC 환경에서도 효율적이고 최소한의 오버헤드로 모니터링을 가능하게 한다.
  • 에너지 관리 및 성능 특성 분석과 같은 고급 사용 사례를 지원하기 위해 다양한 데이터 소스를 단일 분석 가능한 데이터 스토어에 통합한다.

제안 방법

  • 모든 시스템 계층에서 다양한 데이터 소스를 모듈식으로 통합할 수 있도록 플러그인 기반 아키텍처를 설계한다.
  • 높은 확장성을 확보하기 위해 분산형이고 계층적인 NoSQL 데이터 스토어를 사용하여 모든 소스의 모니터링 데이터를 집계하고 영구 저장한다.
  • 이완된 결합과 작업 경계를 초월한 원활한 배포를 보장하기 위해 MQTT 기반 통신을 활용한다. 이는 지속적인 데이터 수신을 보장한다.
  • 데이터를 중앙 스토어로 효율적으로 전달하기 위해 경량 데이터 수집 에이전트(수집 에이전트)와 푸셔 컴포onent을 구현한다.
  • 확장 가능한 플러그인을 통해 표준 HPC 모니터링 프로토콜 및 인터페이스(예: 성능 카운터, 전력 측정기, 응용 프로그램 프로파일링)를 지원한다.
  • 실시간 액세스를 가능하게 하고 향후 스트리밍 분석 워크로드를 지원하기 위해 RESTful API와 센서 캐싱을 통합한다.

실험 결과

연구 질문

  • RQ1어떻게 하면 시설, 시스템, 런타임, 응용 프로그램 등 HPC 스택의 모든 계층에서 이질적인 센서 데이터를 통합할 수 있는 통합 모니터링 프레임워크를 설계할 수 있는가?
  • RQ2대규모 HPC 환경에서 최소한의 오버헤드로 지속적이고 확장 가능한 모니터링을 가능하게 하는 아키텍처 패턴은 무엇인가?
  • RQ3플러그인 기반 시스템은 다양한 HPC 배포 환경과 변화하는 모니터링 요구 사항에 대해 어떻게 확장성과 적응성을 지원할 수 있는가?
  • RQ4실제 HPC 생산 시스템에서 이러한 프레임워크는 어떤 성능 및 확장성 특성을 보이는가?
  • RQ5종합적 모니터링 데이터는 에너지 효율 최적화 및 이상 탐지와 같은 고급 사용 사례를 어떻게 지원할 수 있는가?

주요 결과

  • DCDB는 최소한의 성능 오버헤드를 달성하였으며, 벤치마크 평가 결과 다른 최첨단 모니터링 솔루션과 유사한 성능을 보였다.
  • 이 프레임워크는 르이브니츠 초계산센터에서 다수의 생산용 HPC 시스템에 성공적으로 구현되어 실제 환경에서의 확장성과 안정성을 입증하였다.
  • DCDB는 시설 센서, 시스템 하드웨어, 런타임 메트릭, 응용 프로그램 수준의 성능 카운터에서 온 데이터를 통합함으로써 교차 계층 상관관계 분석을 가능하게 한다.
  • 플러그인 기반 아키텍처 덕분에 새로운 데이터 소스의 원활한 통합이 가능하며, 향후 GPU 성능 이벤트 및 응용 프로그램 프로파일링 데이터 지원도 가능하다.
  • 기존 구성 요소인 REST API와 센서 캐싱을 활용하는 계획된 분석 레이어를 통해 향후 스트리밍 분석 통합을 지원한다.
  • DCDB의 설계는 데이터 필터링 없이 지속적인 모니터링을 가능하게 하여, 세밀한 분석과 최적화를 위한 원본 메트릭 무결성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.