Skip to main content
QUICK REVIEW

[논문 리뷰] Monitoring Extreme-scale Lustre Toolkit

Michael J. Brim, Joshua K. Lothian|arXiv (Cornell University)|2015. 04. 26.
Scientific Computing and Data Management참고 문헌 1인용 수 4
한 줄 요약

모니터링 엑스트림스케일 러스트 툴킷(MELT)은 분산 오버레이 네트워크를 활용하여 클라이언트 및 서버 노드 간에 다중 도메인 모니터링을 가능하게 하는 통합형 저지연도 성능 모니터링 및 분석 프레임워크이다. 실시간으로 시스템의 상태 및 성능 요약을 제공하고, 다수 수준의 진단을 위한 상호작용형 CLI 도구를 제공하며, 일반적인 성능 문제에 대한 루트 케이스 분석을 위한 향후 자동화 기능을 포함한다.

ABSTRACT

We discuss the design and ongoing development of the Monitoring Extreme-scale Lustre Toolkit (MELT), a unified Lustre performance monitoring and analysis infrastructure that provides continuous, low-overhead summary information on the health and performance of Lustre, as well as on-demand, in- depth problem diagnosis and root-cause analysis. The MELT infrastructure leverages a distributed overlay network to enable monitoring of center-wide Lustre filesystems where clients are located across many network domains. We preview interactive command-line utilities that help administrators and users to observe Lustre performance at various levels of resolution, from individual servers or clients to whole filesystems, including job-level reporting. Finally, we discuss our future plans for automating the root-cause analysis of common Lustre performance problems.

연구 동기 및 목표

  • 엑스트림스케일 HPC 환경에서 사용되는 대규모 다중 도메인 러스트 파일시스템의 성능 문제를 모니터링하고 진단하는 데 도전하는 데 목적을 두며.
  • 전체 파일시스템, 서버 및 클라이언트에 걸쳐 지속적이고 저지연도의 성능 모니터링을 제공하는 통합 인fra를 설계하는 데 목적을 두며.
  • 개별 구성 요소에서 작업 수준까지 다양한 정도의 정밀도로 상호작용형 실시간 진단을 가능하게 하는 데 목적을 두며.
  • 반복적인 러스트 성능 문제에 대한 자동화된 루트 케이스 분석 기반의 토대를 마련하는 데 목적을 두며.

제안 방법

  • MELT 프레임워크는 다중 네트워크 도메인에 걸쳐 성능 메트릭을 수집하고 관련성을 분석하기 위해 분산 오버레이 네트워크를 사용하여, 지리적 또는 관리적 분할이 이루어진 HPC 센터에서도 가시성을 확보한다.
  • 최소한의 런타임 오버헤드로 성능 데이터를 집계하고 요약하기 위해 기존의 러스트 모니터링 도구와 통합한다.
  • 관리자 및 사용자가 개별 클라이언트에서 전체 파일시스템에 이르기까지 다양한 추상화 수준에서 성능을 쿼리할 수 있도록 상호작용형 명령줄 유틸리티를 제공한다.
  • 성능 데이터를 작업 실행 메타데이터와 연계함으로써 작업 수준의 보고 기능을 지원한다.
  • 데이터 수집과 분석을 분리하고 분산 처리를 가능하게 하여 초대규모 배포에 적합한 아키텍처를 설계하였다.
  • 향후 확장 기능으로는 일반적인 장애 패턴을 식별하고 복구 전략을 제안하는 자동 진단 파이프라인을 통합할 예정이다.

실험 결과

연구 질문

  • RQ1어떻게 하면 엑스트림스케일 HPC 환경에서 대규모 다중 도메인 러스트 파일시스템에 효과적으로 성능 모니터링을 확장할 수 있는가?
  • RQ2어떤 아키텍처 패턴이 시스템 성능 저하 없이 러스트 구성 요소의 저지연도 지속 모니터링을 가능하게 하는가?
  • RQ3어떻게 하면 시스템 관리자와 최종 사용자 모두에게 통합적이고 다중 정밀도의 진단을 제공할 수 있는가?
  • RQ4러스트에서 일반적인 성능 저하 요인을 효과적으로 루트 케이스 분석하기 위해 어떤 메커니즘이 필요한가?
  • RQ5자동화된 진단은 어떻게 러스트의 생산 모니터링 스택에 통합될 수 있는가?

주요 결과

  • MELT는 분산 오버레이 네트워크를 활용하여 다중 네트워크 도메인에 걸쳐 중심 전체 러스트 파일시스템의 지속적이고 저지연도 모니터링을 성공적으로 구현하였다.
  • 툴킷은 개별 클라이언트에서 전체 파일시스템에 이르기까지 다양한 정밀도에서 실시간 성능 관찰이 가능한 상호작용형 CLI 유틸리티를 제공한다.
  • 작업 수준의 성능 보고 기능이 지원되어 I/O 동작을 응용 프로그램 실행과 연계할 수 있다.
  • 향후 릴리스에서 일반적인 성능 문제에 대한 자동화된 루트 케이스 분석 통합의 가능성을 입증하였다.
  • 설계는 확장성과 확장성을 확보하여 초대규모 HPC 환경에 적합한 배포를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.