[논문 리뷰] 'Mutual Watch-dog Networking': Distributed Awareness of Faults and Critical Events in Petascale/Exascale systems
이 논문은 페타스케일 및 에크사스케일 시스템을 위한 분산 장애 인지 프레임워크인 '상호 워치독 네트워킹'(LO|FA|MO)을 제안한다. 이는 부속적인 저속 진단 네트워크를 통해 실시간 장애 탐지 및 전파를 가능하게 하며, 하드웨어 모니터링, 워치독 메커니즘, 계층적 장애 신호 전송을 조합함으로써 조기 장애 탐지와 내성적인 대응을 실현하여 대규모 고복잡도 아키텍처에서의 시스템 정지 시간을 감소시킨다.
Many tile systems require techniques to be applied to increase components resilience and control the FIT (Failures In Time) rate. When scaling to peta- exa-scale systems the FIT rate may become unacceptable due to component numerosity, requiring more systemic countermeasures. Thus, the ability to be fault aware, i.e. to detect and collect information about fault and critical events, is a necessary feature that large scale distributed architectures must provide in order to apply systemic fault tolerance techniques. In this context, the LO|FA|MO approach is a way to obtain systemic fault awareness, by implementing a mutual watchdog mechanism and guaranteeing fault detection in a no-single-point-of-failure fashion. This document contains specification and implementation details about this approach, in the shape of a technical report.
연구 동기 및 목표
- 수천만 개의 구성 요소와 고복잡도로 인한 증가하는 고장률을 해결하기 위해.
- 침통적인 고장을 유발하기 전에 조기에 고장을 탐지하고 전파함으로써 시스템 정지 시간을 감소시키기 위해.
- 동적 전압 스케일링 및 프로세스 이식과 같은 사전 대응 전략을 보완할 수 있는 장애 인지 인프라를 설계하기 위해.
- 주 데이터 네트워크와 독립적인 부속적인 저속 진단 네트워크를 도입하여 고장률이 높은 시스템에서의 장애 복원력을 확보하기 위해.
- 주 네트워크가 장애가 발생한 경우에도 고장 탐지 및 신호 전달을 가능하게 하기 위해 고장 내성적인 보조 네트워크를 사용하여 진단 정보를 전파하기 위해.
제안 방법
- LO|FA|MO 프레임워크는 DNP(Distributing Network Processor)와 호스트 프로세싱 요소 간의 상호 워치독 메커니즘을 사용하여 주기적인 상태 점검을 통해 고장을 탐지한다.
- 주 3D 토로이드 네트워크가 고장 나도 작동할 수 있도록 전용의 저속이며 높은 신뢰성 있는 진단 네트워크(서비스 네트워크)를 사용하여 고장 정보를 전파한다.
- 하드웨어 모니터는 온도, 전압, 전류, BER 카운터 및 내부 예외 레지스터를 추적하여 실시간으로 고장 징후를 탐지한다.
- 고장 상태는 레지스터를 통해 신호 전달된다: DNP 현지/전역 상태, 호스트 워치독 레지스터, DNP 워치독 레지스터 필드는 고장을 감지한 이웃 노드를 나타낸다.
- 호스트 장애 관리자는 주기적으로 DNP의 상태를 점검하고 서비스 네트워크를 통해 고장 이벤트를 상위 수준의 감시자에게 전파한다.
- 호스트 또는 버스 고장 발생 시 DNP는 워치독 타임아웃을 감지하고 이웃 노드에 DNP 워치독 레지스터를 통해 신호를 보내 전역적 장애 인지를 가능하게 한다.
실험 결과
연구 질문
- RQ1수천 개의 구성 요소를 포함하는 페타스케일 및 에크사스케일 시스템에서 장애 인지를 효과적으로 분산시키는 방법은 무엇인가?
- RQ2주 통신 네트워크가 손상된 경우에도 신뢰성 있는 장애 탐지 및 신호 전달을 가능하게 하는 메커니즘은 무엇인가?
- RQ3DNP와 호스트 프로세서 간의 상호 워치독이 장애 탐지 지연 시간과 시스템 복원력을 어떻게 향상시키는가?
- RQ4저속 전용 진단 네트워크가 주 네트워크 고장 시에도 장애 인지를 유지하는 데 어떤 역할을 하는가?
- RQ5고장 정보를 계층적으로 전파하여 시스템 수준의 조율된 대응을 가능하게 하는 방법은 무엇인가?
주요 결과
- LO|FA|MO 프레임워크는 예외 레지스터 모니터링과 상태 플래그 설정을 통해 라우팅 논리 오류 및 RDMA 엔진 고장과 같은 DNP 코어 고장을 탐지할 수 있다.
- DNP가 주기적인 상태 레지스터를 업데이트하지 못할 경우 호스트가 워치독 타임아웃을 감지함으로써 DNP 코어 멜트다운 고장을 탐지한다.
- 온도 및 전압 임계값 위반은 전용 레지스터를 모니터링하고 DNP 현지/전역 상태 레지스터를 통해 신호로 전달된다.
- 호스트 측 주변기기 고장은 호스트 현지 장애 관리자가 감지하고, 이는 호스트 워치독 레지스터를 통해 전달되며, 이로 인해 이웃 DNP에서 진단 패킷 생성이 유도된다.
- 전체 호스트 장애 또는 버스 고장은 DNP가 워치독 타임아웃을 감지함으로써 탐지되며, 이는 DNP 워치독 레지스터를 통해 고장 전파와 함께 전역적 인지를 가능하게 한다.
- 주 3D 토로이드 네트워크가 고장 나도 복원력 있는 독립적인 서비스 네트워크를 통해 진단 정보 전달을 유지함으로써 고장 인지를 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.