[논문 리뷰] Monitoring, Analyzing, and Controlling Internet-scale Systems with ACME
ACME는 인터넷 규모의 시스템을 모니터링하고 분석하며 제어하기 위한 확장 가능한 인프라로, 네트워크 내에서 센서 데이터를 집계하는 ISING과 이벤트 기반 작동을 수행하는 ENTRIE로 구성된다. 네트워크 내 집계를 통해 종단 간 쿼리 지연을 50% 이상 감소시키며, 4초 이내로 액추에이터를 트리거하여 벤치마킹 및 이상 탐지 시나리오에서의 효과성을 입증한다.
Analyzing and controlling large distributed services under a wide range of conditions is difficult. Yet these capabilities are essential to a number of important development and operational tasks such as benchmarking, testing, and system management. To facilitate these tasks, we have built the Application Control and Monitoring Environment (ACME), a scalable, flexible infrastructure for monitoring, analyzing, and controlling Internet-scale systems. ACME consists of two parts. ISING, the Internet Sensor In-Network agGregator, queries sensors and aggregates the results as they are routed through an overlay network. ENTRIE, the ENgine for TRiggering Internet Events, uses the data streams supplied by ISING, in combination with a user's XML configuration file, to trigger actuators such as killing processes during a robustness benchmark or paging a system administrator when predefined anomalous conditions are observed. In this paper we describe the design, implementation, and evaluation of ACME and its constituent parts. We find that for a 512-node system running atop an emulated Internet topology, ISING's use of in-network aggregation can reduce end-to-end query-response latency by more than 50% compared to using either direct network connections or the same overlay network without aggregation. We also find that an untuned implementation of ACME can invoke an actuator on one or all nodes in response to a discrete or aggregate event in less than four seconds, and we illustrate ACME's applicability to concrete benchmarking and monitoring scenarios.
연구 동기 및 목표
- 다양한 운영 조건 하에서 대규모 분산 시스템을 모니터링하고 제어하는 데 어려움을 해결하기 위해.
- 인터넷 규모 환경에서의 탄력적인 벤치마킹, 테스트 및 시스템 관리를 지원하는 시스템을 설계하기 위해.
- 센서 데이터 수집을 위한 분산 쿼리 처리에서 종단 간 지연을 감소시키기 위해.
- 자동화된 작동 메커니즘을 통해 시스템 이벤트에 실시간으로 반응할 수 있도록 하기 위해.
- 모의 대규모 토폴로지에서 제안된 아키텍처의 확장성과 성능을 평가하기 위해.
제안 방법
- ISING은 오버레이 네트워크를 사용하여 센서 쿼리를 라우팅하고 네트워크 내에서 집계를 수행하여 데이터 전송과 지연을 최소화한다.
- 센서 데이터는 오버레이를 통해 이동하면서 수집되고 집계되어 중복된 데이터 전송을 줄인다.
- ENTRIE는 ISING에서 오는 데이터 스트림을 소비하고 사용자가 정의한 XML 구성 파일을 해석하여 조건을 감지하고 조치를 트리거한다.
- 프로세스 종료나 시스템 관리자 경고와 같은 액추에이터는 사전 정의된 이벤트 트리거에 기반하여 호출된다.
- 시스템은 노드별 및 글로벌 이벤트 감지 모두를 지원하여 세밀한 제어 또는 광범위한 제어를 가능하게 한다.
- 지연과 응답 시간을 측정하기 위해 512개 노드의 모의 인터넷 토폴로지를 사용하여 아키텍처를 평가한다.
실험 결과
연구 질문
- RQ1네트워크 내 집계는 대규모 분산 모니터링 시스템에서 종단 간 지연을 어떻게 감소시킬 수 있는가?
- RQ2모의 인터넷 규모 환경에 확장 가능한 모니터링 및 제어 인프라를 구현할 경우 성능 오버헤드는 어떠한가?
- RQ3시스템 이벤트에 대해 실용적인 시간 창 내에서 액추에이터를 트리거할 수 있는가?
- RQ4시스템은 벤치마킹 및 이상 탐지 워크로드를 얼마나 효과적으로 지원하는가?
- RQ5다양한 시스템 로드와 토폴로지 조건에서 ACME 아키텍처의 확장성은 어떠한가?
주요 결과
- 512개 노드 시스템에서 ISING은 직접 네트워크 연결이나 비집합 오버레이 네트워크 대비 종단 간 쿼리-응답 지연을 50% 이상 감소시킨다.
- 조정되지 않은 ACME 구현은 이산적 또는 집합적 이벤트 발생 시 1개 또는 모든 노드에서 액추에이터를 4초 이내로 활성화할 수 있다.
- 임계치를 초과할 경우 자동으로 프로세스 종료를 가능하게 하여 강건성 벤치마킹을 성공적으로 지원한다.
- 네트워크 내 집계의 사용은 대규모 배포 환경에서 네트워크 대역폭 사용을 크게 줄이고 확장성을 향상시킨다.
- ACME는 시스템 이상 탐지 및 자동 응답과 같은 실제 모니터링 및 제어 시나리오에서 실용적인 적용 가능성을 보여준다.
- 모의 인터넷 토폴로지에서 아키텍처는 복잡한 모니터링 및 제어 워크로드를 지원하는 데 효과적으로 확장된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.