Skip to main content
QUICK REVIEW

[논문 리뷰] Anomaly Analysis for Co-located Datacenter Workloads in the Alibaba Cluster

Rui Ren, Jinheng Li|arXiv (Cornell University)|2018. 11. 14.
Cloud Computing and Resource Management참고 문헌 15인용 수 5
한 줄 요약

이 논문은 Alibaba의 공재배치 데이터센터 워크로드 트레이스를 분석하여 워크로드 불균형과 스케줄링 비효율성으로 인한 성능 이상을 규명한다. DTW 기반 노드 유사도, iForest 이상 탐지, 워크로드 분포 분류를 통해 단기 실행 배치 작업에서의 메모리 사용률이 장시간 실행되는 온라인 컨테이너에 비해 매우 불안정하다는 점과, 8개의 별도 워크로드 분포 유형이 노드 간 자원 사용 패턴의 대부분을 설명하며, 불균형이 주요 이상 원인임을 밝혀낸다.

ABSTRACT

In warehouse-scale cloud datacenters, co-locating online services and offline batch jobs is an efficient approach to improving datacenter utilization. To better facilitate the understanding of interactions among the co-located workloads and their real-world operational demands, Alibaba recently released a cluster usage and co-located workload dataset, which is the first publicly dataset with precise information about the category of each job. In this paper, we perform a deep analysis on the released Alibaba workload dataset, from the perspective of anomaly analysis and diagnosis. Through data preprocessing, node similarity analysis based on Dynamic Time Warping (DTW), co-located workloads characteristics analysis and anomaly analysis based on iForest, we reveals several insights including: (1) The performance discrepancy of machines in Alibaba's production cluster is relatively large, for the distribution and resource utilization of co-located workloads is not balanced. For instance, the resource utilization (especially memory utilization) of batch jobs is fluctuating and not as stable as that of online containers, and the reason is that online containers are long-running jobs with more memory-demanding and most batch jobs are short jobs, (2) Based on the distribution of co-located workload instance numbers, the machines can be classified into 8 workload distribution categories1. And most patterns of machine resource utilization curves are similar in the same workload distribution category. (3) In addition to the system failures, unreasonable scheduling and workload imbalance are the main causes of anomalies in Alibaba's cluster.

연구 동기 및 목표

  • Alibaba의 공재배치 데이터센터 클러스터에서 성능 차이와 자원 사용 불균형을 조사한다.
  • 공재배치 워크로드 분포 패턴에 따라 노드를 분류하고, 자원 사용 곡선에 미치는 영향을 평가한다.
  • 이상 노드를 탐지하고, 시스템 장애를 초월한 이상의 근본 원인을 진단한다.
  • iForest 및 DTW 기반 방법의 실제 생산 트레이스에서 성능 이상을 식별하는 데의 효과성을 평가한다.

제안 방법

  • Alibaba 클러스터 트레이스에 대한 종합적인 데이터 전처리를 수행하여, 컨테이너 수준, 배치 수준, 서버 수준의 자원 사용 메트릭을 생성하기 위해 데이터 보완, 필터링, 상관관계 분석 및 집계를 수행하였다.
  • 동적 시간 왜곡(DTW)을 적용하여 CPU, 메모리, 디스크 사용의 시간적 패턴 기반으로 노드 유사도를 계산함으로써, 정상 조건에서의 피어 노드 식별이 가능해졌다.
  • 노드당 온라인 컨테이너 수와 배치 작업 수를 기반으로 8개의 워크로드 분포 유형으로 기계를 분류하였으며, 각 유형 내에서 일관된 자원 사용 패턴이 드러났다.
  • 정상 행동를 모델링하고 자원 사용 패턴이 크게 이탈한 노드를 식별하기 위해 iForest 알고리즘을 이상 탐지에 활용하였다.
  • 이상 노드와 스케줄링 정책, 워크로드 편향, 자원 경쟁 간의 상관관계를 분석하여 이상의 근본 원인을 분석하였다.
  • 메모리 및 CPU 사용률의 동적 변화에 중점을 두고, Alibaba의 웨어하우스 스케일 데이터센터에서의 실제 생산 트레이스를 사용하여 결과를 검증하였다.

실험 결과

연구 질문

  • RQ1공재배치 데이터센터 워크로드에서 장시간 실행되는 온라인 컨테이너와 단기 실행 배치 작업 간 자원 사용 패턴은 어떻게 다를까?
  • RQ2노드당 온라인 컨테이너 수와 배치 작업 수와 같은 워크로드 분포 패턴이 노드 간 자원 사용 곡선 유사도에 어느 정도 기여하는가?
  • RQ3하드웨어 고장 외에 Alibaba의 공재배치 클러스터에서 성능 이상의 주요 원인은 무엇인가?
  • RQ4DTW 기반 노드 유사도와 결합된 iForest는 실제 데이터센터 트레이스에서 이상 탐지에 얼마나 효과적인가?
  • RQ5워크로드 분포 유형을 사용해 노드 수준의 성능 차이를 예측하고 설명할 수 있는가?

주요 결과

  • Alibaba의 실제 클러스터에서 기계 간 성능 격차는 심각하며, 주로 워크로드 불균형과 단기 배치 작업에서의 변동성이 큰 메모리 사용률 때문이며, 이는 장시간 실행되는 안정적인 온라인 컨테이너와 대비된다.
  • 노드당 온라인 컨테이너 수와 배치 작업 수를 기반으로 8개의 별도 워크로드 분포 유형으로 기계를 분류할 수 있으며, 동일 유형에 속한 노드는 CPU, 메모리, 디스크 메트릭에서 매우 유사한 자원 사용 패턴을 보인다.
  • 배치 작업에서의 메모리 사용률은 짧은 지속 시간과 돌발적인 성격으로 인해 매우 불안정하고 변동성이 크며, 반면 온라인 컨테이너는 시간이 지남에 따라 일관된 메모리 소비를 유지한다.
  • iForest 기반 이상 탐지 방법은 이상 노드를 성공적으로 식별하였으며, 주요 원인은 하드웨어 고장이 아닌 스케줄링 비효율성과 워크로드 불균형이었다.
  • 예를 들어, 71개의 배치 작업과 단 한 개의 온라인 컨테이너만을 호스팅한 머신 1039처럼 워크로드가 편향된 노드는 비정상적인 자원 사용 패턴을 보였으며, 이는 공재배치 시 불균형의 영향을 잘 보여준다.
  • 시스템 수준의 이상은 주로 워크로드 간 간섭과 나쁜 스케줄링 결정에 의해 유도되며, 특히 메모리가 제한된 환경에서 배치 작업이 메모리 집약적인 온라인 서비스와 경쟁함으로써 악화된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.