Skip to main content
QUICK REVIEW

[論文レビュー] Anomaly Analysis for Co-located Datacenter Workloads in the Alibaba Cluster

Rui Ren, Jinheng Li|arXiv (Cornell University)|Nov 14, 2018
Cloud Computing and Resource Management参考文献 15被引用数 5
ひとこと要約

本稿は、Alibabaの共同配置データセンターワークロードトレースを分析し、ワークロードのアンバランスとスケジューリングの非効率性によって引き起こされるパフォーマンスの異常を特定する。DTWに基づくノード類似度、iForest異常検出、ワークロード分布の分類を用いて、短時間のバッチジョブにおけるメモリ使用率が長時間稼働するオンラインコンテナと比べて著しく不安定であることが明らかになった。また、8つの異なるワークロード分布カテゴリが、ノード間のリソース使用率パターンの大部分を説明しており、アンバランスが主な異常要因であることが判明した。

ABSTRACT

In warehouse-scale cloud datacenters, co-locating online services and offline batch jobs is an efficient approach to improving datacenter utilization. To better facilitate the understanding of interactions among the co-located workloads and their real-world operational demands, Alibaba recently released a cluster usage and co-located workload dataset, which is the first publicly dataset with precise information about the category of each job. In this paper, we perform a deep analysis on the released Alibaba workload dataset, from the perspective of anomaly analysis and diagnosis. Through data preprocessing, node similarity analysis based on Dynamic Time Warping (DTW), co-located workloads characteristics analysis and anomaly analysis based on iForest, we reveals several insights including: (1) The performance discrepancy of machines in Alibaba's production cluster is relatively large, for the distribution and resource utilization of co-located workloads is not balanced. For instance, the resource utilization (especially memory utilization) of batch jobs is fluctuating and not as stable as that of online containers, and the reason is that online containers are long-running jobs with more memory-demanding and most batch jobs are short jobs, (2) Based on the distribution of co-located workload instance numbers, the machines can be classified into 8 workload distribution categories1. And most patterns of machine resource utilization curves are similar in the same workload distribution category. (3) In addition to the system failures, unreasonable scheduling and workload imbalance are the main causes of anomalies in Alibaba's cluster.

研究の動機と目的

  • Alibabaの共同配置データセンタークラスタにおけるパフォーマンスの差異とリソース使用率のアンバランスを調査すること。
  • 共同配置ワークロードの分布パターンに基づいてノードを分類し、その影響がリソース使用率曲線に与える影響を評価すること。
  • 異常ノードを検出し、システム障害を超えた異常原因を診断すること。
  • iForestおよびDTWに基づく手法が、実世界の本番トレースにおけるパフォーマンス異常を特定する上でどの程度有効であるかを評価すること。

提案手法

  • Alibabaクラスタトレースに対して包括的なデータ前処理を実施し、データ補完、フィルタリング、相関解析、集約処理を実施することで、コンテナレベル、バッチレベル、サーバーレベルのリソース使用メトリクスを生成した。
  • 動的時間ワープ(DTW)を用いて、CPU、メモリ、ディスク使用率の時間的パターンに基づきノード類似度を計算し、通常状態下での同等ノード(ピアノード)の特定を可能にした。
  • ノードごとのオンラインコンテナ数とバッチジョブ数に基づき、8つのワークロード分布カテゴリにマシンを分類し、各カテゴリ内での一貫性のある使用率パターンを明らかにした。
  • 正常動作をモデル化し、顕著に逸脱したリソース使用率パターンを示すノードを特定するために、iForestアルゴリズムを用いて異常検出を実施した。
  • 異常ノードの原因を特定するため、異常ノードをスケジューリングポリシー、ワークロードの偏り、リソース競合と照合して分析した。
  • Alibabaのウェアハウススケールデータセンターの本番トレースを用いて、CPUおよびメモリ使用率のダイナミクスに注目して、結果の妥当性を検証した。

実験結果

リサーチクエスチョン

  • RQ1共同配置データセンターワークロードにおいて、長時間稼働するオンラインコンテナと短時間のバッチジョブの間で、リソース使用率のパターンはどのように異なるか?
  • RQ2ワークロード分布パターン(例:ノードあたりのコンテナ数やバッチジョブ数)が、ノード間のリソース使用率曲線の類似度にどの程度影響を与えるか?
  • RQ3ハードウェア障害を除き、Alibabaの共同配置クラスタにおけるパフォーマンス異常の主な原因は何であるか?
  • RQ4DTWに基づくノード類似度と組み合わせたiForestが、実世界のデータセンタートレースにおける異常検出にどの程度有効であるか?
  • RQ5ワークロード分布カテゴリを用いて、ノードレベルのパフォーマンス差異を予測・説明できるか?

主な発見

  • Alibabaの本番クラスタにおけるマシン間のパフォーマンス差は顕著であり、主にワークロードのアンバランスと、長時間稼働するオンラインコンテナと比べて著しく変動しやすい短時間バッチジョブのメモリ使用率の不安定さに起因する。
  • ノードごとのオンラインコンテナ数とバッチジョブ数に基づき、8つの明確なワークロード分布カテゴリにマシンを分類でき、同じカテゴリに属するノードはCPU、メモリ、ディスクメトリクスにおいて極めて類似したリソース使用率パターンを示す。
  • バッチジョブにおけるメモリ使用率は、その短時間性とバースト性のため著しく不安定で変動が激しいが、オンラインコンテナは時間経過に伴い一貫したメモリ消費を維持する。
  • iForestに基づく異常検出手法は、異常ノードを効果的に同定した。主な原因はハードウェア障害ではなく、スケジューリングの非効率性とワークロードのアンバランスであった。
  • 偏ったワークロードを有するノード(例:マシン1039は71件のバッチジョブと1つのオンラインコンテナをホスティング)は、異常なリソース使用率を示し、共同配置におけるアンバランスの影響を強く示している。
  • システムレベルの異常は、主にワークロード間干渉と不良なスケジューリング意思決定によって引き起こされ、とくにバッチジョブがメモリ集約型のオンラインサービスと競合するメモリ制限環境で顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。