Skip to main content
QUICK REVIEW

[論文レビュー] Tailored Learning-Based Scheduling for Kubernetes-Oriented Edge-Cloud System

Yiwen Han, Shihao Shen|arXiv (Cornell University)|Jan 17, 2021
Cloud Computing and Resource Management参考文献 24被引用数 5
ひとこと要約

本稿では、Kubernetes指向のエッジ・クラウドシステム向けに、マルチエージェント強化学習とグラフニューラルネットワークを用いてリクエストディスpatchとサービスオ케ストレーションを動的に最適化する学習ベースのスケジューリングフレームワークKaiSを提案する。本手法は、システムモデルの仮定に依存せずにポリシーを学習することで、ベースラインと比較してスループットを14.3%向上し、スケジューリングコストを34.7%低減した。

ABSTRACT

Kubernetes (k8s) has the potential to merge the distributed edge and the cloud but lacks a scheduling framework specifically for edge-cloud systems. Besides, the hierarchical distribution of heterogeneous resources and the complex dependencies among requests and resources make the modeling and scheduling of k8s-oriented edge-cloud systems particularly sophisticated. In this paper, we introduce KaiS, a learning-based scheduling framework for such edge-cloud systems to improve the long-term throughput rate of request processing. First, we design a coordinated multi-agent actor-critic algorithm to cater to decentralized request dispatch and dynamic dispatch spaces within the edge cluster. Second, for diverse system scales and structures, we use graph neural networks to embed system state information, and combine the embedding results with multiple policy networks to reduce the orchestration dimensionality by stepwise scheduling. Finally, we adopt a two-time-scale scheduling mechanism to harmonize request dispatch and service orchestration, and present the implementation design of deploying the above algorithms compatible with native k8s components. Experiments using real workload traces show that KaiS can successfully learn appropriate scheduling policies, irrespective of request arrival patterns and system scales. Moreover, KaiS can enhance the average system throughput rate by 14.3% while reducing scheduling cost by 34.7% compared to baselines.

研究の動機と目的

  • 地理的に分散し、異種のエッジおよびクラウドリソースを管理するためのKubernetesにおけるネイティブなスケジューリングフレームワークの欠如に対処する。
  • 変動するワークロードやネットワーク状態に起因する動的で非線形なシステム行動および複雑な依存関係によるエッジ・クラウドシステムの課題を克服する。
  • 実世界の展開を可能にするために、ネイティブKubernetesコンポONENTと互換性を持つスケーラブルで分散型のスケジューリングソリューションを設計する。
  • サービスの応答時間、ネットワーク遅延、リクエストの到着パターンの正確な予測を必要とせずに、長期的なスループット最適化を実現する。
  • 階層的で段階的なスケジューリングと二段階時間スケールの協調によって、スケジューリングコストとオーケストレーションの複雑さを低減する。

提案手法

  • 分散型のリクエストディスパッチを実現するため、アクタ・クリティック法を用いた協調的マルチエージェントアルゴリズムを採用し、中央集権的なアクション空間の爆発を回避する。
  • システム状態情報(リソースの可用性、ネットワーク遅延、システム構造など)を低次元表現に埋め込むために、グラフニューラルネットワーク(GNN)を用いる。
  • GNNで埋め込まれた状態を複数のポリシーネットワークと統合し、段階的オーケストレーション意思決定によってスケジューリング行動の次元を低減する。
  • 二段階時間スケールのスケジューリングメカニズムを実装する:エッジアクセスポイント(eAP)で高速なディスpatch意思決定を行い、高価値のエッジノードのサブセットに対して遅延の大きい最適化されたサービス配置を実施する。
  • ネイティブKubernetesコンポONENTと互換性を持つようにフレームワークを設計し、既存のクラウドインfraストラクチャへのシームレスな統合を可能にする。
  • 長期的なシステムスループットを最大化し、スケジューリングコストを最小化するよう焦点を当てた報酬関数を定義し、強化学習によるエンド・ツー・エンドのポリシー学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1システムモデルの仮定に依存せずに、Kubernetesネイティブなエッジ・クラウド環境において、リクエストディスパッチとサービスオーケストレーションを学習ベースのスケジューリングフレームワークが効果的に管理できるか。
  • RQ2動的ワークロードを伴う大規模で階層的なエッジ・クラウドシステムにおいて、マルチエージェント強化学習を分散型ディスパッチに適応させる方法は何か。
  • RQ3グラフニューラルネットワークは、異種で分散型のエッジ・クラウド環境におけるシステム状態表現のスケーラビリティと正確性をどの程度向上できるか。
  • RQ4二段階時間スケールのスケジューリングメカニズムは、リアルタイムリクエスト処理において、応答性と最適化効率のバランスをどのようにとるか。
  • RQ5提案フレームワークは、多様なワークロードパターンとシステムスケールにおいて、既存のベースラインと比較して顕著なスループット向上とコスト削減を達成できるか。

主な発見

  • KaiSは、全テストワークロードパターンにおいて、最も近い競合ベースラインと比較して平均システムスループットレートを14.3%向上させた。
  • KaiSは、高価値のエッジノードに限定してサービスオーケストレーションを実施し、二段階時間スケールメカニズムを用いることで、スケジューリングコストを34.7%低減した。
  • フレームワークは、変動するリクエスト到着パターンやシステムスケール下でも効果的なスケジューリングポリシーを学習でき、強力な一般化能力を示した。
  • GSP-SSなどのベースラインとは異なり、KaiSは、適応的負荷分散と制限されたスケジューリングコストのおかげで、高負荷状態下でも高いパフォーマンスを維持した。
  • GNNとマルチエージェントRLの統合により、スケーラブルで低次元の行動空間表現が実現され、トレーニング効率とシステムスケーラビリティが向上した。
  • KaiSはネイティブKubernetesコンポONENTと互換性があるため、アーキテクチャの大規模な見直しを伴わずに、実世界のクラウドエッジインfraストラクチャへの実用的展開が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。