Skip to main content
QUICK REVIEW

[論文レビュー] A Reinforcement Learning Formulation of the Lyapunov Optimization: Application to Edge Computing Systems with Queue Stability

Sohee Bae, Seungyul Han|arXiv (Cornell University)|Dec 14, 2020
Age of Information Optimization参考文献 45被引用数 9
ひとこと要約

本稿は、エッジコンピューティングシステムにおけるリャプノフ最適化のための深層強化学習(DRL)定式化を提案し、時間平均ペナルティの最小化をキュー安定性制約のもとで実現する。構造化されたマルコフ決定過程(MDP)を設計し、リャプノフドリフト条件から導出された報酬関数を用いることで、各時刻における最適化を回避し、非凸および不連続なペナルティ関数に対しても効果的に対処でき、複雑な状況下で従来のDPPアルゴリズムを上回る性能を発揮する。

ABSTRACT

In this paper, a deep reinforcement learning (DRL)-based approach to the Lyapunov optimization is considered to minimize the time-average penalty while maintaining queue stability. A proper construction of state and action spaces is provided to form a proper Markov decision process (MDP) for the Lyapunov optimization. A condition for the reward function of reinforcement learning (RL) for queue stability is derived. Based on the analysis and practical RL with reward discounting, a class of reward functions is proposed for the DRL-based approach to the Lyapunov optimization. The proposed DRL-based approach to the Lyapunov optimization does not required complicated optimization at each time step and operates with general non-convex and discontinuous penalty functions. Hence, it provides an alternative to the conventional drift-plus-penalty (DPP) algorithm for the Lyapunov optimization. The proposed DRL-based approach is applied to resource allocation in edge computing systems with queue stability and numerical results demonstrate its successful operation.

研究の動機と目的

  • 従来のドリフトプラスペナルティ(DPP)アルゴリズムが各時刻で複雑な最適化問題を解く必要があるという計算負荷を軽減すること。
  • 強化学習(RL)が報酬最大化の目的を持つ一方でキュー安定性制約と矛盾するという課題を克服し、時間平均ペナルティを最小化しながらキュー安定性を保証すること。
  • リャプノフ最適化に適した安定的かつ効率的なDRL学習を可能にする、構造的な状態空間と行動空間を有する適切なMDP定式化を設計すること。
  • キュー安定性を保証するとともにペナルティを最小化する報酬関数クラスを設計し、SACのような実用的な割引RLアルゴリズムと互換性を持つこと。
  • DPPが失敗する非凸的かつ不連続なペナルティ関数を伴うエッジコンピューティングリソース割り当てのシナリオにおいて、本手法の有効性を実証すること。

提案手法

  • キュー長とタスク到着統計を含む状態空間、およびタスクのオフロードと計算リソース割り当てのための行動空間を有するマルコフ決定過程(MDP)を構築する。
  • リャプノフドリフトプラスペナルティ条件に基づいて報酬関数を導出することで、期待累積報酬を最大化することがキュー安定性を強制することを保証する。
  • 割引RLに適した1ステップ差分形式に報酬関数を変換し、Soft Actor-Critic(SAC)などのアルゴリズムとの利用を可能にする。
  • Soft Actor-Critic(SAC)アルゴリズムを用いて、ペナルティの最小化とキュー安定性の両立を実現するDRLポリシーを学習する。
  • 複数のアプリケーションタイプを有するエッジコンピューティングシステムにおいて、現実的なタスク到着モデルと不連続ペナルティ関数を用いて手法を検証する。
  • シミュレーション環境を用いて、DRLの性能をDPPと比較し、特に非凸的および不連続なコスト関数下での性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1DRLベースのアプローチは、計算負荷の高いDPPアルゴリズムに置き換え可能であり、キュー安定性を維持できるか?
  • RQ2キュー安定性制約をRL報酬関数にどのように組み込むか。これにより、ポリシー学習による長期的安定性を確保できるか?
  • RQ3従来のDPP最適化が失敗する非凸的および不連続なペナルティ関数に対しても、提案されたDRL定式化が対応可能か?
  • RQ4行動空間の次元が増加する場合、DRLアプローチの学習および性能スケーリング特性はいかなるものか?
  • RQ5DRLベースのポリシーは、理論的境界と同等の、時間平均ペナルティとキュー長の良好なトレードオフを達成できるか?

主な発見

  • DRL-SACエージェントは、不連続ペナルティ関数を伴うすべてのテストシナリオにおいて、時間平均ペナルティを最小化するとともにキュー安定性を維持するポリシーを効果的に学習した。
  • CPUコア割り当てに基づく不連続ペナルティ関数のケースでは、DPPアルゴリズムが微分不能性のため失敗したが、DRLアプローチは成功を収め、非凸性に対するロバストネスを示した。
  • N=8のアプリケーションを有する高次元ケースにおいても、DRLアプローチは安定した学習と効果的なキュー制御を維持し、キュー長が時間経過に伴い有界に保たれた。
  • DRL-SACエージェントは、理論的期待と整合する平均ペナルティと平均キュー長のトレードオフを達成した。V=100では低ペナルティと安定したキューが実現された。
  • 学習曲線は500,000ステップ以内に収束を示し、実行フェーズの結果から複数エピソードにわたり一貫した性能が確認された。
  • 提案された報酬関数設計により、リャプノフ安定性条件がRL目的関数に適切に組み込まれ、明示的な制約強制なしに安定した学習が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。