Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic SDN-based Radio Access Network Slicing with Deep Reinforcement Learning for URLLC and eMBB Services

Abderrahime Filali, Zoubeir Mlika|arXiv (Cornell University)|Feb 13, 2022
Software-Defined Networks and 5G被引用数 4
ひとこと要約

本稿では、深層強化学習を用いて、動的かつ柔軟に無線リソースをURLLCおよびeMBBサービスに割り当てる2段階タイムスケールSDNベースのRANスライシングフレームワークを提案する。長時間スケールでは、SDNコントローラーがEXP3に基づく単一エージェントMDPを用いてgNodeBにリソースブロック(RB)を割り当てる。短時間スケールでは、gNodeBがマルチエージェント深層Q学習(DQL)を用いてユーザーにRBをスケジューリングし、必要に応じて隣接するgNodeBからリソースを借りる。これにより、動的なトラフィック条件下でも両サービスのQoSが顕著に向上する。

ABSTRACT

Radio access network (RAN) slicing is a key technology that enables 5G network to support heterogeneous requirements of generic services, namely ultra-reliable low-latency communication (URLLC) and enhanced mobile broadband (eMBB). In this paper, we propose a two time-scales RAN slicing mechanism to optimize the performance of URLLC and eMBB services. In a large time-scale, an SDN controller allocates radio resources to gNodeBs according to the requirements of the eMBB and URLLC services. In a short time-scale, each gNodeB allocates its available resources to its end-users and requests, if needed, additional resources from adjacent gNodeBs. We formulate this problem as a non-linear binary program and prove its NP-hardness. Next, for each time-scale, we model the problem as a Markov decision process (MDP), where the large-time scale is modeled as a single agent MDP whereas the shorter time-scale is modeled as a multi-agent MDP. We leverage the exponential-weight algorithm for exploration and exploitation (EXP3) to solve the single-agent MDP of the large time-scale MDP and the multi-agent deep Q-learning (DQL) algorithm to solve the multi-agent MDP of the short time-scale resource allocation. Extensive simulations show that our approach is efficient under different network parameters configuration and it outperforms recent benchmark solutions.

研究の動機と目的

  • 集中型および多段階のRANスライシングアプローチにおける高いシグナルオーバーヘッドと柔軟性に欠けるリソース割り当ての問題に対処すること。
  • SDN対応RANにおける異種5Gサービス(URLLCおよびeMBB)の動的でスケーラブルかつQoSに配慮した無線リソース割り当てを可能にすること。
  • gNodeBでの短時間スケールリソーススケジューリングを分散化することで、SDNコントローラーとの頻繁なやり取りに依存するのを減らすこと。
  • 動的なネットワーク環境下でもURLLCの信頼性と低遅延性、eMBBの高スループットを確保すること。
  • 変動するユーザー需要と限られた事前割り当てリソースに対応できる、強固で適応的なリソース割り当てメカニズムの開発

提案手法

  • リソースブロック(RB)割り当て問題を非線形バイナリ計画問題として定式化し、NP困難性を証明する。
  • SDNコントローラーによる長時間スケールのRB割り当てを、探索と活用を最適化するEXP3アルゴリズムを用いた単一エージェントMDPとしてモデル化する。
  • gNodeBレベルでの短時間スケールリソース割り当てを、マルチエージェントMDPとしてモデル化し、安定性と性能向上のためのダブルDQNと経験再生を用いたマルチエージェント深層Q学習(DQL)で解く。
  • 事前割り当てリソースが不足した場合に、gNodeBが隣接するgNodeBから未使用のRBを動的に借りられるようにする。これによりリソース利用効率とQoSが向上する。
  • ターゲットネットワークとリプレイメモリを統合した、頑健な深層強化学習コンponentsを用いて、学習収束性と意思決定品質を向上させる。
  • 2段階アーキテクチャを採用:SDNコントローラーによる長期的RB割り当て、その後に各gNodeBでのリアルタイムのユーザー需要に基づくローカルで高速なスケジューリング
Figure 1 : Resource block allocation procedure
Figure 1 : Resource block allocation procedure

実験結果

リサーチクエスチョン

  • RQ1動的なトラフィック条件下で、SDNベースのRANスライシングは、URLLCとeMBBサービス間のリソース割り当てをどのように効率的にバランスさせるか?
  • RQ2階層的RANスライシングアーキテクチャにおいて、シグナルオーバーヘッドとQoS満足度の最適なトレードオフは何か?
  • RQ3マルチエージェント深層Q学習アプローチは、集中型または単一エージェント手法を上回る性能を発揮できるか?
  • RQ4gNodeB間のRB借用メカニズムは、急激なトラフィックピーク時におけるリソース可用性とサービス信頼性をどのように向上させるか?
  • RQ5提案された2タイムスケールメカニズムは、遅延に敏感なサービスおよび高スループットサービスのQoSを維持しつつ、SDNコントローラーとの頻繁なやり取りにどれほど依存しなくなるか?

主な発見

  • SAMA-RL(提案手法)は、全テストされた最小データレート閾値において、3-SRAおよび1-SRAを常に上回り、合計スムデータレートを最大化する。
  • 最小データレート閾値が高くなるほど、SAMA-RLとベンチマークの性能差が拡大し、厳しいQoS制約下でも本手法の頑健性が示された。
  • 全設定において、SAMA-RLは3-SRAおよび1-SRAよりも最小データレート閾値を満たすエンドユーザー数がより多い。
  • SAMA-RLは、特に高い遅延閾値下でも、エンドユーザーの遅延要件満たし率において、3-SRAおよび1-SRAを顕著に上回った。
  • マルチエージェントDQLベースの借用メカニズムにより、gNodeBは追加のRBを動的にアクセス可能となり、サービスブロッキングが低減され、QoSのレジリエンスが向上した。
  • シミュレーション結果から、提案された2タイムスケールメカニズムがシグナルオーバーヘッドを低減するとともに、URLLCおよびeMBBサービスのQoSを維持または向上させることを確認した。
Figure 2 : Single-agent multi-agent interaction with the MDP environment.
Figure 2 : Single-agent multi-agent interaction with the MDP environment.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。