Skip to main content
QUICK REVIEW

[論文レビュー] Federated Deep Reinforcement Learning for Resource Allocation in O-RAN Slicing

Han Zhang, Hao Zhou|arXiv (Cornell University)|Aug 2, 2022
Energy Harvesting in Wireless Networks被引用数 4
ひとこと要約

本稿では、Open RANネットワークスライシングにおける2つの独立したxAPP(電力制御とスライスベースリソース割り当て)を調整するためのフェデレーテッド深層強化学習(Federated DRL)フレームワークを提案する。局所的なQテーブルを調整モデルを介して集約し、グローバルQテーブルを形成することで、学習効率とネットワーク性能が向上し、中央集権的学習に近い性能を達成する。独立したDRLと比較して、eMBBスルーレットは11%向上、URLLC遅延は33%低減された。プライバシー保護が保たれ、スケーラブルなリソース割り当てが可能である。

ABSTRACT

Recently, open radio access network (O-RAN) has become a promising technology to provide an open environment for network vendors and operators. Coordinating the x-applications (xAPPs) is critical to increase flexibility and guarantee high overall network performance in O-RAN. Meanwhile, federated reinforcement learning has been proposed as a promising technique to enhance the collaboration among distributed reinforcement learning agents and improve learning efficiency. In this paper, we propose a federated deep reinforcement learning algorithm to coordinate multiple independent xAPPs in O-RAN for network slicing. We design two xAPPs, namely a power control xAPP and a slice-based resource allocation xAPP, and we use a federated learning model to coordinate two xAPP agents to enhance learning efficiency and improve network performance. Compared with conventional deep reinforcement learning, our proposed algorithm can achieve 11% higher throughput for enhanced mobile broadband (eMBB) slices and 33% lower delay for ultra-reliable low-latency communication (URLLC) slices.

研究の動機と目的

  • O-RANネットワークスライシングにおける、異なる行動空間と状態空間を持つ複数の独立したxAPPエージェントを調整する課題に対処すること。
  • 中央集権的にデータを共有できない分散型でプライバシー保護が保たれる環境において、学習効率とネットワーク性能を向上させること。
  • 中央集権的制御やグローバル状態の可視化を必要とせず、異種のxAPP(電力制御とリソース割り当て)間での協調を可能にすること。
  • 中央集権的学習に近い性能を達成しながら、データプライバシーを維持し、学習リソースの消費を削減すること。
  • 分散型でフェデレーテッドラーニングアーキテクチャにおいて、2つ以上のxAPPにスケーラブルな調整フレームワークを適用すること。

提案手法

  • 2つの異なるxAPPを設計:電力制御xAPPと階層的無線リソース割り当てxAPPで、それぞれ独立した強化学習エージェントとして動作する。
  • 各xAPPは自らのローカルデータと状態-行動観測に基づいて、ローカルなディープQネットワーク(DQN)モデルを学習する。
  • 両方のxAPPから得られたローカルQテーブルが、中央の調整モデルに送信され、フェデレーテッド集約によりグローバルQテーブルに統合される。
  • 得られたグローバルQテーブルを用いて連携行動を選択し、それを個々のxAPPに分解して実行に反映する。
  • フレームワークはフェデレーテッドな方法でパラメータ集約を実行し、データプライバシーを保ちながら、異種エージェント間での協調学習を可能にする。
  • 調整モデルにより、異なる状態空間と行動空間を持つエージェント間で情報共有が可能となり、全体のシステム性能が向上する。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッド深層強化学習は、O-RANネットワークスライシングにおいて、異なる状態空間と行動空間を持つ複数の異種xAPPを効果的に調整できるか?
  • RQ2eMBBおよびURLLCスライスのスルーレットと遅延の観点から、フェデレーテッドDRLの性能は、独立したDRLおよび中央集権的DRLと比較してどの程度異なるか?
  • RQ3フェデレーテッドアプローチは、分散型O-RAN環境における学習収束速度とスケーラビリティをどの程度向上させるか?
  • RQ4フェデレーテッドフレームワークは、中央集権的学習に匹敵する性能を達成しながら、データプライバシーを維持できるか?
  • RQ5フェデレーテッド調整は、変動するトラフィック負荷下でのQoS指標(遅延とスルーレット)にどのような影響を与えるか?

主な発見

  • 提案されたフェデレーテッドDRLフレームワークは、eMBBスルーレットが10 Mbpsのトラフィック負荷下で、独立したDRLと比較して11%高い性能を達成した。
  • eMBB負荷が10 Mbpsの条件下で、フレームワークはURLLCスライスの遅延を独立したDRLと比較して33%低減した。
  • フェデレーテッドDRLは中央集権的学習に非常に近いネットワーク性能を達成しており、分散学習であるにもかかわらず強力な調整能力を示した。
  • フェデレーテッドDRLアルゴリズムの収束速度は、中央集権的DRLよりも速く、これは各エージェントの状態空間と行動空間が小さくなったことに起因する。
  • URLLC遅延のECCDF(累積分布関数)の結果、フェデレーテッドDRLは独立したDRLと比較して、より良好な遅延分布を示し、尾部遅延が低減された。
  • フレームワークは2つ以上のxAPPへもスケーラブルであり、計算コストはすべてのxAPPの行動空間の合計に等しい入出力次元を持つ単一のDNNを学習するのと同等である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。