Skip to main content
QUICK REVIEW

[論文レビュー] Self-play Learning Strategies for Resource Assignment in Open-RAN Networks

Xiaoyang Wang, Jonathan D. Thomas|arXiv (Cornell University)|Mar 3, 2021
Software-Defined Networks and 5G参考文献 34被引用数 4
ひとこと要約

本稿では、Open-RANネットワークにおけるRU-DUリソース割り当て問題を2次元ナップサック問題としてモデル化し、モンテカルロ木探索(MCTS)を組み合わせた自己対戦深層強化学習手法を提案する。代表的なナップサック環境でオフラインで訓練された本手法は、オンライン相互作用や専門家デモンストレーションを必要とせず、実世界のDUサイトで平均86.9%のリソース利用率を達成し、ベースラインを上回る性能を発揮した。

ABSTRACT

Open Radio Access Network (ORAN) is being developed with an aim to democratise access and lower the cost of future mobile data networks, supporting network services with various QoS requirements, such as massive IoT and URLLC. In ORAN, network functionality is dis-aggregated into remote units (RUs), distributed units (DUs) and central units (CUs), which allows flexible software on Commercial-Off-The-Shelf (COTS) deployments. Furthermore, the mapping of variable RU requirements to local mobile edge computing centres for future centralized processing would significantly reduce the power consumption in cellular networks. In this paper, we study the RU-DU resource assignment problem in an ORAN system, modelled as a 2D bin packing problem. A deep reinforcement learning-based self-play approach is proposed to achieve efficient RU-DU resource management, with AlphaGo Zero inspired neural Monte-Carlo Tree Search (MCTS). Experiments on representative 2D bin packing environment and real sites data show that the self-play learning strategy achieves intelligent RU-DU resource assignment for different network conditions.

研究の動機と目的

  • Open-RANネットワークにおける多様なQoS要件を満たす動的かつ複雑なRU-DUリソース割り当て問題に対処すること。
  • エッジクラウドデータセンターにおけるRUの集中処理を通じて、電力消費量と運用コストを削減すること。
  • 高価または時間がかかるデモンストレータデータに依存せずに、効率的でスケーラブルかつ適応可能なリソース管理を可能にすること。
  • さまざまなネットワーク状態や実世界の展開シナリオにおいても良好に動作する汎用性のある強化学習ポリシーの開発。
  • 動的かつ大規模なORAN環境におけるリアルタイムネットワークリソース割り当てにおいて、オフライン学習が可能かどうかを検討すること。

提案手法

  • RU-DUリソース割り当て問題を2次元ナップサック問題としてモデル化し、RUsをアイテム、DUsを幅が固定で高さが可変のボックスとして扱う。
  • 自己対戦強化学習フレームワークを採用し、エージェントが次第に強化される自分自身のバージョンと競い合いながらポリシー性能を向上させる。
  • アルファゴゼロにインspiredされた深層ニューラルネットワークとモンテカルロ木探索(MCTS)を組み合わせ、探索のガイドと価値関数の近似を実現する。
  • 自己対戦学習を可能にするための順位付けられた報酬メカニズムを導入し、絶対的報酬ではなく相対的パフォーマンスから学習する。
  • 最適解が保証される合成2次元ナップサック環境で事前学習を行い(つまり、r_max = 1)、実世界のインスタンスへの一般化を可能にする。
  • 訓練済みポリシーは、追加のオンラインファインチューニングなしに実ORANサイトのデータにデプロイされ、運用遅延とコストを最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1専門家デモンストレーションデータにアクセスできない状況でも、自己対戦深層強化学習はORANネットワークにおけるRU-DUリソース割り当て問題を効果的に解けるか?
  • RQ2最適解が保証される理想化された2次元ナップサック環境で事前学習されたモデルは、最適解が保証されない現実世界のORAN展開シナリオにどれほど一般化できるか?
  • RQ3実際のDUサイトのデータにおいて、自己対戦RLはヒューリスティック法やMCTSベースラインと比較して、どの程度のリソース利用率と報酬パフォーマンスを達成できるか?
  • RQ4動的ネットワークリソース割り当てにおいて、オフライン学習がオンライン相互作用を置き換えることができるか?運用コストと遅延を低減できるか?
  • RQ5本手法は、さまざまなDU容量やピーク時間帯のトラフィックパターンに対しても、高いパフォーマンスを維持できるか?

主な発見

  • 自己対戦学習手法は、DU2では平均報酬1.000、DU1では0.943を達成し、すべてのベースラインを顕著に上回った。
  • 本手法は、DU1で平均86.9%、DU2で86.4%のリソース利用率を達成し、RU要件の効率的なパッケージングを示した。
  • 最適解が保証される環境(r_max = 1)で学習されたにもかかわらず、最適解が保証されない現実世界のインスタンスに対しても良好に一般化した。
  • オフライン学習のパラダイムにより、オンライン相互作用やライブネットワーククエリの必要性が排除され、運用コストと遅延が低減した。
  • ピーク時間帯の変動するCPU要件や処理時間要件を伴う多様なネットワーク状態に対しても、高いパフォーマンスを維持した。
  • 結果として、MCTSと深層ニューラルネットワークを組み合わせた自己対戦RLは、専門家デモンストレーションなしで、実世界のORAN展開においてほぼ最適なパッケージングを達成できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。