Skip to main content
QUICK REVIEW

[論文レビュー] Learning from Peers: Transfer Reinforcement Learning for Joint Radio and Cache Resource Allocation in 5G Network Slicing.

Hao Zhou, Melike Erol‐Kantarci|arXiv (Cornell University)|Sep 16, 2021
Software-Defined Networks and 5G参考文献 30被引用数 4
ひとこと要約

本稿では、エキスパートエージェントを活用して学習を加速させ、パフォーマンスを向上させる、5Gネットワークスライシングにおける共同無線およびキャッシュリソース割り当てのための転送強化学習(TRL)フレームワークを提案する。QTRLおよびASTRLアルゴリズムは、PPF-TTLと比較してeMBBスルーレットを41.6%向上させ、URLLC遅延を40.3%低減し、Q-learnigよりも収束が速い。

ABSTRACT

Radio access network (RAN) slicing is an important part of network slicing in 5G. The evolving network architecture requires the orchestration of multiple network resources such as radio and cache resources. In recent years, machine learning (ML) techniques have been widely applied for network slicing. However, most existing works do not take advantage of the knowledge transfer capability in ML. In this paper, we propose a transfer reinforcement learning (TRL) scheme for joint radio and cache resources allocation to serve 5G RAN slicing.We first define a hierarchical architecture for the joint resources allocation. Then we propose two TRL algorithms: Q-value transfer reinforcement learning (QTRL) and action selection transfer reinforcement learning (ASTRL). In the proposed schemes, learner agents utilize the expert agents' knowledge to improve their performance on target tasks. The proposed algorithms are compared with both the model-free Q-learning and the model-based priority proportional fairness and time-to-live (PPF-TTL) algorithms. Compared with Q-learning, QTRL and ASTRL present 23.9% lower delay for Ultra Reliable Low Latency Communications slice and 41.6% higher throughput for enhanced Mobile Broad Band slice, while achieving significantly faster convergence than Q-learning. Moreover, 40.3% lower URLLC delay and almost twice eMBB throughput are observed with respect to PPF-TTL.

研究の動機と目的

  • 5G無線アクセスネットワークスライシングにおける収束が遅く、最適でないリソース割り当ての課題に対処すること。
  • エキスパートエージェントからの知識移転を活用して、共同無線およびキャッシュリソース割り当てにおける学習効率とパフォーマンスを向上させること。
  • 複数のネットワークスライスにわたる統合的リソースオ케ストレーションを実現する階層的アーキテクチャを設計すること。
  • 遅延、スルーレット、収束速度の観点から、従来のモデルフリーおよびモデルベース手法を上回ること。

提案手法

  • 5G RANスライシングにおける共同無線およびキャッシュリソース割り当てのための階層的アーキテクチャを提案する。
  • Q値転送強化学習(QTRL)を開発し、学習エージェントがエキスパートエージェントからQ値関数を転送する。
  • 行動選択転送強化学習(ASTRL)を設計し、学習エージェントがエキスパートエージェントから行動選択ポリシーを転送する。
  • エキスパートエージェントをソースタスクで訓練し、ターゲットタスクに再利用可能な知識を生成する。
  • 転送学習を適用して、ターゲットリソース割り当てタスクにおける収束を加速させ、パフォーマンスを向上させる。
  • 提案されたTRLスキームをQ-learnig(モデルフリー)およびPPF-TTL(モデルベース)のベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1転送強化学習は、5Gネットワークスライシングにおける共同無線およびキャッシュリソース割り当ての収束速度とパフォーマンスを向上させ得るか?
  • RQ2エキスパートエージェントからの知識移転は、URLLCおよびeMBBスライスにおける学習エージェントのパフォーマンスにどのように影響するか?
  • RQ3QTRLおよびASTRLは、遅延およびスルーレットの観点から、Q-learnigおよびPPF-TTLをどの程度上回るか?
  • RQ4階層的リソース割り当てアーキテクチャは、マルチスライス5Gネットワークにおけるシステムパフォーマンスにどのような影響を及ぼすか?

主な発見

  • QTRLおよびASTRLは、Q-learnigと比較してURLLCスライスの遅延を23.9%低減した。
  • ASTRLは、Q-learnigと比較してeMBBスライスのスルーレットを41.6%向上させた。
  • 知識移転のおかげで、提案されたTRLスキームはQ-learnigよりも著しく収束が速い。
  • QTRLおよびASTRLは、PPF-TTLベースラインと比較して、URLLC遅延を40.3%低減した。
  • ASTRLは、PPF-TTLと比較してeMBBスルーレットをほぼ2倍にした。
  • TRLベースのアプローチは、すべてのスライスにおける主要パフォーマンス指標で、モデルフリーおよびモデルベースのベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。