[论文解读] Dynamic SDN-based Radio Access Network Slicing with Deep Reinforcement Learning for URLLC and eMBB Services
该论文提出了一种基于两时间尺度SDN的RAN切片框架,利用深度强化学习动态分配无线资源给URLLC和eMBB服务。在长 timescale 上,SDN控制器通过基于EXP3的单智能体MDP将资源块(RBs)分配给gNodeBs;在短 timescale 上,gNodeBs使用多智能体深度Q学习(DQL)对用户进行RB调度,并在需要时从邻近gNodeBs借用资源,显著提升了在动态流量下两种服务的QoS。
Radio access network (RAN) slicing is a key technology that enables 5G network to support heterogeneous requirements of generic services, namely ultra-reliable low-latency communication (URLLC) and enhanced mobile broadband (eMBB). In this paper, we propose a two time-scales RAN slicing mechanism to optimize the performance of URLLC and eMBB services. In a large time-scale, an SDN controller allocates radio resources to gNodeBs according to the requirements of the eMBB and URLLC services. In a short time-scale, each gNodeB allocates its available resources to its end-users and requests, if needed, additional resources from adjacent gNodeBs. We formulate this problem as a non-linear binary program and prove its NP-hardness. Next, for each time-scale, we model the problem as a Markov decision process (MDP), where the large-time scale is modeled as a single agent MDP whereas the shorter time-scale is modeled as a multi-agent MDP. We leverage the exponential-weight algorithm for exploration and exploitation (EXP3) to solve the single-agent MDP of the large time-scale MDP and the multi-agent deep Q-learning (DQL) algorithm to solve the multi-agent MDP of the short time-scale resource allocation. Extensive simulations show that our approach is efficient under different network parameters configuration and it outperforms recent benchmark solutions.
研究动机与目标
- 解决集中式和多层级RAN切片方法中高信令开销和资源分配不灵活的问题。
- 在SDN增强的RAN中实现针对异构5G服务(URLLC和eMBB)的动态、可扩展且QoS感知的无线资源分配。
- 通过在gNodeBs上分散短 timescale 资源调度,降低对频繁SDN控制器交互的依赖。
- 在动态网络条件下,确保为URLLC提供可靠且低延迟的支持,同时为eMBB提供高吞吐量。
- 开发一种稳健、自适应的资源分配机制,以应对波动的用户需求和有限的预分配资源。
提出的方法
- 将无线资源块(RB)分配问题建模为非线性二值规划问题,并证明其为NP难问题。
- 将SDN控制器在长 timescale 上的RB分配建模为单智能体马尔可夫决策过程(MDP),并使用EXP3算法实现探索与利用的平衡。
- 将gNodeB层级在短 timescale 上的资源分配建模为多智能体MDP,采用多智能体深度Q学习(DQL)结合双DQN和经验回放,以提升稳定性和性能。
- 使gNodeBs能够在预分配资源不足时,动态地从邻近gNodeBs借用未使用的RB,从而提高资源利用率和QoS。
- 集成鲁棒的深度强化学习组件,包括目标网络和经验回放,以增强学习收敛性和决策质量。
- 采用两级架构:由SDN控制器进行长期RB分配至gNodeBs,随后各gNodeBs基于实时用户需求进行本地快速调度。

实验结果
研究问题
- RQ1在动态流量条件下,基于SDN的RAN切片如何高效平衡URLLC和eMBB服务之间的资源分配?
- RQ2在分层RAN切片架构中,信令开销与QoS满足之间的最优权衡是什么?
- RQ3多智能体深度强化学习方法在本地gNodeB层级资源调度中是否优于集中式或单智能体方法?
- RQ4gNodeB之间的RB借用机制如何在突发流量高峰期间提升资源可用性和服务可靠性?
- RQ5所提出的两时间尺度机制在多大程度上减少了对频繁SDN控制器交互的依赖,同时仍能维持对时延敏感和高吞吐量服务的QoS?
主要发现
- SAMA-RL(所提方法)在所有测试的最小数据速率阈值下,始终优于3-SRA和1-SRA,能够最大化总和数据速率。
- 随着最小数据速率阈值的提高,SAMA-RL与基准方法之间的性能差距进一步扩大,表明该方法在严格QoS约束下具有更强的鲁棒性。
- 在所有配置下,SAMA-RL实现的满足最小数据速率阈值的终端用户数量均高于3-SRA和1-SRA。
- SAMA-RL在满足终端用户延迟要求方面显著优于3-SRA和1-SRA,尤其是在高延迟阈值条件下。
- 基于多智能体DQL的借用机制使gNodeBs能够动态访问额外的RB,减少服务阻塞,提升QoS韧性。
- 仿真结果证实,所提出的两时间尺度机制在降低信令开销的同时,维持或改善了URLLC和eMBB服务的QoS。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。