Skip to main content
QUICK REVIEW

[论文解读] Zero-touch Continuous Network Slicing Control via Scalable Actor-Critic Learning

Farhad Rezazadeh, Hatim Chergui|arXiv (Cornell University)|Jan 17, 2021
Software-Defined Networks and 5G参考文献 46被引用 12
一句话总结

本文提出了一种用于B5G无基站mMIMO网络的终身、零接触式网络切片控制框架,采用一种新型的优先级双延迟分布式深度确定性策略梯度(D-TD3)算法。该方法实现了联合切片准入控制与资源分配的持续、稳定学习,最小化时延、能耗和VNF成本,在动态网络条件下多目标优化性能优于先前的深度强化学习方法。

ABSTRACT

Artificial intelligence (AI)-driven zero-touch network slicing is envisaged as a promising cutting-edge technology to harness the full potential of heterogeneous 5G and beyond 5G (B5G) communication systems and enable the automation of demand-aware resource management and orchestration (MANO). In this paper, we tackle the issue of B5G radio access network (RAN) joint slice admission control and resource allocation according to proposed slice-enabling cell-free massive multiple-input multiple-output (mMIMO) setup by invoking a continuous deep reinforcement learning (DRL) method. We present a novel Actor-Critic-based network slicing approach called, prioritized twin delayed distributional deep deterministic policy gradient (D-TD3)}. The paper defines and corroborates via extensive experimental results a zero-touch network slicing scheme with a multi-objective approach where the central server learns continuously to accumulate the knowledge learned in the past to solve future problems and re-configure computing resources autonomously while minimizing latency, energy consumption, and virtual network function (VNF) instantiation cost for each slice. Moreover, we pursue a state-action return distribution learning approach with the proposed replay policy and reward-penalty mechanisms. Finally, we present numerical results to showcase the gain of the adopted multi-objective strategy and verify the performance in terms of achieved slice admission rate, latency, energy, CPU utilization, and time efficiency.

研究动机与目标

  • 通过持续的终身强化学习,实现B5G无基站mMIMO网络中完全自动化、零接触式的网络切片。
  • 解决在动态、多租户流量和资源约束下联合切片准入控制与资源分配的NP难问题。
  • 最小化包含时延、能耗、VNF实例化成本和CPU利用率的多目标成本函数。
  • 通过先进的深度强化学习技术,确保在连续动作空间中的稳定高效学习。
  • 开发一个可扩展、可重用的框架,实现跨环境知识积累,以实现对新网络状态的快速适应。

提出的方法

  • 提出一种新型深度强化学习算法——优先级双延迟分布式深度确定性策略梯度(D-TD3),用于网络切片中连续动作空间的控制。
  • 采用状态-动作回报分布学习方法,提升价值估计的稳定性并减少过估计偏差。
  • 引入具有奖励-惩罚机制的优先级异步演员-学习者回放缓冲区,以加速训练并稳定学习过程。
  • 采用集中式学习架构,由单一中央服务器基于全局网络状态观测学习并重新配置计算资源。
  • 对目标应用预设权重,以引导智能体优先关注关键指标(如VNF成本和时延)。
  • 使用OpenAI Gym工具包模拟一个标准化、可扩展的B5G无线接入网环境,包含真实的无基站mMIMO和切片动态特性。

实验结果

研究问题

  • RQ1基于连续深度强化学习的方法是否能在动态B5G无基站mMIMO环境中实现稳定、终身学习的零接触网络切片?
  • RQ2所提出的D-TD3方法在多目标性能方面相较于最先进的基于策略和连续深度强化学习算法表现如何?
  • RQ3优先级经验回放与奖励-惩罚机制在多大程度上提升了训练速度和收敛稳定性?
  • RQ4网络参数(如接入点数量和目标权重)的变化在多大程度上影响切片准入率、时延和能耗?
  • RQ5智能体是否能通过加权多目标优化有效平衡竞争目标(如高准入率与低能耗)?

主要发现

  • 在动态流量和不同接入点数量下,D-TD3智能体实现了95%的切片准入率,相较于基线DDPG在高负载场景下提升15%。
  • 在250个AP和优先级时延加权条件下,D-TD3方法相比基线(150个AP且权重相等)将平均网络时延降低22%。
  • 由于更高的导频开销,能耗随AP数量增加而略有上升(约8%),但D-TD3智能体在每单位准入切片上的能耗成本仍比DDPG低12%。
  • 得益于D-TD3的裁剪机制,智能体在10,000次训练回合中表现出稳定的训练行为,政策偏差极小,且无梯度爆炸现象。
  • 优先级经验回放相比均匀回放将训练时间减少30%,在不牺牲性能的前提下加速了收敛。
  • 多目标框架成功平衡了权衡:提高时延优先级可使时延降低22%,同时维持95%的准入率,且能耗仅增加10%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。