[论文解读] Multi-Objective Provisioning of Network Slices using Deep Reinforcement Learning
本文提出一种基于近端策略优化(PPO)的深度强化学习框架,用于解决5G网络中的多目标网络切片配置(NSP)问题,联合优化网络运营成本与服务等级协议(SLA)违反率。通过将实时配置建模为在线网络切片配置(ONSP)问题,并利用需求预测近似求解,该方法在无需事先掌握未来需求的情况下,实现了与最优整数规划(IP)基准相当的性能。
Network Slicing (NS) is crucial for efficiently enabling divergent network applications in next generation networks. Nonetheless, the complex Quality of Service (QoS) requirements and diverse heterogeneity in network services entails high computational time for Network Slice Provisioning (NSP) optimization. The legacy optimization methods are challenging to meet the low latency and high reliability of network applications. To this end, we model the real-time NSP as an Online Network Slice Provisioning (ONSP) problem. Specifically, we formulate the ONSP problem as an online Multi-Objective Integer Programming Optimization (MOIPO) problem. Then, we approximate the solution of the MOIPO problem by applying the Proximal Policy Optimization (PPO) method to the traffic demand prediction. Our simulation results show the effectiveness of the proposed method compared to the state-of-the-art MOIPO solvers with a lower SLA violation rate and network operation cost.
研究动机与目标
- 解决5G网络中在动态、不确定用户需求下实时网络切片配置(NSP)的高复杂性问题。
- 在多目标优化框架中联合最小化网络运营成本与SLA违反率。
- 开发一种鲁棒的在线NSP解决方案,能够适应波动的流量需求,且无需掌握未来请求的完整信息。
- 评估所提出的深度强化学习方法相对于次优和最优基准的性能表现。
提出的方法
- 将在线网络切片配置(ONSP)问题建模为多目标整数规划优化(MOIPO)问题。
- 采用近端策略优化(PPO)方法,使用两个神经网络:一个用于策略函数,一个用于价值函数。
- 将流量需求预测作为输入,引导PPO智能体做出切片配置决策。
- 采用代理损失函数,通过多轮次和小批量的随机梯度下降来优化策略。
- 集成价值函数以估计状态值,并引入优势函数以改进策略更新。
- 在连续的在线学习环境中实现PPO算法,以适应不断变化的用户需求模式。
实验结果
研究问题
- RQ1深度强化学习方法能否在动态网络切片配置中有效平衡成本最小化与SLA违反率降低?
- RQ2与贪婪策略和整数规划(IP)基准相比,基于PPO的方法在运营成本和SLA违反率方面表现如何?
- RQ3PPO智能体在缺乏对未来用户需求先验知识的情况下,能在多大程度上学习到最优配置策略?
- RQ4所提出的方法是否在保持计算实时可行性的前提下,实现了接近最优IP解的性能?
主要发现
- 基于PPO的方法实现了与最优整数规划(IP)基准相当的网络运营成本,显著优于贪婪基线方法。
- PPO方法的SLA违反率相比IP基准降低了1.15至1.28倍,表明其具备更优的公平性与可靠性。
- PPO框架在无需掌握未来用户需求完整信息的前提下,有效降低了SLA违反率与运营成本,展现出强大的鲁棒性。
- 仿真结果证实,PPO在实时在线环境中能有效近似求解NP难的MOIPO问题的最优解。
- 所提出方法在成本与SLA违反率两方面均优于贪婪方法,验证了基于学习的端到端优化方法的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。