[论文解读] Federated Deep Reinforcement Learning for Resource Allocation in O-RAN Slicing
该论文提出了一种联邦深度强化学习(Federated DRL)框架,用于协调Open RAN网络切片中的两个独立xAPP——功率控制和基于切片的资源分配。通过协调模型聚合本地Q-table以形成全局Q-table,该方法提升了学习效率和网络性能,在eMBB吞吐量方面比独立DRL高出11%,URLLC延迟降低33%,性能接近集中式训练。
Recently, open radio access network (O-RAN) has become a promising technology to provide an open environment for network vendors and operators. Coordinating the x-applications (xAPPs) is critical to increase flexibility and guarantee high overall network performance in O-RAN. Meanwhile, federated reinforcement learning has been proposed as a promising technique to enhance the collaboration among distributed reinforcement learning agents and improve learning efficiency. In this paper, we propose a federated deep reinforcement learning algorithm to coordinate multiple independent xAPPs in O-RAN for network slicing. We design two xAPPs, namely a power control xAPP and a slice-based resource allocation xAPP, and we use a federated learning model to coordinate two xAPP agents to enhance learning efficiency and improve network performance. Compared with conventional deep reinforcement learning, our proposed algorithm can achieve 11% higher throughput for enhanced mobile broadband (eMBB) slices and 33% lower delay for ultra-reliable low-latency communication (URLLC) slices.
研究动机与目标
- 为解决在O-RAN网络切片中协调多个具有不同动作空间和状态空间的独立xAPP代理的挑战。
- 在无法集中共享数据的分布式、隐私保护环境中,提升学习效率和网络性能。
- 在无需集中控制或全局状态可见性的情况下,实现异构xAPP(功率控制与资源分配)之间的协调。
- 在保持数据隐私并减少训练资源消耗的同时,实现接近集中式训练的性能。
- 将协调框架扩展至超过两个xAPP,在分布式联邦学习架构中实现可扩展性。
提出的方法
- 设计了两个不同的xAPP:一个功率控制xAPP和一个分层的无线资源分配xAPP,每个均作为独立的强化学习代理运行。
- 每个xAPP使用其本地数据和状态-动作观测训练本地深度Q网络(DQN)模型。
- 将两个xAPP的本地Q-table提交至中心协调模型,通过联邦聚合形成全局Q-table。
- 使用全局Q-table选择联合动作,随后将其分解并应用回各个xAPP以执行。
- 该框架采用联邦方式的参数聚合,在保护数据隐私的同时,实现异构代理间的协作学习。
- 协调模型实现了具有不同状态和动作空间的代理之间的信息共享,从而提升整体系统性能。
实验结果
研究问题
- RQ1联邦深度强化学习能否在O-RAN网络切片中有效协调多个具有不同状态和动作空间的异构xAPP?
- RQ2在eMBB和URLLC切片的吞吐量与延迟方面,联邦DRL与独立DRL及集中式DRL相比表现如何?
- RQ3联邦方法在分布式O-RAN环境中在多大程度上提升了学习收敛速度与可扩展性?
- RQ4联邦框架是否能在保持数据隐私的同时实现与集中式训练相当的性能?
- RQ5联邦协调对QoS指标(如延迟与吞吐量)在不同流量负载下的影响如何?
主要发现
- 在eMBB流量负载为10 Mbps时,所提出的联邦DRL框架相比独立DRL,eMBB切片的吞吐量提高了11%。
- 在eMBB负载为10 Mbps时,该框架将URLLC切片延迟降低了33%,相比独立DRL。
- 联邦DRL实现了与集中式DRL非常接近的网络性能,表明即使在去中心化训练下,仍具备强大的协调能力。
- 联邦DRL算法的收敛速度优于集中式DRL,归因于每个代理的简化状态与动作空间。
- URLLC延迟的超额累积分布函数(ECCDF)显示,联邦DRL的延迟分布优于独立DRL,尾部延迟更低。
- 该框架可扩展至超过两个xAPP,其计算成本等同于训练一个输入/输出维度等于所有xAPP动作空间总和的单一DNN。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。