[论文解读] Self-play Learning Strategies for Resource Assignment in Open-RAN Networks
本文提出一种结合蒙特卡洛树搜索(MCTS)的自博弈深度强化学习方法,用于解决开放无线接入网(Open-RAN)网络中的RU-DU资源分配问题,将其建模为二维装箱问题。该方法在代表性装箱环境上离线训练,实测在真实DU站点上实现了86.9%的平均资源利用率,优于基线方法,且无需在线交互或专家示范。
Open Radio Access Network (ORAN) is being developed with an aim to democratise access and lower the cost of future mobile data networks, supporting network services with various QoS requirements, such as massive IoT and URLLC. In ORAN, network functionality is dis-aggregated into remote units (RUs), distributed units (DUs) and central units (CUs), which allows flexible software on Commercial-Off-The-Shelf (COTS) deployments. Furthermore, the mapping of variable RU requirements to local mobile edge computing centres for future centralized processing would significantly reduce the power consumption in cellular networks. In this paper, we study the RU-DU resource assignment problem in an ORAN system, modelled as a 2D bin packing problem. A deep reinforcement learning-based self-play approach is proposed to achieve efficient RU-DU resource management, with AlphaGo Zero inspired neural Monte-Carlo Tree Search (MCTS). Experiments on representative 2D bin packing environment and real sites data show that the self-play learning strategy achieves intelligent RU-DU resource assignment for different network conditions.
研究动机与目标
- 为具有多样化服务质量(QoS)需求的Open-RAN网络中的动态复杂RU-DU资源分配问题提供解决方案。
- 通过在边缘云数据中心集中处理RUs,降低功耗和运营成本。
- 实现实时、可扩展且自适应的资源管理,无需依赖昂贵或耗时的示范数据。
- 开发一种可泛化的强化学习策略,在不同网络条件和真实部署场景中均表现良好。
- 探索在动态、大规模ORAN环境中,离线训练是否可行用于实时网络资源分配。
提出的方法
- 将RU-DU资源分配问题建模为二维装箱问题,其中RUs为物品,DUs为具有固定宽度和可变高度的箱子。
- 采用自博弈强化学习框架,智能体与自身逐步增强的版本竞争,以提升策略性能。
- 该方法结合深度神经网络与蒙特卡洛树搜索(MCTS),受AlphaGo Zero启发,用于引导探索与价值函数近似。
- 引入排序奖励机制以支持自博弈训练,使智能体从相对表现而非绝对奖励中学习。
- 在合成二维装箱环境中预训练模型,其中最优解可保证(即 r_max = 1),从而实现向真实世界实例的泛化。
- 训练后的策略直接部署于真实ORAN站点数据,无需进一步在线微调,最大限度降低操作延迟与成本。
实验结果
研究问题
- RQ1在无专家示范数据的情况下,自博弈深度强化学习能否有效解决ORAN网络中的RU-DU资源分配问题?
- RQ2在理想化二维装箱环境上预训练的模型,其在存在非理想约束的真实ORAN部署场景中的泛化能力如何?
- RQ3与启发式方法和MCTS基线相比,自博弈强化学习在真实DU站点数据中可实现的资源利用率和奖励性能水平如何?
- RQ4离线训练能否替代动态网络资源分配中的在线交互,从而降低运营成本与延迟?
- RQ5所提方法在不同DU容量和高峰时段流量模式下,如何保持高性能?
主要发现
- 自博弈学习方法在DU2上达到平均奖励1.000,在DU1上达到0.943,显著优于所有基线方法。
- 在DU1上实现86.9%的平均资源利用率,在DU2上实现86.4%,表明在打包RU需求方面具有高效率。
- 尽管模型在最优解可保证的环境中训练(r_max = 1),仍能良好泛化至真实世界实例,其中此类最优性无法保证。
- 离线训练范式消除了对在线交互或实时网络查询的需求,降低运营成本与延迟。
- 该方法在多种网络条件下保持高性能,包括具有可变CPU和处理时间需求的高峰时段流量。
- 结果表明,结合MCTS与深度神经网络的自博弈强化学习可在无需专家示范的情况下,实现实时ORAN部署中的近似最优打包。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。