Skip to main content
QUICK REVIEW

[论文解读] DRAG: Deep Reinforcement Learning Based Base Station Activation in Heterogeneous Networks

Junhong Ye, Ying–Jun Angela Zhang|arXiv (Cornell University)|Sep 6, 2018
Advanced MIMO Systems Optimization被引用 6
一句话总结

本文提出 DRAG,一种基于深度强化学习的算法,用于异构网络中能量高效的小型基站(SBS)激活。通过将 SBS 开关调度建模为马尔可夫决策过程,并采用具有新颖动作优化方案的深度确定性策略梯度(DDPG),DRAG 在存储和计算方面均实现了多项式复杂度,相较于表格方法展现出更优的能量效率与可扩展性。

ABSTRACT

Heterogeneous Network (HetNet), where Small cell Base Stations (SBSs) are densely deployed to offload traffic from macro Base Stations (BSs), is identified as a key solution to meet the unprecedented mobile traffic demand. The high density of SBSs are designed for peak traffic hours and consume an unnecessarily large amount of energy during off-peak time. In this paper, we propose a deep reinforcement-learning based SBS activation strategy that activates the optimal subset of SBSs to significantly lower the energy consumption without compromising the quality of service. In particular, we formulate the SBS on/off switching problem into a Markov Decision Process that can be solved by Actor Critic (AC) reinforcement learning methods. To avoid prohibitively high computational and storage costs of conventional tabular-based approaches, we propose to use deep neural networks to approximate the policy and value functions in the AC approach. Moreover, to expedite the training process, we adopt a Deep Deterministic Policy Gradient (DDPG) approach together with a novel action refinement scheme. Through extensive numerical simulations, we show that the proposed scheme greatly outperforms the existing methods in terms of both energy efficiency and computational efficiency. We also show that the proposed scheme can scale to large system with polynomial complexities in both storage and computation.

研究动机与目标

  • 解决异构网络(HetNets)中密集部署的小型基站(SBS)在高峰时段外的高能耗问题。
  • 克服现有基站休眠/激活方法的局限性,包括对模型的依赖、计算成本高以及可扩展性差。
  • 开发一种可扩展的、数据驱动的方法,可在长时间尺度上运行,并在无需系统模型先验知识的前提下,适应动态的业务量和信道条件。
  • 通过联合优化 SBS 激活、切换成本和服务时延,在保持服务质量的同时实现高能量效率。

提出的方法

  • 将 SBS 开关调度问题建模为马尔可夫决策过程(MDP),以能耗和业务质量作为目标函数。
  • 采用深度演员-评论家框架,其中深度神经网络(DNN)用于近似策略(演员)和价值函数(评论家),以处理连续的状态和动作空间。
  • 使用深度确定性策略梯度(DDPG)算法,通过离策略经验回放和目标网络端到端训练 DNN。
  • 引入成本估计网络(CEN)以基于状态-动作对预测动作成本,从而实现更智能的探索。
  • 设计一种新颖的动作优化方案,结合成本贪婪与 ε-贪婪探索,以加速学习并提升收敛性。
  • 使用独立的 DNN 预测业务到达速率,利用 SBS 业务中的时间与空间相关性,改善状态表示。

实验结果

研究问题

  • RQ1基于深度强化学习的方法是否能通过仅动态激活必要的 SBS,有效降低 HetNets 中的能量消耗?
  • RQ2与基于表格的强化学习方法相比,所提出的 DRAG 算法在可扩展性和计算复杂度方面表现如何?
  • RQ3引入成本估计网络(CEN)在多大程度上提升了学习效率和策略收敛性?
  • RQ4随着 SBS 数量的增加,DRAG 在存储和计算复杂度方面的扩展行为如何?
  • RQ5在不同业务条件(包括平稳与非平稳业务轨迹)下,该算法的性能表现如何?

主要发现

  • DRAG 在能量效率和计算效率方面显著优于现有基于学习的方法,收敛速度更快,且在平稳与变化的业务场景下均表现更优。
  • 所提出的成本贪婪与混合(ε-成本贪婪)探索策略显著加速了学习过程,仅需约 50 天即可实现准确的成本估计,而基于 Q 值的方法则需 300 天。
  • 收敛所需的网络规模(RNS)几乎随 SBS 数量($B_s$)线性增长,表明其复杂度为 $O(B_s)$,相较于表格方法的 $O(2^{B_s})$ 复杂度有质的飞跃。
  • 增加网络深度可降低收敛所需的宽度——例如,当 $B_s = 30$ 时,收敛比例因子从两层网络的 0.5 降低至三层网络的 0.4,表明更深的网络可提升样本效率。
  • 该算法在存储和计算方面均实现了多项式复杂度,具备可扩展性能,适用于大规模 HetNets 的部署。
  • 基于 DNN 的策略近似实现了无模型、数据驱动的动态网络条件适应,无需预先知晓业务或信道统计特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。