Skip to main content
QUICK REVIEW

[论文解读] GAN-powered Deep Distributional Reinforcement Learning for Resource Management in Network Slicing

Yuxiu Hua, Rongpeng Li|arXiv (Cornell University)|May 10, 2019
Software-Defined Networks and 5G参考文献 43被引用 11
一句话总结

本文提出了一种基于生成对抗网络的深度分布式强化学习方法(GAN-DDQN)及其改进版本Dueling GAN-DDQN,用于5G网络切片中的动态、需求感知资源管理。通过利用生成对抗网络建模动作价值分布,并结合奖励裁剪与双重网络结构,该方法显著提升了训练稳定性,增强了频谱效率与SLA满足率,仿真结果表明其性能优于经典DQN方法。

ABSTRACT

Network slicing is a key technology in 5G communications system. Its purpose is to dynamically and efficiently allocate resources for diversified services with distinct requirements over a common underlying physical infrastructure. Therein, demand-aware resource allocation is of significant importance to network slicing. In this paper, we consider a scenario that contains several slices in a radio access network with base stations that share the same physical resources (e.g., bandwidth or slots). We leverage deep reinforcement learning (DRL) to solve this problem by considering the varying service demands as the environment state and the allocated resources as the environment action. In order to reduce the effects of the annoying randomness and noise embedded in the received service level agreement (SLA) satisfaction ratio (SSR) and spectrum efficiency (SE), we primarily propose generative adversarial network-powered deep distributional Q network (GAN-DDQN) to learn the action-value distribution driven by minimizing the discrepancy between the estimated action-value distribution and the target action-value distribution. We put forward a reward-clipping mechanism to stabilize GAN-DDQN training against the effects of widely-spanning utility values. Moreover, we further develop Dueling GAN-DDQN, which uses a specially designed dueling generator, to learn the action-value distribution by estimating the state-value distribution and the action advantage function. Finally, we verify the performance of the proposed GAN-DDQN and Dueling GAN-DDQN algorithms through extensive simulations.

研究动机与目标

  • 解决5G网络切片中因服务需求动态变化而带来的动态、需求感知无线资源分配挑战。
  • 降低强化学习训练过程中SLA满足率(SSR)与频谱效率(SE)因噪声与随机性带来的影响。
  • 通过将生成对抗网络与分布式Q学习相结合,提升深度强化学习在网络切片任务中的训练稳定性与学习效率。
  • 通过双分支生成器结构解耦状态价值函数与动作优势函数,增强表征学习能力。

提出的方法

  • 提出GAN-DDQN,利用生成对抗网络通过最小化估计分布与目标分布之间的差异,建模动作价值分布。
  • 采用带梯度惩罚的Wasserstein GAN(WGAN-GP)以稳定训练过程,提升价值网络中分布近似的准确性。
  • 引入奖励裁剪机制,缓解强化学习环境中因奖励值波动过大导致的训练不稳定性。
  • 在Dueling GAN-DDQN中设计双分支生成器结构,分别估计状态价值分布与动作优势函数,提升训练稳定性。
  • 结合分布式强化学习与基于GAN的价值估计,捕捉动作价值分布更丰富的统计特性。
  • 通过梯度向量场分析,证明在特定条件下,基于GAN的训练目标具有收敛性。

实验结果

研究问题

  • RQ1基于GAN的方法是否能有效建模网络切片深度强化学习中的动作价值分布,从而降低噪声与随机奖励的影响?
  • RQ2奖励裁剪机制如何提升高方差奖励环境下GAN驱动的DRL在资源分配任务中的训练稳定性?
  • RQ3在分布式Q学习中,将双分支结构集成到GAN生成器是否能提升网络切片任务中的学习效率与收敛性?
  • RQ4在动态业务流量需求下,GAN-DDQN相较于经典DQN在频谱效率与SLA满足率方面提升程度如何?
  • RQ5在分布式强化学习背景下,所提出的基于GAN的训练目标具有怎样的理论收敛行为?

主要发现

  • GAN-DDQN通过建模完整的动作价值分布,显著提升了训练稳定性与性能,降低了对SSR与SE测量中噪声的敏感性。
  • 奖励裁剪机制能有效缓解极端奖励值引发的训练不稳定性,实现更一致的学习进展。
  • Dueling GAN-DDQN通过解耦状态价值与动作优势函数,相比GAN-DDQN实现了更优性能,显著降低了固有训练方差。
  • 大量仿真结果表明,无论在动态服务需求下,GAN-DDQN与Dueling GAN-DDQN在频谱效率与SLA满足率方面均优于经典DQN。
  • 理论分析表明,在特定条件下,基于GAN的训练目标可收敛至最优分布,且振荡幅度受学习率与梯度惩罚超参数的约束。
  • 所提方法在非平稳流量与多指标约束条件下仍表现出优越性能,表明其具备强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。