[论文解读] A Multi-Agent Deep Reinforcement Learning based Spectrum Allocation Framework for D2D Communications
本文提出NAAC,一种用于D2D通信中分布式频谱分配的多智能体深度强化学习框架。在集中式训练过程中利用邻近用户的过往状态与动作,执行阶段无需实时信令,NAAC可降低蜂窝网络中断概率,提升D2D总速率,并实现稳定收敛——在可靠性与频谱效率方面优于Q-learning、DQN、AC和SLA。
Device-to-device (D2D) communication has been recognized as a promising technique to improve spectrum efficiency. However, D2D transmission as an underlay causes severe interference, which imposes a technical challenge to spectrum allocation. Existing centralized schemes require global information, which can cause serious signaling overhead. While existing distributed solution requires frequent information exchange between users and cannot achieve global optimization. In this paper, a distributed spectrum allocation framework based on multi-agent deep reinforcement learning is proposed, named Neighbor-Agent Actor Critic (NAAC). NAAC uses neighbor users' historical information for centralized training but is executed distributedly without that information, which not only has no signal interaction during execution, but also utilizes cooperation between users to further optimize system performance. The simulation results show that the proposed framework can effectively reduce the outage probability of cellular links, improve the sum rate of D2D links and have good convergence.
研究动机与目标
- 解决D2D共用通信中因频谱复用导致蜂窝链路可靠性下降的干扰挑战。
- 克服集中式方案因需全局信息而带来的高信令与计算开销的局限性。
- 缓解依赖D2D对之间频繁实时信息交换的分布式方案所导致的不稳定性与低效性。
- 在执行阶段无需信令交互的前提下,实现D2D对之间的协作式频谱分配,提升系统整体性能。
- 开发一种可扩展、低开销的解决方案,适用于密集、用户密集的5G网络。
提出的方法
- 将D2D频谱分配问题建模为部分可观测马尔可夫博弈,以反映多智能体、非平稳的环境特性。
- 提出NAAC(邻居智能体演员-critic),一种集中式训练与分布式执行(CTDE)框架,利用训练期间邻近D2D对的历史状态与动作。
- 将邻居信息整合至评论家网络,以稳定训练过程并实现智能体间的协作策略学习。
- 采用基于深度确定性策略梯度(DDPG)的演员-评论家网络,以处理D2D资源分配任务中连续的状态与动作空间。
- 通过移除对实时邻居信息交换的需求,实现执行阶段的去中心化,降低信令开销并提升可扩展性。
- 在云端或基站环境中使用邻居历史数据训练框架,随后将策略本地部署于D2D设备上。
实验结果
研究问题
- RQ1如何利用多智能体深度强化学习实现在D2D共用网络中稳定且协作的频谱分配?
- RQ2在训练期间引入邻居用户信息在去中心化D2D环境中在多大程度上能提升系统性能与训练稳定性?
- RQ3与集中式或纯分布式方案相比,CTDE框架是否能在降低信令开销的同时保持或提升频谱效率与可靠性?
- RQ4在D2D对密度不断增加的情况下,NAAC相较于传统强化学习方法(Q-learning、DQN、AC、SLA)在收敛性、中断概率与总速率方面的表现如何?
- RQ5在密集D2D场景中,邻居协作对干扰管理与整体网络性能有何影响?
主要发现
- NAAC在训练期间获得最高的总奖励(较DQN高出最多1.8倍,较Q-learning高出最多2.5倍),表明其具备更优的策略学习能力与稳定性。
- 与Q-learning和DQN相比,蜂窝链路的中断概率降低了最多40%,证明其在干扰环境下的可靠性显著提升。
- 与基线方法相比,NAAC将D2D总速率提升了25%–35%,且随着D2D对数量的增加,性能增益进一步扩大。
- 由于评论家网络中引入了邻居信息,NAAC的收敛速度与稳定性优于Q-learning、DQN与AC,有效稳定了多智能体训练过程。
- 通过隐式协作实现全局优化,防止多个D2D对选择相同资源,从而降低累积干扰。
- 通过将训练(集中式,依赖邻居数据)与执行(去中心化,无需信令)解耦,NAAC显著降低了信令开销,并在大规模网络中表现出良好可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。