[论文解读] Multi-Agent Deep Reinforcement Learning based Spectrum Allocation for D2D Underlay Communications
该论文提出了一种多智能体深度强化学习框架 MAAC,用于设备到设备(D2D)通信中的分布式频谱分配,使 D2D 用户在无需实时信令的情况下实现协作。该方法实现了蜂窝链路的低中断概率和 D2D 链路的高总速率,其可扩展变体 NAAC 进一步降低了训练复杂度并具备出色的泛化能力。
Device-to-device (D2D) communication underlay cellular networks is a promising technique to improve spectrum efficiency. In this situation, D2D transmission may cause severe interference to both the cellular and other D2D links, which imposes a great technical challenge to spectrum allocation. Existing centralized schemes require global information, which causes a large signaling overhead. While existing distributed schemes requires frequent information exchange among D2D users and cannot achieve global optimization. In this paper, a distributed spectrum allocation framework based on multi-agent deep reinforcement learning is proposed, named multi-agent actor critic (MAAC). MAAC shares global historical states, actions and policies during centralized training, requires no signal interaction during execution and utilizes cooperation among users to further optimize system performance. Moreover, in order to decrease the computing complexity of the training, we further propose the neighbor-agent actor critic (NAAC) based on the neighbor users' historical information for centralized training. The simulation results show that the proposed MAAC and NAAC can effectively reduce the outage probability of cellular links, greatly improve the sum rate of D2D links and converge quickly.
研究动机与目标
- 解决 D2D 重用蜂窝频谱时产生的干扰挑战。
- 克服集中式方案(高信令开销)和分布式方案(频繁信息交换)在密集、动态网络中的局限性。
- 设计一种分布式频谱分配框架,使 D2D 用户在无需实时信令的情况下实现协作。
- 通过集中式训练与分布式执行,降低训练复杂度,同时保持高性能系统表现。
- 在动态、用户密集的环境中,确保蜂窝链路的可靠性,同时最大化 D2D 总速率。
提出的方法
- 提出 MAAC(多智能体演员-critic),一种基于全局历史状态、动作和策略的集中式训练与分布式执行框架,以实现 D2D 智能体之间的协作。
- 提出 NAAC(邻近智能体演员-critic),一种可扩展的变体,仅在训练期间使用固定数量邻近 D2D 用户的历史数据,以降低计算负载。
- 在多智能体强化学习框架中采用深度 Q 网络和策略梯度方法,以学习最优频谱分配策略。
- 设计一种奖励函数,平衡蜂窝链路中断概率与 D2D 总速率,使学习过程与系统目标对齐。
- 使用所有或邻近智能体的历史数据进行集中式策略训练,随后在分布式执行模式下部署。
- 在智能体之间采用参数共享机制,以提升多智能体场景下的样本效率和泛化能力。
实验结果
研究问题
- RQ1多智能体深度强化学习框架是否能在无需全局实时信令的情况下,有效降低干扰并提升 D2D 重叠通信中的频谱效率?
- RQ2在集中式训练中使用全局历史数据,对分布式频谱分配的性能和收敛性有何影响?
- RQ3基于邻近信息聚合的策略(NAAC)在多大程度上可降低训练复杂度,同时保持系统性能?
- RQ4在训练期间考虑的邻近用户数量(λ)如何影响蜂窝链路和 D2D 链路的中断概率与总速率?
- RQ5所提出的框架是否能在蜂窝链路可靠性与 D2D 吞吐量之间实现优于现有集中式与分布式方案的权衡?
主要发现
- 与现有方法相比,MAAC 显著降低了蜂窝链路的中断概率,并大幅提升了 D2D 链路的总速率。
- 当 λ(考虑的邻居数量)足够大时,NAAC 的性能可与 MAAC 相当;在 λ=2 时,蜂窝总速率低约 2 bit/s/Hz,但随着 λ 增大,性能逐渐趋近于 MAAC。
- 在 λ 较小时,NAAC 的 D2D 总速率高于 MAAC,但随着 λ 增大,由于对蜂窝链路约束的严格实施,该速率下降。
- 随着 λ 增大,NAAC 的性能趋近于 MAAC,表明引入更多邻居历史信息可提升策略的鲁棒性与可靠性。
- MAAC 和 NAAC 均能快速收敛,且在频谱效率和可靠性方面优于传统集中式与分布式方案。
- 所提出的框架非常适合用于密集、动态的网络环境(如车载网络),具备低信令开销和高可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。