Skip to main content
QUICK REVIEW

[论文解读] Intelligent User Association for Symbiotic Radio Networks using Deep Reinforcement Learning

Qianqian Zhang, Ying‐Chang Liang|arXiv (Cornell University)|May 10, 2019
Advanced MIMO Systems Optimization参考文献 32被引用 9
一句话总结

本文提出两种深度强化学习(DRL)算法——集中式与分布式——用于在共生无线电网络(SRN)中实现智能用户关联,利用环境反向散射通信(AmBC)。通过利用历史信道数据推断实时信道状态,DRL智能体在无需完整实时信道状态信息(CSI)的情况下,实现了物联网(IoT)设备的近似最优和速率,其中分布式DRL在具有不同数量IoT设备的动态环境中表现出更优的可扩展性。

ABSTRACT

In this paper, we are interested in symbiotic radio networks, in which an Internet-of-Things (IoT) network parasitizes in a primary network to achieve spectrum-, energy-, and infrastructure-efficient communications. Specifically, the BS serves multiple cellular users using time division multiple access (TDMA) and each IoT device is associated with one cellular user for information transmission. We focus on the user association problem, whose objective is to link each IoT device to an appropriate cellular user by maximizing the sum rate of all IoT devices. However, the difficulty in obtaining the full real-time channel information makes it difficult to design an optimal policy for this problem. To overcome this issue, we propose two deep reinforcement learning (DRL) algorithms, both use the historical information to infer the current information in order to make appropriate decisions. One algorithm, centralized DRL, makes decisions for all IoT devices at one time with global information. The other algorithm, distributed DRL, makes a decision only for one IoT device at one time using local information. Finally, simulation results show that the two DRL algorithms achieve comparable performance as the optimal user association policy which requires perfect real-time information, and the distributed DRL algorithm has the advantage of scalability.

研究动机与目标

  • 解决在共生无线电网络(SRN)中用户关联的挑战,其中物联网(IoT)设备通过主网络基站(BS)的信号进行反向散射通信。
  • 克服为实现最优用户关联而获取完整实时信道状态信息(CSI)的不切实际性。
  • 设计可扩展且高效的基于DRL的用户关联算法,利用历史CSI推断当前信道状态。
  • 在时分多址(TDMA)与逐次干扰消除(SIC)约束下,最大化所有IoT设备的和速率。
  • 评估所提DRL算法在准静态与高度动态衰落环境下的性能与可扩展性。

提出的方法

  • 提出一种集中式DRL算法,利用全局状态信息(所有IoT设备与蜂窝用户CSI)联合决策所有IoT设备的关联。
  • 开发一种分布式DRL算法,每个IoT设备基于本地CSI与历史数据独立做出关联决策,提升可扩展性。
  • 采用具有经验回放与目标网络的深度Q网络(DQN)以稳定训练并提升策略学习效果。
  • 使用过去200帧的移动平均值对性能进行平滑评估,确保在动态环境中稳定收敛。
  • 将信道建模为大尺度衰落(缓慢变化)与小尺度衰落(快速衰落,相关系数ρ)的组合,其中ρ=0.5与ρ=0分别代表中等与高动态信道。
  • 设计基于所有IoT设备和速率的奖励函数,以指导DRL框架中的策略优化。

实验结果

研究问题

  • RQ1基于DRL的用户关联是否能在无需完整实时CSI的情况下实现SRN中的近似最优和速率?
  • RQ2在CSI反馈受限的动态信道条件下,集中式与分布式DRL的性能表现如何比较?
  • RQ3历史信道信息在多大程度上可弥补用户关联决策中实时CSI的缺失?
  • RQ4当IoT设备数量动态变化时,分布式DRL算法的可扩展性表现如何?
  • RQ5在信道相关性变化时(ρ=0.5 vs. ρ=0),所提DRL算法与最优策略之间的性能差距如何?

主要发现

  • 集中式与分布式DRL算法在和速率上均接近需要完美实时CSI的最优策略,尤其在准静态衰落(ρ=0.5)条件下表现优异。
  • 在高度动态信道(ρ=0)中,两种DRL算法仍能接近最优策略,表明其通过学习大尺度衰落模式具备鲁棒性,即使小尺度衰落呈现无相关性。
  • 当IoT设备数量变化时,分布式DRL算法仍保持高性能与可扩展性,优于随机关联策略,并在集中式DRL因动作空间指数级增长而不可行时仍具有效性。
  • 当M=N=8时,分布式DRL的平均和速率达到1.1 bits/frame/Hz,显著优于随机策略(0.6 bits/frame/Hz)。
  • 在高动态场景(ρ=0)中,DRL与最优策略之间的性能差距略有增加,主要由于从历史数据中预测无相关性小尺度衰落存在困难。
  • 结果表明,分布式DRL算法在大规模网络中具备可扩展性与有效性,适用于动态IoT环境的实际部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。