Skip to main content
QUICK REVIEW

[论文解读] IRS-Assisted Ambient Backscatter Communications Utilizing Deep Reinforcement Learning

Xiaolun Jia, Xiangyun Zhou|arXiv (Cornell University)|Mar 12, 2021
Advanced Wireless Communication Technologies参考文献 21被引用 6
一句话总结

该论文提出了一种基于深度强化学习(DRL)的框架,用于在无先验信道状态信息(CSI)的情况下,优化环境背散射通信(AmBC)中智能反射面(IRS)的相位偏移和读取器波束成形。采用改进的深度确定性策略梯度(DDPG)算法,结合逐集训练与零折扣因子,该方法在检测性能上达到全CSI基准的90%以上,证明了在未知环境信号和动态衰落条件下的有效运行。

ABSTRACT

We consider an ambient backscatter communication (AmBC) system aided by an intelligent reflecting surface (IRS). The optimization of the IRS to assist AmBC is extremely difficult when there is no prior channel knowledge, for which no design solutions are currently available. We utilize a deep reinforcement learning-based framework to jointly optimize the IRS and reader beamforming, with no knowledge of the channels or ambient signal. We show that the proposed framework can facilitate effective AmBC communication with a detection performance comparable to several benchmarks under full channel knowledge.

研究动机与目标

  • 解决由于环境信号未知和缺乏CSI而导致的环境背散射通信(AmBC)中严重直射链路干扰(DLI)的挑战。
  • 克服在全信道状态信息(CSI)不可用时,优化AmBC系统中IRS相位偏移的困难。
  • 设计一种仅基于观测信号样本运行的学习框架,无需了解环境信号功率或信道系数。
  • 实现在被动标签和未知源导致CSI获取不可行的现实室内环境中,有效实现IRS辅助的AmBC。
  • 在缺乏信道知识和时变环境信号的条件下,实现与全CSI基准相当的性能。

提出的方法

  • 采用适用于无CSI部分可观察环境的深度确定性策略梯度(DDPG)算法。
  • 使用零折扣因子(γ = 0)的逐集训练,以处理因未知环境信号和衰落导致的时间变化奖励函数。
  • 基于瞬时信干噪比(SINR)制定奖励函数,以反映实时检测性能。
  • 利用非IRS情况下的最优特征向量合并器初始化DRL策略,以改善探索和收敛性。
  • 使用来自源信号和反向散射数据的观测信号样本,联合更新IRS相位偏移和波束成形权重,训练演员-评论家网络。
  • 在读取器端应用线性合并,采用单位范数波束成形向量g,以实现对反向散射符号的能量检测。

实验结果

研究问题

  • RQ1当无CSI时,基于DRL的框架是否能在AmBC系统中实现有效的IRS和波束成形优化?
  • RQ2无CSI的DRL框架在检测可靠性方面与全CSI基准相比表现如何?
  • RQ3训练时长和回合长度对DRL框架收敛性和性能有何影响?
  • RQ4在无CSI条件下,IRS反射单元数量对系统检测性能有何影响?
  • RQ5该DRL框架能否在无需显式信道估计的情况下,适应具有时间相关特性的信道和变化的环境信号功率?

主要发现

  • 所提出的DRL框架在所有IRS尺寸下,中位数广义速率容量差(GRCD)均在最佳全CSI基准(含IRS的特征向量合并器)的25%以内。
  • 对于具有N = 64个反射单元的IRS,误码率(BER)相比最佳非IRS基准提升了整整一个数量级。
  • 训练符号持续时间L_t = 100提供了合理的权衡,可在该点后获得递减收益,实现准确的信道协方差估计。
  • 更长的训练阶段(T_1)可提升GRCD性能,T_1 = 0时性能极差,表明在无CSI条件下随机探索的必要性。
  • 由于采用逐集训练和零折扣因子,该框架在不同信道实现下均保持稳定性能,可有效应对每轮奖励函数的变化。
  • 将非IRS情况下最优特征向量合并器作为初始化,显著提升了DRL过程中的探索效率和收敛速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。