QUICK REVIEW
[论文解读] On the Robustness of Deep Reinforcement Learning in IRS-Aided Wireless Communications Systems
Amal Feriani, Amine Mezghani|arXiv (Cornell University)|Jul 17, 2021
Advanced Wireless Communication Technologies被引用 5
一句话总结
本文评估了深度强化学习(DRL)在智能反射面(IRS)辅助的MISO下行链路系统中优化相移的性能,与传统方法(如VAMP和ADMM)进行对比。DRL在信道状态信息(CSI)误差和用户移动性方面表现出更优的鲁棒性,即使在存在噪声和距离变化的情况下,仍能保持稳定的信噪比(SNR)性能,而传统方法则显著退化。
ABSTRACT
We consider an Intelligent Reflecting Surface (IRS)-aided multiple-input single-output (MISO) system for downlink transmission. We compare the performance of Deep Reinforcement Learning (DRL) and conventional optimization methods in finding optimal phase shifts of the IRS elements to maximize the user signal-to-noise (SNR) ratio. Furthermore, we evaluate the robustness of these methods to channel impairments and changes in the system. We demonstrate numerically that DRL solutions show more robustness to noisy channels and user mobility.
研究动机与目标
- 评估DRL在IRS辅助无线通信系统中对抗信道损伤和系统动态变化的鲁棒性。
- 在CSI不完美和用户移动性条件下,将DRL性能与传统优化方法(VAMP和ADMM)进行基准对比。
- 评估DRL是否能在不依赖完美CSI的情况下维持高性能,从而在实际应用中优于传统方法。
- 量化在扰动条件下推理速度和SNR退化程度,突出DRL在实时应用中的优势。
- 在CSI存在噪声或过时时的真实场景中,对DRL的鲁棒性进行实际评估。
提出的方法
- 使用马尔可夫决策过程(MDP)框架训练DRL智能体,通过基于用户SNR的奖励函数来优化IRS相移。
- DRL智能体在推理过程中无需显式信道状态信息,端到端学习策略。
- 通过最大比率传输(MRT)计算波束成形向量,相移矩阵保持固定。
- 通过随机模型评估性能:$\mathbf{H}[t] = \sqrt{\epsilon}\mathbf{H}[t-1] + \sqrt{1-\epsilon}\mathbf{w}[t]$,其中$\mathbf{w}[t]$为i.i.d. CN(0,1)。
- 通过将基站与用户间距离以5–25 m为步长逐步增加来模拟用户移动性,使用先前计算出的最优相移矩阵测量SNR。
- 在1000次实现中测量推理时间,以对比DRL与迭代方法(VAMP和ADMM)的速度。
实验结果
研究问题
- RQ1在完美CSI条件下,DRL在SNR方面与VAMP和ADMM相比表现如何?
- RQ2在CSI存在噪声或不完美时,DRL如何保持性能,与VAMP和ADMM相比表现如何?
- RQ3用户移动性对DRL与传统优化方法SNR性能的影响是什么?
- RQ4DRL的推理速度与VAMP和ADMM等迭代优化算法相比如何?
- RQ5在信道扰动下,DRL的性能退化程度如何,与依赖CSI的方法相比有何差异?
主要发现
- 在完美CSI条件下,VAMP达到最高SNR,其次为ADMM和DRL,但DRL在无需CSI的情况下已接近最优性能。
- 在高阶CSI噪声($\epsilon = 0.9$)下,VAMP的SNR下降超过16 dB,而DRL的下降仅约3 dB。
- ADMM在CSI误差下表现出显著性能损失,尽管在完美CSI下性能优于DRL,但其鲁棒性不及DRL。
- 当用户距离增加至25 m时,DRL的SNR几乎保持不变,而VAMP和ADMM的性能急剧下降。
- DRL的推理时间在256个IRS单元下仍稳定低于0.7 ms,而VAMP和ADMM耗时超过100 ms,凸显DRL在实时应用中的优势。
- DRL训练曲线显示,随着IRS单元数增加,奖励持续提升,但每增加一个单元带来的SNR增益逐渐减小,表明存在收益递减现象。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。