[论文解读] Reinforcement Learning of Beam Codebooks in Millimeter Wave and Terahertz MIMO Systems
本文提出一种深度强化学习(DRL)框架,仅通过接收信号功率测量,无需信道状态信息、阵列几何结构或用户位置信息,即可自主优化毫米波/太赫兹MIMO系统中的波束码本。该方法学习到与环境和硬件特性相关的波束波形,例如在非视 Line-of-Sight(NLOS)场景下的多瓣波束,或在相位失配情况下的畸变补偿波束,实现接近最优的性能,同时显著降低了传统码本的波束训练开销。
Millimeter wave (mmWave) and terahertz MIMO systems rely on pre-defined beamforming codebooks for both initial access and data transmission. Being pre-defined, however, these codebooks are commonly not optimized for specific environments, user distributions, and/or possible hardware impairments. This leads to large codebook sizes with high beam training overhead which increases the initial access/tracking latency and makes it hard for these systems to support highly mobile applications. To overcome these limitations, this paper develops a deep reinforcement learning framework that learns how to iteratively optimize the codebook beam patterns (shapes) relying only on the receive power measurements and without requiring any explicit channel knowledge. The developed model learns how to autonomously adapt the beam patterns to best match the surrounding environment, user distribution, hardware impairments, and array geometry. Further, this approach does not require any knowledge about the channel, array geometry, RF hardware, or user positions. To reduce the learning time, the proposed model designs a novel Wolpertinger-variant architecture that is capable of efficiently searching for an optimal policy in a large discrete action space, which is important for large antenna arrays with quantized phase shifters. This complex-valued neural network architecture design respects the practical RF hardware constraints such as the constant-modulus and quantized phase shifter constraints. Simulation results based on the publicly available DeepMIMO dataset confirm the ability of the developed framework to learn near-optimal beam patterns for both line-of-sight (LOS) and non-LOS scenarios and for arrays with hardware impairments without requiring any channel knowledge.
研究动机与目标
- 解决毫米波/太赫兹MIMO系统中传统预定义波束码本存在的高波束训练开销和次优性能问题。
- 克服固定单瓣波束波形无法适应非视 Line-of-Sight(NLOS)传播或硬件损伤的局限性。
- 开发一种无需显式信道状态信息、用户位置知识或阵列几何结构假设的学习框架。
- 在量化相移器和相位失配等实际硬件约束下,实现鲁棒的波束码本学习。
- 降低大规模阵列在相位量化情况下的学习时间与搜索复杂度,此类场景通常具有大规模离散动作空间。
提出的方法
- 采用深度强化学习(DRL)框架,仅以接收信号功率作为唯一奖励信号,训练波束波形策略。
- 引入一种新型Wolpertinger变体神经网络架构,高效搜索由量化相移器引起的大型离散动作空间。
- 设计一种复值神经网络,满足实际射频约束,包括恒包络特性和量化相移器限制。
- 实施聚类-分配策略,在无需用户位置知识或训练期间稳定性假设的前提下,学习波束码本。
- 采用基于策略梯度的训练目标,优化波束成形向量,以在多样化传播环境中最大化接收功率。
- 将学习到的波束波形投影到干净和受损的角域空间,以验证对硬件损伤的适应能力。
实验结果
研究问题
- RQ1基于DRL的方法是否能在不依赖显式信道状态信息的前提下,学习到毫米波/太赫兹MIMO系统中的最优波束码本?
- RQ2DRL框架在非视 Line-of-Sight(NLOS)环境(如存在墙体反射时)下,其波束波形适应能力如何?
- RQ3所学习的码本在多大程度上能补偿相位失配和阵元间距误差等硬件损伤?
- RQ4与传统大型波束码本相比,DRL框架是否可通过学习紧凑、环境感知的码本,降低波束训练开销?
- RQ5在具备完整信道知识的理想条件下,所学习码本的性能与无约束波束成形相比如何?
主要发现
- 所提出的DRL框架在NLOS场景中学习到多瓣波束波形,通过捕获多条反射路径的能量,其性能优于传统单瓣波束成形码本。
- 在NLOS环境中,所学习的16波束码本因有效利用多径分量,其平均波束成形增益高于传统波束成形码本。
- 在相位失配标准差达0.3λ的情况下,DRL学习的码本保持稳定性能,仅出现轻微波动,而传统32波束码本性能显著下降。
- 所学习的波束在干净角域中呈现畸变,但在受损角域中则变得高度聚焦,证实了对硬件损伤的有效补偿。
- DRL学习的码本实现的波束成形增益接近理想无约束波束成形向量(在完整信道知识下)的性能,表明其接近最优性能。
- 该框架通过使用更少波束(如8–16个)实现更低的波束训练开销,且在具有挑战性的传播与硬件条件下,性能优于更大的传统码本(如32波束),表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。