[论文解读] Learning Reflection Beamforming Codebooks for Arbitrary RIS and Non-Stationary Channels
该论文提出了一种基于深度强化学习(DRL)的框架,无需显式信道知识即可学习智能反射面(RIS)反射波束码本,采用多级学习方法以加速收敛并降低计算复杂度。该方法在任意RIS几何结构、分布式部署及非平稳信道条件下均表现出优越性能——仅使用6个波束即超越了256波束的DFT码本。
Reconfigurable intelligent surfaces (RIS) are expected to play an important role in future wireless communication systems. These surfaces typically rely on their reflection beamforming codebooks to reflect and focus the signal on the target receivers. Prior work has mainly considered pre-defined RIS beamsteering codebooks that do not adapt to the environment and hardware and lead to large beam training overhead. In this work, a novel deep reinforcement learning based framework is developed to efficiently construct the RIS reflection beam codebook. This framework adopts a multi-level design approach that transfers the learning between the multiple RIS subarrays, which speeds up the learning convergence and highly reduces the computational complexity for large RIS surfaces. The proposed approach is generic for co-located/distributed RIS surfaces with arbitrary array geometries and with stationary/non-stationary channels. Further, the developed solution does not require explicitly channel knowledge and adapts the codebook beams to the surrounding environment, user distribution, and hardware characteristics. Simulation results show that the proposed learning framework can learn optimized interaction codebooks within reasonable iterations. Besides, with only 6 beams, the learned codebook outperforms a 256-beam DFT codebook, which significantly reduces the beam training overhead.
研究动机与目标
- 解决传统RIS波束成形码本依赖预定义、非自适应设计(如DFT)所导致的高波束训练开销与缺乏适应性问题。
- 应对大规模RIS系统中因空间分离导致的阵列几何未知、分布式部署及非平稳信道带来的挑战。
- 设计一种低复杂度、硬件感知的码本,仅依赖接收功率测量,无需显式信道状态信息。
- 通过多级、逐级学习与合并框架,实现对大尺寸RIS表面的高效学习收敛,实现子阵列间知识迁移。
提出的方法
- 采用深度强化学习(DRL)框架,仅使用接收功率测量作为唯一反馈信号,避免对显式信道估计的需求。
- 实施多级学习架构:首先学习子阵列的反射向量,然后在更高级别相干合并以形成最终波束成形向量。
- 通过子阵列间参数迁移(例如,使用预训练子阵列的模型权重初始化)加速收敛并减少训练时间。
- 通过在DRL动作空间中直接集成量化相位控制,考虑实际RIS硬件约束(如4比特移相器)。
- 采用分层学习策略:对于分布式RIS,首先对每个表面的子阵列进行训练,然后合并表面级响应,最后在所有表面间相干合并。
- 将波束成形增益最大化问题建模为马尔可夫决策过程,DRL智能体通过基于接收功率导出的奖励信号,基于试错法学习最优反射向量。
实验结果
研究问题
- RQ1DRL框架是否能够在无需显式信道状态信息或阵列几何先验知识的情况下,学习到有效的RIS反射波束码本?
- RQ2所提出的多级学习框架在大规模RIS系统中如何降低收敛时间与计算复杂度?
- RQ3所学习的码本在波束成形增益与训练开销方面,相较于传统DFT码本能实现多大程度的性能提升?
- RQ4该框架是否能够适应因空间分离的子孔径导致的分布式RIS部署所引发的非平稳信道条件?
- RQ5子阵列间的参数迁移在加速大规模RIS表面学习过程方面有多高效?
主要发现
- 所提出的DRL框架学习到的16波束码本,其平均波束成形增益比256波束DFT码本高出40%以上,同时将波束训练开销降低至仅6.25%。
- 仅使用6个波束,所学习的码本在波束成形增益上即超越256波束DFT码本,显著降低了训练开销。
- 多级学习框架通过参数迁移降低了收敛时间:在使用预训练模型初始化后,子阵列可被快速训练。
- 对于具有非平稳信道的分布式RIS系统,三级学习模型在少于100次迭代内即达到近似最优性能——与需要65,536次迭代的穷举搜索相当。
- 该框架成功适应任意RIS几何结构,包括共址与分布式配置,并考虑了4比特移相器等硬件约束。
- 该方法无需显式信道知识,仅依赖接收功率测量,从而在实际部署中降低了同步与估计开销。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。