Skip to main content
QUICK REVIEW

[论文解读] Learning to Decode: Reinforcement Learning for Decoding of Sparse Graph-Based Channel Codes

Salman Habib, Allison Beemer|arXiv (Cornell University)|Oct 12, 2020
Error Correcting Code Techniques被引用 5
一句话总结

本文提出一种基于强化学习(RL)的译码框架,用于短至中等长度的LDPC码,采用Q-learning优化置信传播(BP)译码中的校验节点(CN)调度。通过将CN选择建模为多臂赌博机问题,并利用图结构诱导聚类以降低状态空间复杂度,该方法在误比特率(BER)性能方面表现更优,且消息传递复杂度显著低于洪水法、MGI和节点级调度(NS)方案。

ABSTRACT

We show in this work that reinforcement learning can be successfully applied to decoding short to moderate length sparse graph-based channel codes. Specifically, we focus on low-density parity check (LDPC) codes, which for example have been standardized in the context of 5G cellular communication systems due to their excellent error correcting performance. These codes are typically decoded via belief propagation iterative decoding on the corresponding bipartite (Tanner) graph of the code via flooding, i.e., all check and variable nodes in the Tanner graph are updated at once. In contrast, in this paper we utilize a sequential update policy which selects the optimum check node (CN) scheduling in order to improve decoding performance. In particular, we model the CN update process as a multi-armed bandit process with dependent arms and employ a Q-learning scheme for optimizing the CN scheduling policy. In order to reduce the learning complexity, we propose a novel graph-induced CN clustering approach to partition the state space in such a way that dependencies between clusters are minimized. Our results show that compared to other decoding approaches from the literature, the proposed reinforcement learning scheme not only significantly improves the decoding performance, but also reduces the decoding complexity dramatically once the scheduling policy is learned.

研究动机与目标

  • 解决传统置信传播在LDPC码中译码复杂度过高及收敛性能不佳的问题。
  • 利用强化学习提升短至中等长度LDPC码的译码性能。
  • 通过基于图结构的校验节点聚类,降低大状态空间中Q-learning的计算负担。
  • 开发一种可扩展、低复杂度的译码框架,优于现有迭代译码方案。
  • 实现无需实时残差计算的实时自适应调度,与节点级调度不同。

提出的方法

  • 将CN调度过程建模为马尔可夫决策过程(MDP),其中每个校验节点在多臂赌博机设置中被视为一个“臂”。
  • 应用Q-learning估计动作价值函数,选择能最大化收敛速度与译码性能的CN。
  • 提出一种图结构诱导的聚类方法,将校验节点划分为依赖性最小的簇,以降低状态空间维度。
  • 通过最大化簇内短环数量优化簇结构,提升学习效率与性能。
  • 利用学习到的最优调度策略指导置信传播中的消息传递,最小化总消息数。
  • 实现三种变体:MQC(最大化Q值计数)、MQR(最大化Q值奖励)和MQO(最优Q值策略),其中MQO表现最佳。

实验结果

研究问题

  • RQ1强化学习能否有效优化LDPC码置信传播中的校验节点调度?
  • RQ2如何降低Q-learning在实际LDPC译码中指数级增长的状态空间复杂度?
  • RQ3基于图结构的校验节点聚类是否能提升学习效率与译码性能?
  • RQ4基于强化学习的调度是否能在误比特率与消息传递复杂度方面优于传统洪水法与节点级调度?
  • RQ5是否可能在不进行实时残差计算的前提下实现调度,同时保持或提升性能?

主要发现

  • 所提出的基于强化学习的译码方案中,MQO变体在所有信噪比(SNR)水平下,对(3,6)-正则码与(3,7) AB-LDPC码均实现了最佳BER性能。
  • 在SNR为2.5 dB时,MQO将(3,6)-正则码的平均CN到变量节点(VN)消息数降低至163,(3,7) AB-LDPC码降低至208,优于洪水法与NS方案。
  • 与NS方案相比,基于强化学习的方法消除了实时残差计算需求,显著降低了消息传递复杂度。
  • 所提出的结合环最大化机制的图结构诱导聚类方法,提升了学习效率,并带来了优于非优化聚类的译码性能。
  • 在高SNR下,MQO方案相比洪水法平均减少35%的消息数,同时实现更低的BER。
  • 基于强化学习的框架实现了更快的收敛速度与更低的延迟译码,适用于低延迟通信系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。