[论文解读] Strategies for High-Throughput FPGA-based QC-LDPC Decoder Architecture
该论文提出了一种高吞吐量、可扩展且可重构的基于FPGA的QC-LDPC译码器架构,采用一种新颖的校验矩阵(PCM)紧凑表示方法和算法流水线技术,实现了多倍吞吐量增益。通过将节点处理拆分并把PCM划分为层和超层,该方法在不增加硬件资源的情况下实现了高效流水线处理,从而在Xilinx Kintex-7 FPGA上以260 MHz主频实现了608 Mb/s的吞吐量,且通过高层次综合(HLS)自动生成HDL代码。
We propose without loss of generality strategies to achieve a high-throughput FPGA-based architecture for a QC-LDPC code based on a circulant-1 identity matrix construction. We present a novel representation of the parity-check matrix (PCM) providing a multi-fold throughput gain. Splitting of the node processing algorithm enables us to achieve pipelining of blocks and hence layers. By partitioning the PCM into not only layers but superlayers we derive an upper bound on the pipelining depth for the compact representation. To validate the architecture, a decoder for the IEEE 802.11n (2012) QC-LDPC is implemented on the Xilinx Kintex-7 FPGA with the help of the FPGA IP compiler [2] available in the NI LabVIEW Communication System Design Suite (CSDS) which offers an automated and systematic compilation flow where an optimized hardware implementation from the LDPC algorithm was generated in approximately 3 minutes, achieving an overall throughput of 608Mb/s (at 260MHz). As per our knowledge this is the fastest implementation of the IEEE 802.11n QC-LDPC decoder using an algorithmic compiler.
研究动机与目标
- 设计一种适用于5G及后4G系统的高吞吐量、可扩展且可重构的基于FPGA的QC-LDPC译码器架构。
- 通过自动化高层次综合(HLS)实现快速原型设计,克服ASIC设计的局限性。
- 通过新颖的紧凑PCM表示方法和分层译码的高效流水线处理,实现显著的吞吐量增益。
- 通过在FPGA上实现符合标准的IEEE 802.11n(2012)QC-LDPC码,验证该架构的可行性。
- 通过并行使用多个核心,实现超过2 Gb/s的吞吐量,展示架构的可扩展性与高效性。
提出的方法
- 提出一种新颖的QC-LDPC校验矩阵(PCM)紧凑表示方法,通过减少冗余计算和提升数据局部性,实现多倍吞吐量提升。
- 将节点处理算法拆分,以支持块级和层级操作的流水线处理,实现在不增加硬件资源使用的情况下并发处理。
- 将PCM划分为层和超层,以推导出可实现流水线深度的上限,从而在资源受限条件下优化吞吐量。
- 采用固定点算术的缩放最小和算法(MSA)进行译码,输入LLR为6位符号小数,消息更新使用4位小数。
- 整个译码器使用LabVIEW CSDS™ FPGA IP编译器实现,该工具可自动从高层次图形化数据流描述在约3分钟内生成优化后的VHDL代码。
- 设计在Xilinx Kintex-7 FPGA上使用Vivado进行综合与实现,测量了1x和2x流水线版本的资源使用情况与性能表现。
实验结果
研究问题
- RQ1紧凑的PCM表示方法如何在不增加硬件复杂度的前提下提升FPGA-QC-LDPC译码器的吞吐量?
- RQ2在使用紧凑PCM表示时,分层QC-LDPC译码器可实现的最大流水线深度是多少?
- RQ3块处理与层处理的算法流水线是否可在不增加硬件资源的前提下实现高吞吐量?
- RQ4与现有最先进的FPGA实现相比,HLS生成的FPGA译码器在吞吐量与资源效率方面表现如何?
- RQ5所提出的架构在多核并行化下,能在多大程度上实现多Gb/s级的译码吞吐量?
主要发现
- 所提出的紧凑PCM表示方法通过优化数据访问与减少冗余计算,实现了译码吞吐量的多倍提升。
- 2x流水线版本在Xilinx Kintex-7 FPGA上以260 MHz主频实现了608 Mb/s吞吐量,相比1x版本提升1.7倍,效率达0.86。
- 资源利用率保持高效:2x版本使用了5.3%的DSP48s、8.2%的LUTs、6.4%的BRAMs和5.3%的触发器,总切片使用量仅比1x版本增加3.8%。
- 固定点实现经过8次迭代后,误比特率(BER)性能与浮点版本相差不超过0.5 dB,证明了在降低精度下仍能实现接近最优的性能。
- FPGA IP编译器在约3分钟内完成了完整HDL代码的生成,验证了自动化HLS在LDPC译码复杂信号处理中的可行性与快速原型能力。
- 通过使用五个并行译码核心的可扩展实现,在同一FPGA平台上实现了2.06 Gb/s的吞吐量,充分展示了该架构在高吞吐量应用中的强大可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。