Skip to main content
QUICK REVIEW

[论文解读] Hardware Architecture for List SC Decoding of Polar Codes

Alexios Balatsoukas‐Stimming, Alexandre J. Raymond|arXiv (Cornell University)|Mar 28, 2013
Error Correcting Code Techniques参考文献 8被引用 12
一句话总结

该论文提出了首个用于极化码列表逐次消除(SC)译码的VLSI硬件架构,通过复制指向中间似然值的指针而非直接复制似然值,消除了昂贵的似然值复制操作。该设计在UMC 90nm工艺下,针对N=1024和列表大小L=2,4,实现了459 MHz时钟频率下181 Mbps的吞吐量,显著提升了标准SC译码的纠错性能,同时通过基于指针的状态管理与优化的内存访问,保持了高效率。

ABSTRACT

We present a hardware architecture and algorithmic improvements for list SC decoding of polar codes. More specifically, we show how to completely avoid copying of the likelihoods, which is algorithmically the most cumbersome part of list SC decoding. The hardware architecture was synthesized for a blocklength of N = 1024 bits and list sizes L = 2, 4 using a UMC 90nm VLSI technology. The resulting decoder can achieve a coded throughput of 181 Mbps at a frequency of 459 MHz.

研究动机与目标

  • 为文献中缺乏极化码列表逐次消除(SC)译码的硬件架构提供解决方案。
  • 降低列表SC译码中因似然值复制导致的高计算与内存开销。
  • 实现低面积与延迟开销的实用化、高吞吐量列表SC译码。
  • 在保持硬件效率的同时,实现优于标准SC译码的纠错性能提升。

提出的方法

  • 提出一种基于指针的方法,替代列表SC译码中对中间似然值的直接复制,仅存储对似然值的指针。
  • 采用改进的基数为2L的度量排序器架构,在单个周期内选择L条最佳路径,降低关键路径延迟。
  • 采用交叉开关结构实现部分和、路径状态及指针内存的内存复制,支持在单个周期内跨L条译码路径完成状态复制。
  • 在MCU与度量排序器之间引入寄存器,以减少关键路径延迟,接受约50%的周期开销以换取更高的时钟频率。
  • 设计分层内存结构,为信道LLR和中间似然值分别分配独立存储空间,以最小化面积与功耗。
  • 通过复用同一信道LLR内存于所有路径,并仅分配(L+1)N个似然值存储位置,实现内存使用的优化。

实验结果

研究问题

  • RQ1如何在硬件中消除列表SC译码中昂贵的似然值复制步骤?
  • RQ2实现高吞吐量与低延迟的列表SC译码所需的最小硬件开销是多少?
  • RQ3基于指针的状态管理能否在不降低译码性能的前提下替代值复制?
  • RQ4在标准CMOS工艺下,列表SC译码器可实现的吞吐量与面积效率如何?
  • RQ5与现有SC译码器实现相比,所提出的架构在面积与性能方面表现如何?

主要发现

  • 所提出的架构在UMC 90nm CMOS工艺下,针对N=1024和L=2,4,实现了459 MHz时钟频率下181 Mbps的吞吐量。
  • 通过仅复制指针而非直接复制似然值,消除了直接似然值复制,降低了内存带宽与面积开销。
  • 度量排序器(用于选择L条最佳路径)的面积仅占总芯片面积的0.1%(L=2)至0.8%(L=4)。
  • 引入寄存器以降低关键路径延迟,使周期数增加约50%,但可实现更高的时钟频率与整体吞吐量。
  • L=2时总芯片面积为1.60 mm²,L=4时为3.53 mm²,相较于标准SC译码器,L=4时面积增加50%,但该开销因纠错性能的显著提升而合理。
  • 该架构是首个在硬件中实现列表SC译码的方案,文献中未见任何ASIC或FPGA的先前实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。