[論文レビュー] High-Throughput Flexible Belief Propagation List Decoder for Polar Codes
本論文は、行列分解を用いたオンザフライの順列生成により、複数の順列因子グラフ(PFG)における並列デコードを可能にする、高スルーレートで柔軟な信念伝播リスト(BPL)デコーダーの初のハードウェア実装を提示する。デコーダーは4.0 dB SNRで25.63 Gbpsのスルーレートと29.46 Gbps/mm²の面積効率を達成し、リストサイズ4のSCLデコードと同等の性能を発揮するが、リストサイズに制限なく任意のリストサイズをサポートする。面積オーバーヘッドなしで実現可能である。
Owing to its high parallelism, belief propagation (BP) decoding is highly amenable to high-throughput implementations and thus represents a promising solution for meeting the ultra-high peak data rate of future communication systems. However, for polar codes, the error-correcting performance of BP decoding is far inferior to that of the widely used CRC-aided successive cancellation list (SCL) decoding algorithm. To close the performance gap to SCL, BP list (BPL) decoding expands the exploration of candidate codewords through multiple permuted factor graphs (PFGs). From an implementation perspective, designing a unified and flexible hardware architecture for BPL decoding that supports various PFGs and code configurations presents a big challenge. In this paper, we propose the first hardware implementation of a BPL decoder for polar codes and overcome the implementation challenge by applying a hardware-friendly algorithm that generates flexible permutations on-the-fly. First, we derive the graph selection gain and provide a sequential generation (SG) algorithm to obtain a near-optimal PFG set. We further prove that any permutation can be decomposed into a combination of multiple fixed routings, and we design a low-complexity permutation network to satisfy the decoding schedule. Our BPL decoder not only has a low decoding latency by executing the decoding and permutation generation in parallel, but also supports an arbitrary list size without any area overhead. Experimental results show that, for length-1024 polar codes with a code rate of one-half, our BPL decoder with 32 PFGs has a similar error-correcting performance to SCL with a list size of 4 and achieves a throughput of 25.63 Gbps and an area efficiency of 29.46 Gbps/mm$^{2}$ at SNR=4.0dB, which is 1.82$ imes$ and 4.33$ imes$ faster than the state-of-the-art BP flip and SCL decoders,~respectively
研究の動機と目的
- 極性符号における信念伝播(BP)とCRC補助逐次取消リスト(SCL)デコードの性能差を解消し、高スルーレートかつ柔軟なBPLデコードを実現すること。
- 任意のリストサイズと複数の順列因子グラフ(PFG)を統合的かつ面積効率よくサポートするハードウェア課題を克服すること。
- 面積や周波数オーバーヘッドを増加させることなく、柔軟な順列をオンザフライで生成するハードウェアに適したアルゴリズムを設計すること。
- 近似的に最適な誤り訂正性能を維持しながら、高スルーレートと高い面積効率を達成すること。
提案手法
- グラフ選択ゲインを最大化する近似的に最適な順列因子グラフ(PFG)の集合を構築するための逐次生成(SG)アルゴリズムを提案する。
- 行列分解に基づくハードウェアに適した順列生成手法を導入し、任意の順列を固定ルーティングに分解することで、低複雑度のオンザフライルーティングを実現する。
- 複数のPFGにわたって単一のBPデコーダーを再利用する直列デコードスケジューリングを設計し、並列BPデコーダーの高コストを回避する。
- デコードスケジューリングと柔軟な順列生成器を分離することで、遅延を低減し、面積オーバーヘッドなしに任意のリストサイズをサポートする。
- スルーレートを向上させるとともに、クリティカルパス遅延を短縮するため、二段列の双方向伝搬アーキテクチャを採用する。
- 動的順列切り替えを可能にする単一のBPデコーダーコアを実装し、さまざまなリストサイズにわたる効率的かつスケーラブルな再利用を実現する。
実験結果
リサーチクエスチョン
- RQ1任意のリストサイズを面積オーバーヘッドなしでサポートできる信念伝播リスト(BPL)デコーダーを、極性符号用にどのように設計できるか?
- RQ2誤り訂正性能を最大限に高めつつ、ハードウェア複雑度を最小限に抑える最適な順列因子グラフ(PFG)の集合は何か?
- RQ3低ハードウェア複雑度で実装可能なオンザフライ順列生成により、柔軟かつ高スルーレートなBPLデコードを実現できるか?
- RQ4提案されたBPLデコーダーは、最先端のSCL、BP、BPFデコーダーと比較して、性能、スルーレート、面積効率の面でどのように差をつけるか?
- RQ5提案されたハードウェアアーキテクチャは、将来の超高速通信システムに適した低遅延とスケーラビリティを維持しながら、高スルーレートを達成できるか?
主な発見
- 提案されたBPLデコーダーは、28 nm FD-SOIプロセスを用いて、SNR = 4.0 dBで25.63 Gbpsのスルーレートと29.46 Gbps/mm²の面積効率を達成した。
- 32個のPFGを用いることで、リストサイズ4のSCLデコードと同等の誤り訂正性能を達成し、SNR = 2.65 dBでBLER = 10⁻⁴を達成した。
- 同じSNR条件下で、最先端のBPフラップ(BPF)デコーダーより1.82倍、SCLデコーダーより4.33倍のスルーレートを達成した。
- 同等の条件下で、[20]と[21]で報告されたBPFデコーダーと比較して、面積効率がそれぞれ2.36倍と2.74倍高い。
- リストサイズに関係なく、常に一定の面積と周波数を維持するため、性能やハードウェアコストに影響を与えることなく、大規模なリストサイズに対してもスケーラブルにサポート可能である。
- 65 nm CMOSプロセスに正規化した場合、BPLデコーダーは12.67 Gbps/mm²の面積効率を達成し、性能-面積効率トレードオフのグラフの左上隅に位置し、優れたトレードオフ性能を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。