Skip to main content
QUICK REVIEW

[論文レビュー] Strategies for High-Throughput FPGA-based QC-LDPC Decoder Architecture

Swapnil Mhaske, Hojin Kee|arXiv (Cornell University)|Mar 10, 2015
Error Correcting Code Techniques被引用数 4
ひとこと要約

本稿では、新しいコン pactな奇数検査行列(PCM)表現とアルゴリズム的パイプライン化を用いた、高スループットでスケーラブルかつ再構成可能なFPGAベースのQC-LDPCデコーダアーキテクチャを提案する。ノード処理を分割し、PCMをレイヤーとスーパーレイヤーに分割することで、追加のハードウェアを要せず効率的なパイプライン化を実現し、Xilinx Kintex-7 FPGA上で260 MHzで608 Mb/sのスループットを達成した。自動化されたハイレベル合成を用いて3分でHDLを生成した。

ABSTRACT

We propose without loss of generality strategies to achieve a high-throughput FPGA-based architecture for a QC-LDPC code based on a circulant-1 identity matrix construction. We present a novel representation of the parity-check matrix (PCM) providing a multi-fold throughput gain. Splitting of the node processing algorithm enables us to achieve pipelining of blocks and hence layers. By partitioning the PCM into not only layers but superlayers we derive an upper bound on the pipelining depth for the compact representation. To validate the architecture, a decoder for the IEEE 802.11n (2012) QC-LDPC is implemented on the Xilinx Kintex-7 FPGA with the help of the FPGA IP compiler [2] available in the NI LabVIEW Communication System Design Suite (CSDS) which offers an automated and systematic compilation flow where an optimized hardware implementation from the LDPC algorithm was generated in approximately 3 minutes, achieving an overall throughput of 608Mb/s (at 260MHz). As per our knowledge this is the fastest implementation of the IEEE 802.11n QC-LDPC decoder using an algorithmic compiler.

研究の動機と目的

  • 5Gおよびそれ以降の4G以降のシステムに適した、高スループットでスケーラブルかつ再構成可能なFPGAベースのQC-LDPCデコーダアーキテクチャの設計。
  • 自動化されたハイレベル合成(HLS)を用いて、ASICベースの設計の制限を克服し、迅速なプロトタイピングを可能にする。
  • 新しいコン pactなPCM表現と効率的なレイヤー化デコーディングのパイプライン化を用いて、顕著なスループット向上を達成する。
  • FPGA上での標準準拠のIEEE 802.11n(2012)QC-LDPCコード実装により、アーキテクチャを検証する。
  • 複数のコアを並列に使用することで、2 Gb/sを超えるスループットを達成し、スケーラビリティと効率性を示す。

提案手法

  • QC-LDPCの奇数検査行列(PCM)の新しいコン pactな行列表現を提案し、冗長な計算を低減し、データローカリティを向上させることで、スループットの複数倍向上を実現する。
  • ノード処理アルゴリズムを分割することで、ブロックレベルおよびレイヤーレベルの両方の処理をパイプライン化可能とし、ハードウェアリソースの増加なしに並列処理を実現する。
  • PCMをレイヤーとスーパーレイヤーに分割することで、実現可能なパイプライン深度の上限を導出し、リソース制約下でのスループット最適化を図る。
  • 固定小数点演算を用いたスケーリングされた最小和アルゴリズム(MSA)をデコーディングに使用し、6ビット符号付き小数入力LLRと4ビット小数メッセージ更新を使用する。
  • 全デコーダはLabVIEW CSDS™ FPGA IPコンパイラーを用いて実装され、高レベルのグラフィカルデータフロー記述から約3分で最適化されたVHDLを自動生成する。
  • 設計はVivadoを用いてXilinx Kintex-7 FPGA上で合成・実装され、1xおよび2xパイプラインバージョンのリソース使用量と性能が測定された。

実験結果

リサーチクエスチョン

  • RQ1コン pactなPCM表現は、ハードウェア複雑性を増加させずに、FPGAベースのQC-LDPCデコーダのスループットをどのように向上させるか?
  • RQ2コン pactなPCM表現を用いた場合、レイヤー化QC-LDPCデコーダで達成可能な最大パイプライン深度はどの程度か?
  • RQ3ブロック処理とレイヤー処理のアルゴリズム的パイプライン化は、追加のハードウェアリソースなしに高スループットを実現できるか?
  • RQ4HLSで生成されたFPGAデコーダのスループットとリソース効率は、既存の最先端のFPGAベース実装と比較してどの程度か?
  • RQ5提案されたアーキテクチャは、並列化によってどの程度、複数Gb/sのデコーディングを達成できるか?

主な発見

  • 提案されたコン pactなPCM表現により、データアクセスの最適化と冗長計算の低減が実現され、デコーディングスループットが複数倍向上した。
  • 2xパイプライン版は、Xilinx Kintex-7 FPGA上で260 MHzで608 Mb/sのスループットを達成し、1xバージョンと比較して1.7倍の高速化を実現し、効率は0.86であった。
  • リソース使用量は効率的で、2xバージョンはDSP48の5.3%、LUTの8.2%、BRAMの6.4%、フリップフロップの5.3%を消費し、1xバージョンと比較して総スライス使用量はたった3.8%増加にとどまった。
  • 固定小数点実装は、8回の反復後に浮動小数点バージョンと0.5 dB以内の誤り率(BER)性能を達成し、精度を低減しながらもほぼ最適な性能を示した。
  • FPGA IPコンパイラーは約3分で完全なHDLを生成し、複雑な信号処理における自動化HLSの実用性を検証する迅速なプロトタイピングを可能にした。
  • 5つの並列デコーダコアを用いたスケーラブルな実装により、同じFPGAプラットフォーム上で2.06 Gb/sのスループットを達成し、高スループット用途における強力なスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。