Skip to main content
QUICK REVIEW

[논문 리뷰] Strategies for High-Throughput FPGA-based QC-LDPC Decoder Architecture

Swapnil Mhaske, Hojin Kee|arXiv (Cornell University)|2015. 03. 10.
Error Correcting Code Techniques인용 수 4
한 줄 요약

이 논문은 새로운 압축된 패리티체크행렬(PCM) 표현 방식과 알고리즘 기반 파ip라이닝을 사용하여 고-throughput, 확장 가능하고 재구성 가능한 FPGA 기반 QC-LDPC 디코더 아키텍처를 제안한다. 이로 인해 다중 속도 향상이 달성된다. 노드 처리를 분할하고 PCM를 레이어와 슈퍼레이어로 분할함으로써, 추가 하드웨어 없이도 효율적인 파이프라이닝이 가능해지며, 자동 고수준 합성(automated high-level synthesis)을 통해 Xilinx Kintex-7 FPGA에서 260 MHz에서 608 Mb/s의 Throughput을 달성한다.

ABSTRACT

We propose without loss of generality strategies to achieve a high-throughput FPGA-based architecture for a QC-LDPC code based on a circulant-1 identity matrix construction. We present a novel representation of the parity-check matrix (PCM) providing a multi-fold throughput gain. Splitting of the node processing algorithm enables us to achieve pipelining of blocks and hence layers. By partitioning the PCM into not only layers but superlayers we derive an upper bound on the pipelining depth for the compact representation. To validate the architecture, a decoder for the IEEE 802.11n (2012) QC-LDPC is implemented on the Xilinx Kintex-7 FPGA with the help of the FPGA IP compiler [2] available in the NI LabVIEW Communication System Design Suite (CSDS) which offers an automated and systematic compilation flow where an optimized hardware implementation from the LDPC algorithm was generated in approximately 3 minutes, achieving an overall throughput of 608Mb/s (at 260MHz). As per our knowledge this is the fastest implementation of the IEEE 802.11n QC-LDPC decoder using an algorithmic compiler.

연구 동기 및 목표

  • 5G 및 Beyond-4G 시스템에 적합한 고-throughput, 확장 가능하고 재구성 가능한 FPGA 기반 QC-LDPC 디코더 아키텍처를 설계하는 것.
  • 자동 고수준 합성(HLS)을 통해 빠른 프로토타이핑이 가능하도록 ASIC 기반 설계의 한계를 극복하는 것.
  • 새로운 압축된 PCM 표현 방식과 효율적인 계층적 디코딩 파이프라이닝을 통해 상당한 Throughput 향상을 달성하는 것.
  • IEEE 802.11n(2012) 표준 준수 QC-LDPC 코드를 FPGA에 구현하여 아키텍처를 검증하는 것.
  • 다중 코어를 병렬로 사용하여 2 Gb/s 이상의 Throughput를 달성함으로써 확장성과 효율성을 입증하는 것.

제안 방법

  • QC-LDPC 패리티체크행렬(PCM)에 대한 새로운 압축된 행렬 표현 방식을 제안하여, 중복 계산을 줄이고 데이터 국소성을 향상시킴으로써 다중 속도 향상을 가능하게 한다.
  • 노드 처리 알고리즘을 분할하여 블록 수준 및 레이어 수준의 작업을 파이프라이닝할 수 있도록 하여, 하드웨어 자원 증가 없이도 동시 처리가 가능하도록 한다.
  • PCM를 레이어와 슈퍼레이어로 분할하여 파이프라이닝 깊이의 상한을 유도하고, 자원 제약 조건 하에서 Throughput를 최적화한다.
  • 고정소수점 산술을 사용한 스케일된 최소합 알고리즘(Min-Sum Algorithm, MSA)을 사용하여 디코딩하며, 입력 LLR는 6비트 부호 있는 분수형태, 메시지 업데이트는 4비트 분수형태를 사용한다.
  • 전체 디코더는 LabVIEW CSDS™ FPGA IP 컴파일러를 사용하여 구현되었으며, 이는 고수준 그래픽 데이터플로우 기반 기술을 약 3분 내에 최적화된 VHDL로 자동 생성한다.
  • 자원 사용량과 성능을 측정하기 위해 Vivado를 사용하여 Xilinx Kintex-7 FPGA에 설계를 합성 및 구현하였으며, 1x 및 2x 파이프라이닝된 버전에서 비교 분석을 수행하였다.

실험 결과

연구 질문

  • RQ1압축된 PCM 표현 방식은 하드웨어 복잡도를 증가시키지 않으면서도 FPGA 기반 QC-LDPC 디코더의 Throughput를 어떻게 향상시킬 수 있는가?
  • RQ2압축된 PCM 표현 방식을 사용할 경우 계층적 QC-LDPC 디코더에서 달성 가능한 최대 파이프라이닝 깊이는 얼마인가?
  • RQ3블록 및 레이어 처리의 알고리즘 기반 파이프라이닝은 추가 하드웨어 자원 없이도 고속도를 달성할 수 있는가?
  • RQ4HLS를 통해 생성된 FPGA 디코더의 Throughput 및 자원 효율성은 기존 최첨단 FPGA 기반 구현과 비교하여 어떻게 되는가?
  • RQ5제안된 아키텍처는 병렬화를 통해 얼마나 높은 수준의 다중 Gb/s 디코딩을 달성할 수 있는가?

주요 결과

  • 제안된 압축된 PCM 표현 방식은 데이터 액세스 최적화와 중복 계산 감소를 통해 디코딩 Throughput를 다중으로 향상시킨다.
  • 2x 파이프라이닝된 버전은 Xilinx Kintex-7 FPGA에서 260 MHz에서 608 Mb/s의 Throughput를 달성하였으며, 1x 버전 대비 1.7배의 속도 향상(효율성 0.86)을 보였다.
  • 자원 사용량은 효율적으로 유지되었으며, 2x 버전은 DSP48의 5.3%, LUT의 8.2%, BRAM의 6.4%, 플립플롭의 5.3%를 사용하였고, 1x 버전 대비 총 슬라이스 사용량은 3.8% 증가에 그쳤다.
  • 고정소수점 구현은 8회 반복 후 부동소수점 버전과 0.5 dB 이내의 BER 성능을 달성하여, 낮은 정밀도로도 거의 최적의 성능을 구현하였다.
  • FPGA IP 컴파일러는 약 3분 내에 전체 HDL를 생성하여, 복잡한 신호 처리의 자동화된 HLS를 위한 실현 가능성을 검증하고 빠른 프로토타이핑을 가능하게 하였다.
  • 다섯 개의 병렬 디코더 코어를 사용한 확장 가능한 구현은 동일한 FPGA 플랫폼에서 2.06 Gb/s의 Throughput를 달성하여 고속도 응용 분야에서 강력한 확장성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.