Skip to main content
QUICK REVIEW

[논문 리뷰] Design of a Transport Triggered Architecture Processor for Flexible Iterative Turbo Decoder

Shahriar Shahabuddin, Janne Janhunen|arXiv (Cornell University)|2015. 01. 17.
Advanced Wireless Communication Techniques참고 문헌 11인용 수 9
한 줄 요약

이 논문은 3GPP LTE 호환 시스템에서 유연하고 고-throughput 터보 디코딩을 위한 애플리케이션 특화 명령어 집합 프로세서(ASIP)로 설계된 트랜스포트 트리거드 아키텍처(TTA) 프로세서를 제시한다. 이 프로세서는 단일 프로그래머블 플랫폼에서 다수의 준최적의 MAP 알고리즘—특히 max-log-MAP—을 지원하며, 200 MHz에서 QPP 인터리버를 사용해 경쟁 없는 메모리 액세스를 구현하고 낮은 지연 시간을 달성하여 31.32 Mbps의 처리량을 달성한다.

ABSTRACT

In order to meet the requirement of high data rates for the next generation wireless systems, the efficient implementation of receiver algorithms is essential. On the other hand, the rapid development of technology motivates the investigation of programmable implementations. This paper summarizes the design of a programmable turbo decoder as an applicationspecific instruction-set processor (ASIP) using Transport Triggered Architecture (TTA). The processor architecture is designed in such manner that it can be programmed to support other receiver algorithms, for example, decoding based on the Viterbi algorithm. Different suboptimal maximum a posteriori (MAP) algorithms are used and compared to one another for the softinput soft-output (SISO) component decoders in a single TTA processor. The max-log-MAP algorithm outperforms the other suboptimal algorithms in terms of latency. The design enables the designer to change the suboptimal algorithms according to the bit error rate (BER) performance requirement. Unlike many other programmable turbo decoder implementations, quadratic polynomial permutation (QPP) interleaver is used in this work for contention-free memory access and to make the processor 3GPP LTE compliant. Several optimization techniques to enable real time processing on programmable platforms are introduced. Using our method, with a single iteration 31.32 Mbps throughput is achieved for the max-log-MAP algorithm for a clock frequency of 200 MHz.

연구 동기 및 목표

  • 반복적 터보 디코딩을 위한 프로그래머블이고 애플리케이션 특화된 프로세서를 설계하여 다수의 준최적 MAP 알고리즘을 지원한다.
  • TTA 기반 ASIP 아키텍처를 사용해 3GPP LTE 호환 시스템에서 고처리량과 낮은 지연 시간을 달성한다.
  • 하드웨어 재설계 없이도 BER 및 지연 시간 요구사항에 따라 디코딩 알고리즘을 쉽게 재구성할 수 있도록 한다.
  • 경쟁 없는 메모리 액세스와 3GPP LTE 표준 완전 준수를 보장하기 위해 QPP 인터리버를 구현한다.
  • 최적화 기법과 효율적인 스케줄링을 활용해 프로그래머블 플랫폼에서 실시간 처리를 구현한다.

제안 방법

  • 프로세서는 데이터 경로와 명령 수준 병렬 처리에 대한 세밀한 제어가 가능한 TTA(트랜스포트 트리거드 아키텍처) 모델을 사용해 설계되었다.
  • TCE(TTA 컴파일러 환경) 도구 체인을 통해 고수준 C 코드를 그래픽적으로 프로세서 아키텍처 그래프에 컴파일하고 매핑할 수 있다.
  • 단일 프로세서 내에서 max-log-MAP, 선형-로그-MAP, 상수-로그-MAP, 로그-MAP 등 여러 준최적 MAP 알고리즘을 지원한다.
  • 효율적이고 경쟁 없는 메모리 액세스와 3GPP LTE 준수를 위해 QPP(이차치환다항식) 인터리버를 구현하였다.
  • 완벽한 버스 활용도와 사이클 정밀 스케줄링과 같은 최적화 기법을 적용하여 지연 시간을 최소화하고 처리량을 극대화하였다.
  • 프로세서는 사이클 정밀 모델을 사용해 평가되었으며, 각 알고리즘의 처리량과 사이클 수를 기반으로 성능이 측정되었다.

실험 결과

연구 질문

  • RQ1단일 TTA 기반 ASIP이 최소한의 하드웨어 오버헤드로 다수의 준최적 MAP 알고리즘을 효율적으로 지원할 수 있는가?
  • RQ2프로그래머블 플랫폼에서 max-log-MAP 알고리즘이 다른 준최적 알고리즘에 비해 지연 시간과 처리량 측면에서 어떻게 비교되는가?
  • RQ3TTA 기반 터보 디코더에서 QPP 인터리버 사용이 메모리 액세스 효율성과 3GPP LTE 준수에 어떤 영향을 미치는가?
  • RQ4버스 스케줄링 및 명령 수준 병렬 처리와 같은 최적화 기법이 실시간 처리 성능을 얼마나 향상시킬 수 있는가?
  • RQ5TTA 기반 프로세서가 순수 하드웨어 설계 수준의 고처리량을 달성하면서도 다양한 디코딩 알고리즘에 대한 프로그래머블성을 유지할 수 있는가?

주요 결과

  • max-log-MAP 알고리즘이 가장 낮은 지연 시간을 보이며, 반복당 39,226 사이클 뿐만 아니라 로그-MAP(834,253 사이클)에 비해 현저히 적은 사이클을 소모한다.
  • 200 MHz 클럭 주파수에서 max-log-MAP에 대해 31.32 Mbps의 처리량을 달성했으며, 이는 대부분의 이전 프로그래머블 구현보다 뛰어난 성능이다.
  • QPP 인터리버는 경쟁 없는 메모리 액세스를 가능하게 하고 3GPP LTE 표준 완전 준수를 보장한다.
  • 로지스틱-로그-MAP는 복잡한 조건부 논리로 인해 지연 시간이 증가하여 브랜치 명령어 수가 24,576개로 가장 많다.
  • BER 및 지연 시간 요구사항에 따라 알고리즘 간 재구성이 가능하여 강력한 유연성을 입증하였다.
  • 단일 TTA 프로세서가 여러 디코딩 알고리즘을 효율적으로 구현할 수 있음을 보여주며, 향후 시스템에서 다중 코어 확장 기반으로 처리량을 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.