Skip to main content
QUICK REVIEW

[논문 리뷰] Pixie: A heterogeneous Virtual Coarse-Grained Reconfigurable Array for high performance image processing applications

Amit Kulkarni, Dirk Stroobandt|arXiv (Cornell University)|2017. 05. 04.
Embedded Systems Design Techniques참고 문헌 5인용 수 8
한 줄 요약

이 논문은 고성능 이미지 처리를 가속화하기 위해 FPGA에 구현된 이질적 가상 거시적 재구성가능 어레이(VCGRA)인 Pixie를 제안한다. 매개변수화된 설정 플로우를 사용함으로써 처리 요소에 대해 24%의 논리 자원 감소와 가상 채널에 대해 82%의 자원 절감을 달성하여 빠른 컴파일과 재구성 가능성을 확보하면서 하드웨어 DSP 블록에 의존하지 않는다.

ABSTRACT

Coarse-Grained Reconfigurable Arrays (CGRAs) enable ease of programmability and result in low development costs. They enable the ease of use specifically in reconfigurable computing applications. The smaller cost of compilation and reduced reconfiguration overhead enables them to become attractive platforms for accelerating high-performance computing applications such as image processing. The CGRAs are ASICs and therefore, expensive to produce. However, Field Programmable Gate Arrays (FPGAs) are relatively cheaper for low volume products but they are not so easily programmable. We combine best of both worlds by implementing a Virtual Coarse-Grained Reconfigurable Array (VCGRA) on FPGA. VCGRAs are a trade off between FPGA with large routing overheads and ASICs. In this perspective we present a novel heterogeneous Virtual Coarse-Grained Reconfigurable Array (VCGRA) called "Pixie" which is suitable for implementing high performance image processing applications. The proposed VCGRA contains generic processing elements and virtual channels that are described using the Hardware Description Language VHDL. Both elements have been optimized by using the parameterized configuration tool flow and result in a resource reduction of 24% for each processing elements and 82% for each virtual channels respectively.

연구 동기 및 목표

  • FPGA에서 이미지 처리 가속기의 개발 비용과 컴파일 시간을 줄이기 위해.
  • 고수준 응용 기술 서술과 FPGA 구현 간 격차를 메우기 위해.
  • 하드코딩된 DSP 블록에 의존하지 않고 저비용 FPGA에서 영향력 있고 매개변수화된 VCGRA를 구현함으로써 이를 제거하기 위해.
  • Sobel 에지 검출과 같은 이미지 처리 워크로드에서 높은 성능과 낮은 면적 오버헤드를 달성하기 위해.
  • 매개변수화된 재구성 가능성을 통해 VCGRAs가 FPGA 수준의 접근성과 ASIC 수준의 효율성을 동시에 제공할 수 있음을 입증하기 위해.

제안 방법

  • VCGRA는 논리 및 인터커넥트 자원 최적화를 위해 매개변수화된 설정 도구 플로우를 사용하여 FPGA에 구현된다.
  • 처리 요소(PEs)는 산술 연산(덧셈, 뺄셈, 곱셈 등)을 위한 구성 가능한 기능 단위를 설계하여 기능적 이질성을 구현한다.
  • 가상 채널(VCs)은 조정 가능한 연결(TCONs)을 사용하고 매개변수화를 통해 최적화되어 자원 사용을 82% 감소시킨다.
  • 재구성 가능한 인터커넥트 네트워크와 가상 스위치 블록(VSBs) 및 설정 레지스터를 사용하여 데이터 경로의 동적 재구성을 가능하게 한다.
  • IEEE 754 호환 부동소수점 연산을 위한 FloPoCo를 사용하여 고정소수점 및 부동소수점 PE 버전을 구현한다.
  • Sobel 에지 검출 필터는 45개의 PE와 4개의 VC를 사용하여 매핑되었으며, 재구성 시간은 PE 기준 156 ms, VC 기준 18.4 ms로 측정되었다.

실험 결과

연구 질문

  • RQ1매개변수화된 VCGRA 구현이 FPGA에서 이미지 처리 응용 프로그램의 자원 사용과 재구성 오버헤드를 줄일 수 있는가?
  • RQ2하드코딩된 DSP 블록이 없는 VCGRA는 전통적인 FPGA 구현 대비 면적과 성능 측면에서 어떻게 비교되는가?
  • RQ3매개변수화된 설정이 처리 요소와 가상 채널의 논리 및 와이어 길이 오버헤드를 얼마나 줄일 수 있는가?
  • RQ4실세계 이미지 처리 커널에 대해 매개변수화가 컴파일 및 재구성 시간에 어떤 영향을 미치는가?
  • RQ5VCGRA가 FPGA 수준의 프로그래머블성과 낮은 개발 비용을 유지하면서도 약간의 ASIC 수준 성능을 달성할 수 있는가?

주요 결과

  • 제안된 VCGRA는 매개변수화된 설정을 통해 처리 요소에 대해 24%의 논리 자원 감소와 가상 채널에 대해 82%의 자원 절감을 달성한다.
  • 최소 채널 폭가 42% 감소로 인해 매개변수화된 구현에서 와이어 길이가 76% 감소하였다.
  • 고정소수점 PE는 LUT 사용량이 5% 감소하고 와이어 길이가 2% 감소했으며, 재구성 비용은 3.4 ms였다.
  • 부동소수점 PE는 면적 기준 24%의 최적화와 와이어 길이 기준 25%의 감소를 달성했으며, 재구성 비용은 88.5 ms였다.
  • 4×4 VCGRA 격자는 논리 자원에서 6% 감소와 와이어 길이에서 4% 감소를 기록했으며, 재구성 비용은 98.5 ms였다.
  • Sobel 필터의 컴파일 시간은 1초 이내였고, 비트스트림 생성에는 약 1200초가 소요되어 기존 FPGA 플로우에 비해 상당히 빠른 편이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.