Skip to main content
QUICK REVIEW

[논문 리뷰] High Throughput 2D Spatial Image Filters on FPGAs

Abdullah Al-Dujaili, Suhaib A. Fahmy|arXiv (Cornell University)|2017. 10. 14.
CCD and CMOS Imaging Sensors참고 문헌 5인용 수 7
한 줄 요약

이 논문은 최대 성능를 위해 현대 DSP 블록을 활용하면서도 런타임 계수 재구성 기능을 지원하는 고-throughput, FPGA 기반 2D 공간 이미지 필터 아키텍처를 제안한다. DSP 블록의 병렬성과 간결한 경계 처리 기법을 활용하여, Full HD (1920×1080) 영상에서 190 프레임 per 초 이상을 달성하였으며, 고수준 합성(HLS) 도구로 생성된 필터 대비 1.7배 높은 픽셀 처리 속도를 확보하면서도 런타임 유연성을 유지한다.

ABSTRACT

FPGAs are well established in the signal processing domain, where their fine-grained programmable nature allows the inherent parallelism in these applications to be exploited for enhanced performance. As architectures have evolved, FPGA vendors have added more heterogeneous resources to allow often-used functions to be implemented with higher performance, at lower power and using less area. DSP blocks, for example, have evolved from basic multipliers to support the multiply-accumulate operations that are the core of many signal processing tasks. While more features were added to DSP blocks, their structure and connectivity has been optimised primarily for one-dimensional signal processing. Basic operations in image processing are similar, but performed in a two-dimensional structure, and hence, many of the optimisations in newer DSP blocks are not exploited when mapping image processing algorithms to them. We present a detailed study of two-dimensional spatial filter implementation on FPGAs, showing how to maximise performance through exploitation of DSP block capabilities, while also presenting a lean border pixel management policy.

연구 동기 및 목표

  • 비효율적인 2D 공간 필터링으로 인해 발생하는 실시간 비전 시스템의 성능 저하 문제를 해결한다.
  • 1D 신호 처리에 최적화된 현대 FPGA의 DSP 블록이 2D 이미지 필터링에서 충분히 활용되지 않는 문제를 해결한다.
  • 스마트 비전 시스템에서 다기능 이미지 처리를 위한 런타임 계수 재구성 기능을 제공한다.
  • 효율적인 경계 픽셀 처리 및 파ipelined 아키텍처 설계를 통해 자원 사용량과 지연 시간을 최소화한다.
  • 현대 FPGA에서 이론적 최대 수준의 스루풋을 달성하면서도 자원 사용량은 낮추고 고주파수 클럭을 유지한다.

제안 방법

  • 스캐닝 입력과 행 버퍼를 사용해 w−1개의 이전 행을 저장하는 스트리밍 데이터플로우를 활용한 직접형 2D 공간 필터 설계.
  • 가변 계수를 지원하는 DSP 블록을 사용해 입력 픽셀과 계수의 병렬 곱셈을 수행하여 런타임 계수 업데이트 가능.
  • 필터 파이프라인의 프리밍, 플러싱, 활성화 및 비활성화를 제어하기 위한 상태 기계 제어 유닛 통합.
  • 이전 연구에서 제안된 오버랩된 프리밍 및 플러싱 기법을 적용해 전체 프레임 버퍼링 없이도 경계 처리 오버헤드를 최소화.
  • 누적 단계에서 지연 시간과 자원 사용량을 최적화하기 위해 DSP 기반, 로직 전용, 하이브리드 등 다양한 애더 트리 설계 비교.
  • Xilinx Zynq FPGA를 타겟 플랫폼으로 선택하여, DSP 블록과 처리 논리 및 재구성 가능 논리 간 고대역폭 인터커넥트 기능을 활용.

실험 결과

연구 질문

  • RQ11D 신호 처리를 위해 설계된 현대 FPGA의 DSP 블록이 2D 이미지 필터링에 효과적으로 활용될 수 있는가?
  • RQ2런타임 계수 재구성은 FPGA 기반 이미지 필터의 자원 사용량, 지연 시간, 성능에 어떤 영향을 미치는가?
  • RQ3경계 픽셀 처리의 성능 오버헤드는 얼마이며, 스루풋을 희생시키지 않고도 이를 최소화할 수 있는가?
  • RQ4DSP 기반과 로직 기반 애더 트리 설계 간의 스루풋, 지연 시간, 자원 사용량에서의 성능 비교는 어떠한가?
  • RQ5Vivado HLS와 같은 고수준 합성(HLS) 도구에 비해 제안된 아키텍처는 성능 및 유연성 측면에서 어떤가?

주요 결과

  • 제안된 DSP 기반 설계는 최대 462 MHz의 클럭 주파수를 달성하여, Full HD (1920×1080) 영상 스트림에서 190 프레임 per 초 이상의 성능을 확보한다.
  • 로직 전용 구현은 2833개의 슬라이스 레지스터와 3101개의 LUT를 사용하지만, DSP 기반 버전은 오직 49개의 DSP 블록과 3444개의 슬라이스 레지스터만 사용하여 자원 효율성이 뛰어나다.
  • 이전 논문의 [15] 기법을 활용한 경계 관리 기능은 로직 사용량을 552개의 슬라이스 레지스터와 484개의 LUT로 증가시켰지만, 경계 없음 경우 대비 뿐만 아니라 1.5%의 지연 증가만을 초래하며 높은 스루풋을 유지한다.
  • Vivado HLS로 생성된 필터(369 MHz 대비 214 MHz)보다 1.7배 높은 픽셀 처리 속도를 확보하였으며, HLS 도구는 고정 계수를 최적화하기 위해 설계되었음에도 불구하고.
  • 런타임 계수 업데이트 기능을 지원하여, 재프로그래밍 없이도 블러, 샤프닝, 에지 검출 등의 다양한 이미지 처리 기능 간 동적 전환 가능.
  • DSP 기반 애더 트리와 함께 사용된 직접형 필터는 640×480 이미지에 대해 3874 사이클의 지연 시간을 기록하였으며, FPGA 아키텍처의 이론적 최대 스루풋에 매우 가까운 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.