Skip to main content
QUICK REVIEW

[논문 리뷰] Fast Implementation of Morphological Filtering Using ARM NEON Extension

Elena Limonova, Arseny P. Terekhin|arXiv (Cornell University)|2020. 02. 19.
CCD and CMOS Imaging Sensors참고 문헌 7인용 수 7
한 줄 요약

이 논문은 ARM NEON SIMD 명령어를 활용하여 분리 가능성과 하이브리드 알고리즘(대규모 창에 대해선 van Herk/Gil-Werman, 소규모 창에 대해선 저상수 선형 알고리즘)을 적용한 형태학적 침식 및 팽창의 최적화된 구현을 제시한다. 또한 8x8 및 16x16 행렬 전치 연산을 빠르게 처리한다. 이 방법은 비-SIMD 기반 구현 대비 최대 12배 빠른 16x16 행렬 전치 연산과 3배 빠른 침식/팽창 연산을 달성한다.

ABSTRACT

In this paper we consider speedup potential of morphological image filtering on ARM processors. Morphological operations are widely used in image analysis and recognition and their speedup in some cases can significantly reduce overall execution time of recognition. More specifically, we propose fast implementation of erosion and dilation using ARM SIMD extension NEON. These operations with the rectangular structuring element are separable. They were implemented using the advantages of separability as sequential horizontal and vertical passes. Each pass was implemented using van Herk/Gil-Werman algorithm for large windows and low-constant linear complexity algorithm for small windows. Final implementation was improved with SIMD and used a combination of these methods. We also considered fast transpose implementation of 8x8 and 16x16 matrices using ARM NEON to get additional computational gain for morphological operations. Experiments showed 3 times efficiency increase for final implementation of erosion and dilation compared to van Herk/Gil-Werman algorithm without SIMD, 5.7 times speedup for 8x8 matrix transpose and 12 times speedup for 16x16 matrix transpose compared to transpose without SIMD.

연구 동기 및 목표

  • ARM 기반 임베디드 시스템에서 실시간 영상 처리에 있어 형태학적 필터링의 성능 저하 문제를 해결한다.
  • ARM 프로세서에서 직사각형 구조 요소에 대해 침식 및 팽창 연산의 계산 복잡도를 감소시킨다.
  • ARM NEON을 통한 SIMD 병렬 처리를 활용하여 행렬 전치 및 형태학적 연산과 같은 주요 영상 처리 원천을 가속화한다.
  • 분리 가능성, 적응형 창 처리, 데이터 수준 병렬 처리를 결합한 알고리즘 최적화를 통해 고성능을 달성한다.

제안 방법

  • 직사각형 구조 요소의 분리 가능성을 활용하여 2차원 형태학적 연산을 수평 및 수직 순차적 패ass로 분해한다.
  • 대규모 창 크기에 대해선 각 패스당 O(n) 선형 복잡도를 달성하기 위해 van Herk/Gil-Werman 알고리즘을 적용한다.
  • 오버헤드를 최소화하고 효율성을 향상시키기 위해 소규모 창 크기에 대해 저상수 선형 복잡도 알고리즘을 사용한다.
  • 창 크기에 따라 두 알고리즘을 동적으로 조합하여 성능과 정확성의 균형을 맞춘다.
  • 분리형 필터링에서의 데이터 재구성 가속을 위해 ARM NEON 인트린식을 사용한 최적화된 8x8 및 16x16 행렬 전치 루틴을 구현한다.
  • 모든 단계에 걸쳐 SIMD 벡터화를 통합하여 ARM NEON 유닛에서의 데이터 수준 병렬 처리를 최대한 활용한다.

실험 결과

연구 질문

  • RQ1어떻게 SIMD 확장 기능을 활용하여 ARM 프로세서에서 형태학적 필터링을 가속화할 수 있는가?
  • RQ2침식 및 팽창에 대해 분리형 필터링과 NEON 최적화 커널을 조합했을 때의 성능 향상은 어떠한가?
  • RQ3van Herk/Gil-Werman과 저상수 선형 알고리즘의 하이브리드 알고리즘은 다양한 창 크기에서 계산 비용을 얼마나 효과적으로 감소시키는가?
  • RQ4NEON 최적화된 행렬 전치가 분리형 형태학적 연산의 성능에 얼마나 기여하는가?
  • RQ5최종 구현체는 비-SIMD 기반 구현 대비 전체적으로 얼마나 빠른가?

주요 결과

  • 최종 구현체는 SIMD 최적화 없이 van Herk/Gil-Werman 알고리즘을 사용한 경우 대비 침식 및 팽창 연산에서 3배의 성능 향상을 달성했다.
  • NEON 최적화된 루틴을 사용했을 때 8x8 행렬 전치 연산은 비-SIMD 구현 대비 5.7배 빠른 성능을 보였다.
  • 16x16 행렬 전치 연산은 NEON 최적화된 전치 커널을 사용해 12배 빠른 성능을 달성했다.
  • 알고리즘 최적화와 SIMD 병렬 처리의 조합이 ARM 프로세서에서 형태학적 필터링의 실행 시간을 크게 감소시켰다.
  • 하이브리드 접근 방식은 소규모 및 대규모 창 크기 간의 성능을 효과적으로 균형 잡아 오버헤드를 최소화하면서 최대 처리량을 달성했다.
  • 결과적으로 NEON 기반 구현이 임베디드 컴퓨터 비전 워크로드에서 상당한 성능 향상을 제공할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.