Skip to main content
QUICK REVIEW

[논문 리뷰] DNN is not all you need: Parallelizing Non-Neural ML Algorithms on Ultra-Low-Power IoT Processors

Enrico Tabanelli, Giuseppe Tagliavini|arXiv (Cornell University)|2021. 07. 16.
Advanced Memory and Neural Computing인용 수 7
한 줄 요약

이 논문은 초저전력 PULP 기반 IoT 프로세서(GAP8 및 PULP-OPEN)에서 비신경망 기계학습 알고리즘—예를 들어 가우시안 나이브 베이즈, 로지스틱 회귀, 랜덤 포레스트—의 효율적인 병렬화를 제안한다. 메모리 액세스 최적화, 세밀한 수준의 병렬성 활용, 대상 프로세서에 최적화된 부동소수점 에뮬레이션 라이브러리 사용을 통해, 8코어 플랫폼에서 최대 7.04배의 성능 향상과 지연 시간 및 에너지 소비 87% 감소를 달성하였으며, ARM Cortex-M4보다 성능은 12.87배 빠르고 에너지 효율성은 98% 높다.

ABSTRACT

Machine Learning (ML) functions are becoming ubiquitous in latency- and privacy-sensitive IoT applications, prompting a shift toward near-sensor processing at the extreme edge and the consequent increasing adoption of Parallel Ultra-Low Power (PULP) IoT processors. These compute- and memory-constrained parallel architectures need to run efficiently a wide range of algorithms, including key Non-Neural ML kernels that compete favorably with Deep Neural Networks (DNNs) in terms of accuracy under severe resource constraints. In this paper, we focus on enabling efficient parallel execution of Non-Neural ML algorithms on two RISCV-based PULP platforms, namely GAP8, a commercial chip, and PULP-OPEN, a research platform running on an FPGA emulator. We optimized the parallel algorithms through a fine-grained analysis and intensive optimization to maximize the speedup, considering two alternative Floating-Point (FP) emulation libraries on GAP8 and the native FPU support on PULP-OPEN. Experimental results show that a target-optimized emulation library can lead to an average 1.61x runtime improvement and 37% energy reduction compared to a standard emulation library, while the native FPU support reaches up to 32.09x and 99%, respectively. In terms of parallel speedup, our design improves the sequential execution by 7.04x on average on the targeted octa-core platforms leading to energy and latency decrease up to 87%. Lastly, we present a comparison with the ARM Cortex-M4 microcontroller (MCU), a widely adopted commercial solution for edge deployments, which is 12.87x slower and 98% less energy-efficient than PULP-OPEN.

연구 동기 및 목표

  • 자원 제약이 있는 초저전력 IoT 프로세서에서 비신경망 기계학습 알고리즘의 효율적 실행을 가능하게 하기 위해.
  • 엄격한 에너지 및 메모리 제약 조건 하에서 엣지 추론 시 딥 네트워크(DNN)와 비신경망 기계학습 커널 간의 성능 격차를 해소하기 위해.
  • RISC-V 기반 PULP 플랫폼(GAP8 및 PULP-OPEN)에서 여섯 가지 핵심 비신경망 기계학습 알고리즘의 병렬 실행을 최적화하기 위해.
  • 부동소수점 에뮬레이션 라이브러리와 네이티브 FPU 지원이 런타임 및 에너지 효율성에 미치는 영향을 평가하기 위해.
  • PULP 플랫폼의 성능을 널리 사용되는 ARM Cortex-M4 MCU와 비교하여 엣지 기계학습 워크로드에 대해 평가하기 위해.

제안 방법

  • 8코어 PULP 플랫폼을 대상으로 비신경망 기계학습 커널 여섯 종류—가우시안 나이브 베이즈, 로지스틱 회귀, 선형 SVM, 랜덤 포레스트, k-NN, GEMM 기반 커널—의 병렬 구현을 설계하고 최적화하였다.
  • 메모리 액세스 패턴과 스레드 수준의 병렬성에 대한 세밀한 분석을 수행하여 코어 간 데이터 재사용과 로드 밸런스를 극대화하였다.
  • FPU가 없는 GAP8에서 두 가지 부동소수점 에뮬레이션 라이브러리—표준 libgcc와 대상 프로세서에 최적화된 RVfplib 라이브러리—를 구현하고 비교하였다.
  • PULP-OPEN에서의 네이티브 FPU 지원을 활용하여 고정밀도, 저지연 부동소수점 연산을 달성하였다.
  • 루프 전개, 하드웨어 루프 지원, 병합 곱셈-덧셈(FMA) 명령어를 포함한 컴파일러 최적화를 적용하여 사이클 수를 감소시켰다.
  • GAP8과 PULP-OPEN에서 사이클 정밀 프로파일링을 수행하여 순차적 및 병렬 구성에서의 성능 및 에너지 효율성을 측정하였다.

실험 결과

연구 질문

  • RQ1비신경망 기계학습 알고리즘이 DNN과 비교하여 초저전력 PULP IoT 프로세서에서 경쟁 가능한 성능과 에너지 효율성을 달성할 수 있는가?
  • RQ2FPU가 없는 PULP 플랫폼에서 부동소수점 에뮬레이션 라이브러리의 선택이 런타임과 에너지 소비에 어떤 영향을 미치는가?
  • RQ38코어 PULP 아키텍처에서 비신경망 기계학습 커널을 최적화함으로써 달성할 수 있는 병렬 성능 향상 수준은 어느 정도인가?
  • RQ4PULP-OPEN의 성능은 널리 보급된 ARM Cortex-M4 엣지 기계학습 추론 워크로드에서 어떻게 비교되는가?
  • RQ5PULP 기반 시스템에서 성능 향상을 제한하는 아키텍처적 요인은 무엇이며, 알고리즘 및 컴파일러 수준 최적화를 통해 이를 어떻게 완화할 수 있는가?

주요 결과

  • GAP8에서 대상 프로세서에 최적화된 RVfplib 부동소수점 에뮬레이션 라이브러리는 표준 libgcc 라이브러리 대비 평균 1.61배 성능 향상과 37%의 에너지 절감을 달성하였다.
  • PULP-OPEN에서의 네이티브 FPU 지원은 libgcc 에뮬레이션 대비 최대 32.09배 성능 향상과 99%의 에너지 절감을 기록하였다.
  • PULP-OPEN의 8코어 클러스터에서의 병렬 실행은 평균 7.04배 성능 향상을 기록하였으며, 지연 시간과 에너지 소비를 각각 최대 87% 감소시켰다.
  • PULP-OPEN는 심지어 단일 코어 모드에서도 ARM Cortex-M4 MCU 대비 12.87배 빠른 성능과 98% 높은 에너지 효율성을 확보하였다.
  • PULP-OPEN에서의 순차적 실행은 Cortex-M4 대비 1.36배에서 2.39배 빠르며, GEMM 기반 커널에서 가장 높은 성능 향상이 관찰되었다.
  • 단일 사이클 로드 연산, 하드웨어 루프 지원, 파ip라인 FMA 명령어와 같은 아키텍처적 요소들이 성능 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.