Skip to main content
QUICK REVIEW

[논문 리뷰] Mobile Machine Learning Hardware at ARM: A Systems-on-Chip (SoC) Perspective

Yuhao Zhu, Matthew Mattina|arXiv (Cornell University)|2018. 01. 19.
CCD and CMOS Imaging Sensors참고 문헌 6인용 수 17
한 줄 요약

이 논문은 모바일 기계학습을 위한 시스템 수준의 공동 설계 접근법을 제안하며, ISP의 동작 벡터와 ARM의 ACP를 통해 L3 캐시에 접근하여 연속적인 컴퓨터 비전에서 CNN 추론 주파수를 감소시킨다. 매 프레임마다 전체 추론을 수행하는 대신 동작 데이터를 재사용하여 물체 추적을 수행함으로써, 정확도 손실이 1% 미만일 정도로 40% 이상의 에너지 절감을 달성한다.

ABSTRACT

Machine learning is playing an increasingly significant role in emerging mobile application domains such as AR/VR, ADAS, etc. Accordingly, hardware architects have designed customized hardware for machine learning algorithms, especially neural networks, to improve compute efficiency. However, machine learning is typically just one processing stage in complex end-to-end applications, involving multiple components in a mobile Systems-on-a-chip (SoC). Focusing only on ML accelerators loses bigger optimization opportunity at the system (SoC) level. This paper argues that hardware architects should expand the optimization scope to the entire SoC. We demonstrate one particular case-study in the domain of continuous computer vision where camera sensor, image signal processor (ISP), memory, and NN accelerator are synergistically co-designed to achieve optimal system-level efficiency.

연구 동기 및 목표

  • 모바일 시스템에서의 온디바이스 딥 러닝에 대한 점점 증가하는 계산 및 에너지 수요를 해결하기 위해.
  • 고립된 DNN 가속기 최적화의 한계를 넘어 전체 SoC 공동 설계로 확장하여.
  • 정확도를 희생시키지 않고 연속적인 컴퓨터 비전 워크로드에서 에너지 소비를 줄이기 위해.
  • 抽象화 레이어와 표준화된 API를 통해 효율적인 하드웨어-소프트웨어 통합을 가능하게 하기 위해.
  • ISP, 메모리, 가속기 간의 교차 IP 협업이 체계적인 성능 향상에 기여할 수 있음을 입증하기 위해.

제안 방법

  • ISP의 시간적 노이즈 제거 파이프라인에서 생성된 동작 벡터(MVs)를 활용해 물체 추적을 수행함으로써, 중복된 CNN 추론을 방지하였다.
  • ARM의 가속기 일관성 포트(ACP)를 사용해 L3 캐시에 직접 액세스할 수 있도록 하여 계층 간 데이터 재사용을 가능하게 하였고, DRAM 트래픽을 감소시켰다.
  • 모든 추론을 수행할 필요가 없는 프레임에서 동작 벡터로 충분한 추적 성능을 확보하기 위해 시스템 수준의 외삽 윈도우(EW)를 구현하였다.
  • ARM Compute Library를 활용해 최적화된 DNN 커널을 구현하고, AndroidNN API를 통해 HAL 추상화를 통해 노출하였다.
  • 에너지 소비와 정확도의 상호 교환 관계를 평가하기 위해 Jetson TX2 측정값을 기반으로 맞춤형 SoC 시뮬레이터를 校정하였다.
  • AndroidNN 인터페이스를 유지하면서도 하위 수준 드라이버와 HAL만 수정함으로써 기존 애플리케이션과의 후행 호환성을 유지하였다.

실험 결과

연구 질문

  • RQ1ISP, 메모리, NN 가속기 간의 시스템 수준 공동 설계가 정확도 손실이 크지 않은 수준에서 모바일 연속 비전에서 에너지 소비를 줄일 수 있는가?
  • RQ2ISP에서 생성된 동작 벡터는 얼마나 효과적으로 물체 추적에 재사용될 수 있으며, 이를 통해 반복적인 CNN 추론의 필요성을 얼마나 줄일 수 있는가?
  • RQ3ACP를 통한 L3 캐시 공유 방식은 CNN 워크로드에서 DRAM 대역폭과 에너지 소비를 얼마나 줄일 수 있는가?
  • RQ4외삽 윈도우 크기를 늘릴수록 에너지 절감과 정확도 사이의 상호 교환 관계는 어떻게 변화하는가?
  • RQ5하드웨어-소프트웨어 스택 추상화는 새로운 시스템 수준 최적화를 가능하게 하면서도 기존 애플리케이션의 호환성을 유지할 수 있는가?

주요 결과

  • 제안된 시스템은 1080p/60fps에서 실시간 물체 검출 작업에서 에너지 소비를 40% 이상 감소시켰다.
  • 외삽 윈도우 크기가 2일 경우, 전체 프레임 추론 대비 정확도 손실이 1% 미만이었다.
  • 외삽 윈도우 크기가 커질수록 에너지 절감 효과가 증가했지만, 윈도우 크가 커질수록 점차 정확도가 저하되었다.
  • 모델 압축 기법(예: TinyYOLO)보다도 뛰어난 성능을 보였으며, 더 높은 정확도와 더 큰 에너지 절감 효과를 달성했다.
  • ACP를 통한 L3 캐시 재사용은 DRAM 액세스를 크게 감소시켜 외부 메모리 트래픽을 최소화함으로써 전체 에너지 효율성에 기여하였다.
  • 추상화 레이어와 HAL 수정을 통해 기존 AndroidNN 기반 애플리케이션과의 완전한 후행 호환성을 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.