Skip to main content
QUICK REVIEW

[論文レビュー] Mobile Machine Learning Hardware at ARM: A Systems-on-Chip (SoC) Perspective

Yuhao Zhu, Matthew Mattina|arXiv (Cornell University)|Jan 19, 2018
CCD and CMOS Imaging Sensors参考文献 6被引用数 17
ひとこと要約

本稿では、モバイル機器向けの機械学習におけるシステムレベルの共同設計手法を提案する。ISPの動き量とARMのACPを介したL3キャッシュを活用し、連続的なコンピュータビジョンにおけるCNN推論周波数を低減する。フレームごとの完全な推論を繰り返さずに、動きデータを再利用することで、1%未満の精度損失で40%以上のエネルギー削減を達成した。

ABSTRACT

Machine learning is playing an increasingly significant role in emerging mobile application domains such as AR/VR, ADAS, etc. Accordingly, hardware architects have designed customized hardware for machine learning algorithms, especially neural networks, to improve compute efficiency. However, machine learning is typically just one processing stage in complex end-to-end applications, involving multiple components in a mobile Systems-on-a-chip (SoC). Focusing only on ML accelerators loses bigger optimization opportunity at the system (SoC) level. This paper argues that hardware architects should expand the optimization scope to the entire SoC. We demonstrate one particular case-study in the domain of continuous computer vision where camera sensor, image signal processor (ISP), memory, and NN accelerator are synergistically co-designed to achieve optimal system-level efficiency.

研究の動機と目的

  • モバイルシステムにおけるオンデバイスディープラーニングの増大する計算およびエネルギー要件に対処すること。
  • DNNアクセラレータの最適化に限界があるのを克服し、SoC全体の共同設計に拡張すること。
  • 精度を損なわず、連続的コンピュータビジョンワークロードにおけるエネルギー消費を削減すること。
  • 抽象化レイヤーと標準化APIを通じて、効率的なハードウェア・ソフトウェア統合を実現すること。
  • ISP、メモリ、アクセラレータの間でのIP間連携が、顕著なシステムレベルの利得をもたらすことを実証すること。

提案手法

  • ISPの時間的ノイズ低減パイプラインから生成される動き量(MVs)を、オブジェクト追跡に再利用することで、フレームごとのCNN推論を回避した。
  • ARMのアクセラレータ一貫性ポート(ACP)を活用し、L3キャッシュへの直接アクセスを可能にし、層間データの再利用を実現することで、DRAMトラフィックを削減した。
  • CNN推論をスキップするためのシステムレベルの外挿ウィンドウ(EW)を実装し、動き量が追跡に十分なフレームでは推論を省略した。
  • ARM Compute Libraryを用いて最適化されたDNNカーネルを実装し、AndroidNN APIを介してHAL抽象化を通じて公開した。
  • エネルギーと精度のトレードオフを評価するために、Jetson TX2の測定値を基にカスタムSoCシミュレータをキャリブレーションした。
  • AndroidNNインタフェースを維持し、低レベルドライバおよびHALのみを変更することで、後方互換性を確保した。

実験結果

リサーチクエスチョン

  • RQ1ISP、メモリ、NNアクセラレータの間でシステムレベルの共同設計を実施することで、顕著な精度損失なしにモバイル機器における連続的ビジョンのエネルギー消費を削減できるか?
  • RQ2ISPから得られる動き量を、オブジェクト追跡に再利用することで、繰り返しのCNN推論の必要性をどの程度低減できるか?
  • RQ3ACPを介したL3キャッシュ共有は、CNNワークロードにおけるDRAM帯域幅およびエネルギー消費削減にどの程度効果的か?
  • RQ4外挿ウィンドウサイズを大きくした場合、エネルギー節約と精度のトレードオフはどのように変化するか?
  • RQ5ハードウェア・ソフトウェアスタックの抽象化は、アプリケーションの互換性を保持しつつ、新たなシステムレベル最適化を可能にするか?

主な発見

  • 提案手法は、1080p/60fpsのリアルタイムオブジェクト検出において、40%以上のエネルギー消費削減を達成した。
  • 外挿ウィンドウサイズが2の場合、完全なフレーム推論と比較して1%未満の精度損失にとどまった。
  • 外挿ウィンドウサイズが大きくなるほどエネルギー節約が進んだが、ウィンドウサイズの増大に伴い精度が徐々に低下した。
  • 本手法は、TinyYOLOのようなモデル圧縮技術を上回り、より高い精度とより大きなエネルギー節約を達成した。
  • ACPを介したL3キャッシュ再利用により、DRAMアクセスが顕著に削減され、オフチップメモリトラフィックの最小化を通じて全体のエネルギー効率が向上した。
  • 抽象化レイヤーとHALの変更により、従来のAndroidNNベースアプリケーションとの完全な後方互換性を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。