[論文レビュー] Dynamic Vision Sensor integration on FPGA-based CNN accelerators for high-speed visual classification
本論文は、高水準合成(HLS)を用いて、動的ビジョンセンサー(DVS)とCNN推論システムを統合するFPGAベースのハードウェアアクセラレータを提案する。ARMコアからイベントヒストグラム収集および正規化をオフロードすることで、ソフトウェアベースの処理に比べ67%の高速化を達成し、60MHzクロック周波数で160fpsに達し、低消費電力かつパイプライン処理を実現した。
Deep-learning is a cutting edge theory that is being applied to many fields. For vision applications the Convolutional Neural Networks (CNN) are demanding significant accuracy for classification tasks. Numerous hardware accelerators have populated during the last years to improve CPU or GPU based solutions. This technology is commonly prototyped and tested over FPGAs before being considered for ASIC fabrication for mass production. The use of commercial typical cameras (30fps) limits the capabilities of these systems for high speed applications. The use of dynamic vision sensors (DVS) that emulate the behavior of a biological retina is taking an incremental importance to improve this applications due to its nature, where the information is represented by a continuous stream of spikes and the frames to be processed by the CNN are constructed collecting a fixed number of these spikes (called events). The faster an object is, the more events are produced by DVS, so the higher is the equivalent frame rate. Therefore, these DVS utilization allows to compute a frame at the maximum speed a CNN accelerator can offer. In this paper we present a VHDL/HLS description of a pipelined design for FPGA able to collect events from an Address-Event-Representation (AER) DVS retina to obtain a normalized histogram to be used by a particular CNN accelerator, called NullHop. VHDL is used to describe the circuit, and HLS for computation blocks, which are used to perform the normalization of a frame needed for the CNN. Results outperform previous implementations of frames collection and normalization using ARM processors running at 800MHz on a Zynq7100 in both latency and power consumption. A measured 67% speedup factor is presented for a Roshambo CNN real-time experiment running at 160fps peak rate.
研究の動機と目的
- 従来のカメラの30fps制限を超える高スループットな視覚応用分野において、動的ビジョンセンサー(DVS)を用いてこれを克服すること。
- FPGA上でCNN推論アクセラレータと統合可能な、DVSイベント処理のハードウェアアクセラーテッドパイプラインを設計すること。
- HLSを用いてARMコアからヒストグラム正規化をFPGAにオフロードすることで、遅延と消費電力を低減すること。
- DVSイベント、正規化フレーム、CNN推論のパイプライン処理を可能にし、最大スループットを達成すること。
- ARMコア上のソフトウェアベースのDVS処理に比べ、リソースオーバーヘッドを最小限に抑えつつ67%の高速化を実証すること。
提案手法
- アドレスイベント表現(AER)DVSレティナからのイベント収集に適した、VHDLを用いたパイプラインFPGAアーキテクチャの設計。
- 高性能かつハードウェア最適化された計算ブロックを実現するため、高水準合成(HLS)を用いたヒストグラム正規化の実装。
- BRAMを介して、正規化済みヒストグラムをNullHop CNNアクセラレータに直接統合し、AXI-Stream DMAおよびARM処理を回避。
- 60MHzクロックで動作するZynq7100 FPGAプラットフォームを用い、全パイプライン(イベント収集 → 正規化 → CNN推論)を実行。
- ARMコア上のcAERライブラリおよびUSBホストインターフェースの必要性を排除することで、消費電力と遅延を低減。
- 次のフレームの正規化データがBRAMに準備されている間に、現在のフレームがCNNで処理されるように、パイプライン動作を可能に。
実験結果
リサーチクエスチョン
- RQ1FPGAベースのハードウェアアクセラレーションにより、ARMベースのソフトウェア処理と比較して、DVSイベント処理の遅延を顕著に低減できるか?
- RQ2HLS最適化された正規化論理は、DVS-CNNパイプラインにおけるスループット向上と消費電力低減にどの程度寄与するか?
- RQ3ARMコアからFPGAにヒストグラム正規化をオフロードすることで、全体のシステム消費電力とリソース利用度にどのような影響を与えるか?
- RQ4DVSイベント、正規化、CNN推論のパイプライン処理は、高フレームレートで持続的なリアルタイム性能を達成できるか?
- RQ5ソフトウェアベースの処理に比べ、ハードウェアベースのDVS処理は、フレームレートと遅延の面でどの程度の性能向上を示すか?
主な発見
- FPGAベースのシステムは、ARMベースのソフトウェア実装に比べ67%の高速化を達成し、フレーム分類遅延を約10msから約6msに短縮した。
- 60MHzクロック周波数で、ハードウェアアクセラレーテッドDVS処理を用いて、Roshambo CNNでピーク160fpsに達した。
- 消費電力は、ARMコアを含めて500mWにまで低減した。一方、同じタスクをARMコア上でソフトウェア正規化で実行した場合、1Wであった。
- ハードウェアソリューションは、以前のソフトウェアベースのバージョンと比較して、LUTが18%、フリップフロップが4.5%、BRAMが0.5%、DSPスライスが25%増加した。
- パイプライン処理により、CNNが現在のフレームを計算している間に、次のフレームの正規化データがすでにBRAMに準備されていた。
- cAERライブラリおよびUSBホストインターフェースへの依存が排除され、システムの複雑さと消費電力が低減した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。