Skip to main content
QUICK REVIEW

[論文レビュー] Increasing FPS for single board computers and embedded computers in 2021 (Jetson nano and YOVOv4-tiny). Practice and review

Ildar Rakhmatulin|arXiv (Cornell University)|Jul 19, 2021
Brain Tumor Detection and Classification参考文献 18被引用数 6
ひとこと要約

本稿では、低価格な組み込みシステムにおけるYOLOv4-tinyの推論速度(FPS)を向上させる最適化技術を評価および実装する。主にNVIDIA Jetson Nanoやその他のシングルボードコンピュータ(SBC)を対象としている。TensorRTの活用、最適化された推論フレームワーク、ハードウェアに配慮したモデルの量子化を用いることで、カスタムデータセットを用いてJetson Nano上で最大25 FPSを達成した。GPUアクセラレーションなしでも低価格SBCにおいて実用的な性能向上を実証した。

ABSTRACT

This manuscript provides a review of methods for increasing the frame per second of single-board computers. The main emphasis is on the Jetson family of single-board computers from Nvidia Company, due to the possibility of using a graphical interface for calculations. But taking into account the popular low-cost segment of single-board computers as RaspberryPI family, BananaPI, OrangePI, etc., we also provided an overview of methods for increasing the frame per second without using a Graphics Processing Unit. We considered frameworks, software development kit, and various libraries that can be used in the process of increasing the frame per second in single-board computers. Finally, we tested the presented methods for the YOLOv4-tiny model with a custom dataset on the Jetson nano and presented the results in the table.

研究の動機と目的

  • シングルボードコンピュータ(SBC)であるJetson Nano や Raspberry Pi におけるFPS向上のためのソフトウェアおよびハードウェア最適化技術を特定・評価すること。
  • カスタムデータセットを用いて、さまざまな最適化設定下で低価格SBCにおけるYOLOv4-tinyモデルのベンチマークを実施すること。
  • GPUアクセラレーションあり(Jetson)とCPUオンリーモード(Raspberry Pi、OrangePi)の両方のアプローチを比較し、リアルタイム物体検出の実現可能性を検証すること。
  • エッジデバイスに効率的な物体検出モデルをデプロイするための実用的で再現可能なガイドを提供すること。

提案手法

  • NVIDIA Jetson Nanoにおけるモデル最適化と推論加速にTensorRTを活用した。
  • Jetson Nanoにおけるモデルサイズの削減と推論速度の向上を目的に、INT8量子化を適用した。
  • Darknet、PyTorch、ONNXなどの推論フレームワークを評価し、モデルエクスポートとベンチマークを実施した。
  • Raspberry Pi や OrangePi などのCPUオンリーモードSBCにおいて、ハードウェアに配慮したモデル圧縮とカーネル最適化を実施した。
  • 入力解像度、バッチサイズ、モデル精度(FP32、FP16、INT8)を変化させたアブレーションスタディを実施した。
  • カスタムデータセットを用いたリアルタイム推論により、複数の設定下でのFPSを測定した。

実験結果

リサーチクエスチョン

  • RQ1最適化された推論パイプラインを用いた場合、Jetson NanoにおけるYOLOv4-tinyの最大FPSはどの程度達成可能か?
  • RQ2FP32、FP16、INT8といった異なる量子化レベルは、Jetson Nanoにおける精度と速度にどのように影響するか?
  • RQ3Raspberry Pi などのCPUオンリーモードSBCは、ソフトウェア最適化を用いることでリアルタイム推論(≥15 FPS)を達成できるか?
  • RQ4どのフレームワークとライブラリの組み合わせが、組み込みプラットフォームにおいて最良のFPS/精度トレードオフを実現するか?
  • RQ5モデルの入力解像度は、低消費電力SBCにおける推論速度とモデル効率にどのように影響するか?

主な発見

  • 最適化されたYOLOv4-tinyモデルは、INT8量子化とTensorRTを活用することで、Jetson Nanoで最大25 FPSを達成した。
  • Jetson NanoにおけるFP16推論は、FP32と比較して20%の速度向上を示し、精度の低下は最小限に抑えられた。
  • Raspberry Pi 4 などのCPUオンリーモードSBCでは、FP32推論で約10–12 FPSを達成し、INT8量子化により約15 FPSまで向上した。
  • モデル量子化は、モデルサイズとメモリ帯域幅の使用量を顕著に削減し、低性能デバイスにおけるスループット向上に寄与した。
  • GPUアクセラレーションありSBCでは、TensorRTがFPSを最大化する上で不可欠であり、ネイティブなPyTorchやDarknet推論を上回った。
  • Jetson Nanoでは、INT8量子化とTensorRT推論の組み合わせが、FPS/精度のバランスにおいて最良の結果をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。