Skip to main content
QUICK REVIEW

[論文レビュー] Ultra-Efficient On-Device Object Detection on AI-Integrated Smart Glasses with TinyissimoYOLO

Julian Moosmann, Pietro Bonazzi|arXiv (Cornell University)|Nov 2, 2023
Advanced Memory and Neural Computing被引用数 4
ひとこと要約

本稿では、AI統合スマートグラス向けに超効率的なデバイス内オブジェクト検出を最適化した、100万パラメータ未塔のYOLOベースニューラルネットワーク「TinyissimoYOLO」を提示する。GAP9 RISC-Vプロセッサ上で動作させたところ、18 FPSの性能を達成し、エンドツーエンドの遅延が56ms、消費電力は62.9mWに抑えられ、154mAhのバッテリで最大9.3時間の連続動作が可能となった。これにより、同様のハードウェア環境において先行研究を上回る性能を発揮した。

ABSTRACT

Smart glasses are rapidly gaining advanced functions thanks to cutting-edge computing technologies, especially accelerated hardware architectures, and tiny Artificial Intelligence (AI) algorithms. However, integrating AI into smart glasses featuring a small form factor and limited battery capacity remains challenging for a satisfactory user experience. To this end, this paper proposes the design of a smart glasses platform for always-on on-device object detection with an all-day battery lifetime. The proposed platform is based on GAP9, a novel multi-core RISC-V processor from Greenwaves Technologies. Additionally, a family of sub-million parameter TinyissimoYOLO networks are proposed. They are benchmarked on established datasets, capable of differentiating up to 80 classes on MS-COCO. Evaluations on the smart glasses prototype demonstrate TinyissimoYOLO's inference latency of only 17ms and consuming 1.59mJ energy per inference. An end-to-end latency of 56ms is achieved which is equivalent to 18 frames per seconds (FPS) with a total power consumption of 62.9mW. This ensures continuous system runtime of up to 9.3 hours on a 154mAh battery. These results outperform MCUNet (TinyNAS+TinyEngine), which runs a simpler task (image classification) at just 7.3 FPS, while the 18 FPS achieved in this paper even include image-capturing, network inference, and detection post-processing. The algorithm's code is released open with this paper and can be found here: https://github.com/ETH-PBL/TinyissimoYOLO

研究の動機と目的

  • 最小限の消費電力と長時間のバッテリ駆動を実現する、スマートグラス上で常にオンのデバイス内オブジェクト検出を可能にすること。
  • 小型のフォームファクタを有するバッテリ駆動のリソース制限付きウェアラブルデバイスに、複雑なAIモデルをデプロイする課題に対処すること。
  • RISC-Vベースのシステムにおける超低消費電力エッジ推論に特化した、極めて効率的なニューラルネットワークアーキテクチャを設計すること。
  • 厳密なエネルギー予算内で、画像取得、推論、ポストプロセッシングを統合したリアルタイム性能(18 FPS)を達成すること。
  • スマートグラスを対象に、ハードウェア、モデルアーキテクチャ、ソフトウェアスタックを共同最適化することで、エンドツーエンドのシステム効率を実証すること。

提案手法

  • エッジデプロイに特化した、100万パラメータ未満のコンパクトなYOLOベースモデルのファミリー「TinyissimoYOLO」を提案した。
  • モデルサイズと計算コストを最小限に抑えるために、ニューラルアーキテクチャサーチとモデル圧縮技術を活用した。
  • TinyissimoYOLOモデルをGAP9マルチコアRISC-Vプロセッサに統合し、その超低消費電力特性を活かしてデバイス内推論を実現した。
  • エンドツーエンドの遅延予算56ms以内に収めるために、画像取得、モデル推論、ポストプロセッシングを含む全推論パイプラインを最適化した。
  • 動的および静的消費電力を低減するために、エネルギーに配慮したモデル量子化とハードウェアに配慮したモデルコンパイルを採用した。
  • MS-COCOデータセットを用いて、物理的スマートグラスプロトタイプ上でシステムを検証した。1インスタンスあたり1.59mJのエネルギー消費で、80クラスの検出を達成した。

実験結果

リサーチクエスチョン

  • RQ1100万パラメータ未満のYOLOベースモデルが、超低消費電力で動作するスマートグラスプラットフォームで、リアルタイムのオブジェクト検出(≥18 FPS)を達成できるか?
  • RQ2同様のハードウェア環境において、エンドツーエンドのシステム遅延とエネルギー効率は、既存のエッジAIソリューションと比較してどの程度優れているか?
  • RQ3モデル圧縮とハードウェアに配慮したニューラルアーキテクチャサーチによって、モデルサイズと推論エネルギーをどれだけ削減できるか、精度を損なわずに行えるか?
  • RQ4画像取得、推論、ポストプロセッシングを含む全パイプラインが、154mAhのバッテリで9.3時間の連続動作を実現するために、56ms以内に収まるか?
  • RQ5実際のスマートグラスプロトタイプにデプロイした場合、TinyissimoYOLOはMS-COCOデータセットでどの程度の精度と推論速度を達成できるか?

主な発見

  • TinyissimoYOLOは、スマートグラスプロトタイプ上で18 FPS、エンドツーエンド遅延56msを達成し、リアルタイムオブジェクト検出を実現した。
  • システムの総消費電力はたったの62.9mWであり、154mAhのバッテリで最大9.3時間の連続動作が可能となった。
  • 1回の推論あたりエネルギー消費はわずか1.59mJであり、デバイス内オブジェクト検出において顕著なエネルギー効率を示した。
  • モデルはMS-COCOデータセットで最大80のオブジェクトクラスを認識でき、そのコンパクトさにもかかわらず高い精度を維持した。
  • 画像分類のみを実行するMCUNet(7.3 FPS)と比較して、より高いフレームレートを達成しながら、画像取得・推論・ポストプロセッシングを含むより複雑なタスクを処理できた。
  • モデルコードのオープンソースリリースにより、エッジAI研究分野における再現性の確保とさらなる最適化が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。