Skip to main content
QUICK REVIEW

[論文レビュー] DEEPEYE: A Compact and Accurate Video Comprehension at Terminal Devices Compressed with Quantization and Tensorization

Yuan Cheng, Guangya Li|arXiv (Cornell University)|May 21, 2018
Human Pose and Action Recognition参考文献 21被引用数 5
ひとこと要約

DEEPEYEは、リアルタイムのオブジェクト検出に8ビット量子化YOL​Oと、アクション認識にテンソル化RNNを統合することで、端末デバイス向けにコンパクトで高精度な動画理解システムを提案する。このフレームワークは、UCF11で16.58%の精度向上を達成し、15,047倍のパラメータ削減と2.87倍の高速化を実現した一方で、MOMENTSではフル精度YOL​Oと比較して0.47%以内のmAPを維持した。

ABSTRACT

As it requires a huge number of parameters when exposed to high dimensional inputs in video detection and classification, there is a grand challenge to develop a compact yet accurate video comprehension at terminal devices. Current works focus on optimizations of video detection and classification in a separated fashion. In this paper, we introduce a video comprehension (object detection and action recognition) system for terminal devices, namely DEEPEYE. Based on You Only Look Once (YOLO), we have developed an 8-bit quantization method when training YOLO; and also developed a tensorized-compression method of Recurrent Neural Network (RNN) composed of features extracted from YOLO. The developed quantization and tensorization can significantly compress the original network model yet with maintained accuracy. Using the challenging video datasets: MOMENTS and UCF11 as benchmarks, the results show that the proposed DEEPEYE achieves 3.994x model compression rate with only 0.47% mAP decreased; and 15,047x parameter reduction and 2.87x speed-up with 16.58% accuracy improvement.

研究の動機と目的

  • リソース制約のある端末デバイスに大規模な動画理解モデルをデプロイする課題に対処すること。
  • オブジェクト検出とアクション認識を別々に最適化する従来手法の限界を克服すること。
  • 高精度を維持しながらモデルサイズと推論時間を著しく削減する統合フレームワークの開発。
  • 量子化とテンソル化技術を統合して、顕著な精度損失なしにYOL​OおよびRNNのコンponentsを圧縮すること。
  • 検出と認識パイプラインのエンドツーエンド最適化により、エッジデバイスでのリアルタイム動画分析を可能にすること。

提案手法

  • YOL​Oに8ビットのトレーニング後量子化を適用し、モデルのサイズと計算コストを削減しながらも、精度を維持する。
  • YOL​Oの出力から特徴量を抽出し、それらをテンソル化RNN(T-RNN)に供給して動画分類のための時系列モデリングを実行する。
  • Tucker分解を用いて、RNNの重み行列を高次元テンソルを低ランク成分に分解することで圧縮する。
  • 量子化YOL​Oからの特徴量を用いてT-RNNをエンドツーエンドで学習させ、検出と認識の共同最適化を可能にする。
  • YOL​Oには量子化、RNNにはテンソル化を適用するハイブリッドアプローチにより、パラメータ数を削減し、推論を高速化する。
  • 量子化YOL​Oとテンソル化RNNを1つのパイプラインに統合し、遅延とメモリ使用量を最小限に抑えることで、統合的動画理解を実現する。

実験結果

リサーチクエスチョン

  • RQ18ビット量子化YOL​Oは、端末デバイスへのデプロイを可能にしつつも、高い検出精度を維持できるか?
  • RQ2YOL​Oからの特徴量を用いて、テンソル化RNNが動画シーケンスを効果的にモデリングし、モデルの複雑さを低減できるか?
  • RQ3量子化YOL​Oとテンソル化RNNを組み合わせることで、モデルの圧縮と推論速度の向上が顕著に得られるか?
  • RQ4統合されたシステムは、エッジデバイス上でリアルタイム動画理解を実現するための高精度と低遅延を両立できるか?
  • RQ5標準的な動画ベンチマークにおいて、提案フレームワークはパラメータ数、速度、精度の点でベースラインモデルと比較してどのように差をつけるか?

主な発見

  • MOMENTSデータセットでは、DEEPEYEがmAPを0.47%低下させるだけで3.994倍のモデル圧縮率を達成した。
  • UCF11データセットでは、DEEPEYEはパラメータ数を15,047倍削減し、単純なRNNベースラインと比較して16.58%の精度向上を達成した。
  • フル精度YOL​Oベースラインと比較して、学習推論時間で2.87倍の高速化を実現した。
  • 8ビット量子化YOL​O(Q-YOLO)は、mAPが0.5350に保たれ、フル精度YOL​Oの0.5397と比較してわずか0.47%の低下にとどまった。
  • Q-YOLOからの特徴量を入力とするテンソル化RNNは、UCF11で86.09%の精度を達成し、単純なRNN(69.51%)やフレーム入力のT-RNN(79.98%)を上回った。
  • 提案フレームワークにより、入力から隠れ層へのマッピングのパラメータ数は58.98Mからたったの3,920にまで削減され、15,047倍の圧縮が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。