Skip to main content
QUICK REVIEW

[論文レビュー] Towards Real-Time Action Recognition on Mobile Devices Using Deep Models

Chen-Lin Zhang, Xinxin Liu|arXiv (Cornell University)|Jun 17, 2019
Human Pose and Action Recognition参考文献 34被引用数 8
ひとこと要約

本論文は、効率的なディープラーニングモデルを活用し、時系列シフトモジュール(TSM)と圧縮・拡張(SE)モジュールを組み合わせることで、6倍少ないFLOPsと推論時間で最先端の精度を達成する、モバイルデバイス向けのリアルタイム行動認識フレームワークを提案している。本論文は、深層行動認識モデルをモバイル端末に初めて成功裏にデプロイした。Huawei Mate 10では、ジェスチャー認識において約10 FPSを達成した。

ABSTRACT

Action recognition is a vital task in computer vision, and many methods are developed to push it to the limit. However, current action recognition models have huge computational costs, which cannot be deployed to real-world tasks on mobile devices. In this paper, we first illustrate the setting of real-time action recognition, which is different from current action recognition inference settings. Under the new inference setting, we investigate state-of-the-art action recognition models on the Kinetics dataset empirically. Our results show that designing efficient real-time action recognition models is different from designing efficient ImageNet models, especially in weight initialization. We show that pre-trained weights on ImageNet improve the accuracy under the real-time action recognition setting. Finally, we use the hand gesture recognition task as a case study to evaluate our compact real-time action recognition models in real-world applications on mobile phones. Results show that our action recognition models, being 6x faster and with similar accuracy as state-of-the-art, can roughly meet the real-time requirements on mobile devices. To our best knowledge, this is the first paper that deploys current deep learning action recognition models on mobile devices.

研究の動機と目的

  • 重いデータオーグメンテーションを伴わない、従来のサーバー基盤の設定とは異なる、モバイルデバイスにおけるリアルタイム行動認識の推論設定を再定義すること。
  • リアルタイム制約下でのモバイルハードウェア上で、最先端の行動認識モデルを実証的に評価すること。
  • FLOPsとレイテンシを大幅に削減しながらも高い精度を維持する、コンactで効率的なモデルを設計すること。
  • 特に手のジェスチャー認識を含む実世界のモバイルアプリケーションにおいて、アプローチの有効性を検証すること。
  • ImageNetモデル最適化の原則とは異なる、効率的なリアルタイム行動認識モデルの設計インサイトを提供すること。

提案手法

  • 効率性とモバイル環境適合性の観点から、ベースアーキテクチャとしてMnasNetを採用した。
  • FLOPコストゼロでフレーム間の特徴量交換を可能にする時系列シフトモジュール(TSM)を統合し、時間的モデリングを強化した。
  • チャネルごとの特徴応答を再キャリブレーションすることで表現力向上を図る、圧縮・拡張(SE)モジュールを追加した。
  • 一般化と精度向上を図るため、ImageNetおよびKineticsの両方で共同事前学習を実施した。
  • 25エポック、学習率の段階的低下を用いて、ジェスチャー認識のためのJesterデータセットで微調整を行った。
  • バッチ処理(8フレームクリップ)と逐次フレーム入力の2つの入力モードを用い、リアルタイム推論を模擬した評価を実施した。

実験結果

リサーチクエスチョン

  • RQ1重いデータオーグメンテーションを伴わないリアルタイムモバイル推論設定下で、最先端の行動認識モデルの性能はどのように変化するか?
  • RQ2ImageNetで事前学習された重みは、モバイルデバイスにおけるリアルタイム行動認識の精度向上にどのような役割を果たすか?
  • RQ3TSMやSEのような追加モジュールは、コンパクトモデルにおける精度、FLOPs、推論レイテンシにどのように影響を与えるか?
  • RQ4画像分類向けに設計された効率的モデルは、モバイルプラットフォーム上での動画行動認識に効果的に適応可能か?
  • RQ5効率的なImageNetモデルと効率的なリアルタイム行動認識モデルの間には、モデル設計の原則にどのような相違があるか?

主な発見

  • TSMおよびSEモジュールを搭載したMnasNetは、Kinetics検証セットでトップ1精度66.5%を達成し、ベースラインMnasNet(60.7%)と比較して5.8%の向上を示したが、FLOPsと推論時間は6倍削減された。
  • ImageNetおよびKineticsの両方で事前学習したモデルは、Kineticsでのみ学習したモデルを上回り、リアルタイム設定下でもKinetics精度とImageNet精度の相関が強く見られた。
  • コンパクトモデルでは過学習が深刻な問題であったが、これはImageNet設定とは対照的であり、過学習が顕著に現れない傾向とは逆であった。
  • Inceptionのようなブランチアーキテクチャは有効であったが、FLOP数が同程度であっても、モバイルデバイス上でのCPUレイテンシが高かった。
  • HUAWEI Mate 10における逐次推論では、約10 FPS(1フレームあたり90.24ms)を達成し、ジェスチャー認識のリアルタイム要件を満たした。
  • 提案モデルは、ResNet-50と比較して20%のレイテンシ、10%のFLOPsでJesterデータセットで93.7%の精度を達成し、優れた効率-精度トレードオフを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。