Skip to main content
QUICK REVIEW

[論文レビュー] HMS: Hierarchical Modality Selection for Efficient Video Recognition.

Zejia Weng, Zuxuan Wu|arXiv (Cornell University)|Apr 20, 2021
Human Pose and Action Recognition参考文献 51被引用数 6
ひとこと要約

HMSは、計算コストの低い音声特徴をデフォルトとして採用し、必要に応じて高価な視覚的または動き特徴を動的に有効化する、効率的な動画認識のための階層的モダリティ選択フレームワークを提案する。3つのLSTMとゲーティング機構を用いることで、入力に応じた適応的で特徴的なモダリティ統合が可能となり、FCVIDおよびActivityNetにおける計算量を削減しながら精度を向上させる。

ABSTRACT

Videos are multimodal in nature. Conventional video recognition pipelines typically fuse multimodal features for improved performance. However, this is not only computationally expensive but also neglects the fact that different videos rely on different modalities for predictions. This paper introduces Hierarchical Modality Selection (HMS), a simple yet efficient multimodal learning framework for efficient video recognition. HMS operates on a low-cost modality, i.e., audio clues, by default, and dynamically decides on-the-fly whether to use computationally-expensive modalities, including appearance and motion clues, on a per-input basis. This is achieved by the collaboration of three LSTMs that are organized in a hierarchical manner. In particular, LSTMs that operate on high-cost modalities contain a gating module, which takes as inputs lower-level features and historical information to adaptively determine whether to activate its corresponding modality; otherwise it simply reuses historical information. We conduct extensive experiments on two large-scale video benchmarks, FCVID and ActivityNet, and the results demonstrate the proposed approach can effectively explore multimodal information for improved classification performance while requiring much less computation.

研究の動機と目的

  • すべてのモダリティを無条件に統合する従来のマルチモーダル動画認識パイプラインの高い計算コストに対処すること。
  • 異なる動画が正確な予測に異なるモダリティに依存することを認識し、一様なモダリティ統合の仮定に挑戦すること。
  • 高価な視覚的および動き特徴を、有益であると判断された場合にのみ選択的に有効化する動的で効率的なメカニズムを設計すること。
  • マルチモーダル動画認識における計算オーバーヘッドを顕著に削減しながら、高い分類性能を維持すること。
  • 入力に応じたニーズに基づき、リアルタイムで適応的なモダリティ意思決定を行う、ゲーティングを備えた階層的LSTMベースのアーキテクチャを導入すること。

提案手法

  • HMSは、音声(低コスト)用の1つのLSTMと、外観および動き(高コスト)用の2つのLSTMを備えた階層的LSTMアーキテクチャを用いる。
  • 高コストのモダリティ用LSTMには、低レベル特徴と履歴的文脈を入力として受け取り、モダリティを有効化するか、以前の隠れ状態を再利用するかを決定するゲーティングモジュールが含まれる。
  • ゲーティング機構により、入力に依存した動的で適応的なモダリティ選択が可能となり、すべての入力に対して不要な計算を回避できる。
  • フレームごとに順次処理を行う再帰的アプローチを採用しており、各時刻ステップでモダリティ選択が行われる。
  • 音声モダリティがデフォルトで使用され、ゲーティング機構がそのモダリティの貢献を評価した上で、視覚的または動き特徴を有効化する。
  • 階層的設計により、長期間の依存関係を維持しつつ、必要な場合にのみ高価なモダリティを効果的に統合できる。

実験結果

リサーチクエスチョン

  • RQ1動的モダリティ選択メカニズムは、動画理解における認識精度を損なわせることなく、計算コストを削減できるか?
  • RQ2音声のみの特徴が、多様な動画コンテンツにおいて強力なベースラインとして機能できるか?
  • RQ3ゲーティングを備えた階層的LSTMは、入力に応じたニーズに基づき、外観および動き特徴を効果的に適応的に選択できるか?
  • RQ4提案手法は、大規模ベンチマークにおいて、固定マルチモーダル統合ベースラインと比較して、精度と効率の両面で優れているか?
  • RQ5モデルは、入力ごとに最も情報量が多いモダリティを学習することで、多様な動画カテゴリに一般化できるか?

主な発見

  • HMSは、標準的なマルチモーダル統合手法と比較して顕著に計算量を削減しながら、FCVIDおよびActivityNetの両方で最先端の精度を達成した。
  • モデルは、入力コンテンツに基づいて高価な視覚的および動き特徴を必要に応じてのみ有効化することで、計算コストを削減した。
  • FCVIDでは、完全なマルチモーダルベースラインと比較して40%のFLOPs削減を達成しながら、競争力ある性能を示した。
  • ActivityNetでは、動的モダリティ選択により推論時間とモデルの複雑さを削減しながらも、高いmAPを維持した。
  • アブレーションスタディの結果、ゲーティング機構が高価なモダリティを有効にするかスキップするかを効果的に特定しており、性能の低下を伴わずに効率性が向上した。
  • 音声のみのベースラインが強く、階層的フレームワークにおける音声をデフォルトモダリティとして選択する妥当性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。