Skip to main content
QUICK REVIEW

[論文レビュー] Busy-Quiet Video Disentangling for Video Classification

Guoxi Huang, Adrian G. Borş|arXiv (Cornell University)|Mar 29, 2021
Generative Adversarial Networks and Image Synthesis参考文献 54被引用数 5
ひとこと要約

本論文は、空間的・時間的周波数をフィルタリングすることで、動的背景コンテンツから忙しい動きの詳細を分離する新規なモーションバンドパスモジュール(MBPM)を提案する。これにより、2ストリームのビジー・クイエットネット(BQN)は、動きに重要な領域に対して高複雑度、静的領域に対して低複雑度で処理を行うことができる。BQNは周波数ドメインにおける動きフィルタリングと効率的なデュアルパスウェイ特徴抽出を活用することで、FLOPsを著しく削減しながら、Something-Something V1、Kinetics400、UCF101、HMDB51で最先端の精度を達成した。

ABSTRACT

In video data, busy motion details from moving regions are conveyed within a specific frequency bandwidth in the frequency domain. Meanwhile, the rest of the frequencies of video data are encoded with quiet information with substantial redundancy, which causes low processing efficiency in existing video models that take as input raw RGB frames. In this paper, we consider allocating intenser computation for the processing of the important busy information and less computation for that of the quiet information. We design a trainable Motion Band-Pass Module (MBPM) for separating busy information from quiet information in raw video data. By embedding the MBPM into a two-pathway CNN architecture, we define a Busy-Quiet Net (BQN). The efficiency of BQN is determined by avoiding redundancy in the feature space processed by the two pathways: one operating on Quiet features of low-resolution, while the other processes Busy features. The proposed BQN outperforms many recent video processing models on Something-Something V1, Kinetics400, UCF101 and HMDB51 datasets.

研究の動機と目的

  • 生のRGB動画における静的背景や滑らかなテクスチャの冗長な処理が引き起こす従来の動画モデルの非効率性を是正すること。
  • 空間的・時間的ドメインにおける低周波数で冗長な成分から、動き関連情報を分離する学習可能でエンド・ツー・エンドのメカニズムを構築すること。
  • 動きの内容に応じて計算リソースを適応的に割り当てる2パスウェイネットワークアーキテクチャ(ビジー・クイエットネット)を設計すること。
  • 動画データにおける周波数ドメインのスパarsityを活用することで、計算コストを低減しつつ動画分類の精度を向上させること。
  • オプティカルフローまたはフレーム要約に依存せずに、効率的かつリアルタイムの動き表現を可能にすること。

提案手法

  • モーションバンドパスモジュール(MBPM)は、周波数ドメインにおける学習可能なバンドパスフィルタを用いて動画シーケンスをフィルタリングし、高速に動くエッジや境界が符号化される特定の帯域を標的とする。
  • 3つの連続するRGBフレームごとに、MBPMは動きに必要なキューを保持しつつ時間的冗長性を低減した1つの代表フレームを出力する。
  • ビジー・クイエットネット(BQN)は2つの並列パスウェイを採用する:ビジー・ストリームはMBPMの出力から高解像度の動き特徴を処理し、クイエット・ストリームは静的コンテンツの低解像度・ダウンサンプリング表現を処理する。
  • バンドパスラテラルコネクション(BPLC)モジュールは2つのパスウェイ間の特徴を統合し、モデル最適化に不可欠なクロスパスウェイ情報交換を可能にする。
  • TSM-R50、X3D-M、I3Dなどの既存の3D CNNバックボーンと互換性があり、ステートオブザアートモデルへのプラグアンドプレイ統合を可能にする。
  • システム全体はエンド・ツー・エンドで学習可能であり、フレーム要約手法とは異なり、厳密な時間的順序を保持するため、長期的な時間的モデリングが可能である。

実験結果

リサーチクエスチョン

  • RQ1周波数ドメインフィルタリングを用いて、動画データ内の冗長な静的コンテンツから動き情報を効果的に分離できるか?
  • RQ2ビジーとクイエットな成分を分離することで、計算リソースを動きの内容に比例して割り当てることで、より効率的かつ正確な動画分類が可能になるか?
  • RQ3空間的・時間的周波数フィルタリングから得られる学習可能な動き表現が、オプティカルフローまたはフレームレベルの要約を上回る精度と効率性を達成できるか?
  • RQ4BPLCモジュールは2パスウェイアーキテクチャにおける特徴統合と全体のモデル性能をどの程度向上させるか?
  • RQ5提案手法は、既存の3D CNNと比較してFLOPsを削減しながら、標準ベンチマークで最先端の性能を達成できるか?

主な発見

  • TSM-R50をバックボーンにしたBQNは、Kinetics400で77.3%のトップ-1精度を達成し、I3Dより+6.2%、Oct-I3Dより+2.7%高いが、FLOPsは3.7倍少ない。
  • Something-Something V1では、TSM-R50をバックボーンにしたBQN 48fが54.3%のトップ-1精度を達成し、2番目に良い手法(TEA 16f)を+2.0%上回った。
  • アンサンブル版のBQN Enは、Something-Something V1でトップ-1精度57.1%、トップ-5精度84.2%を達成し、新たな最先端を樹立した。
  • X3D-Mをバックボーンに使用した場合、BQNは通常のX3D-Mと比較して4倍のフレームを処理しながら、FLOPsは50%しか増加しなかった。これは極めて優れた効率性を示している。
  • X3D-MをバックボーンにしたBQNは、TSM-R50 16fと比較して3.4%高いトップ-1精度を達成したが、計算複雑度はその14%にまで削減された。
  • UCF101とHMDB51では、TSM-R50をバックボーンにしたBQNが、それぞれ97.6%および77.6%の平均クラス精度を達成し、I3D(オプティカルフロー使用)を除くほとんどの手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。