Skip to main content
QUICK REVIEW

[論文レビュー] An Image Classifier Can Suffice For Video Understanding.

Quanfu Fan, Chun-Fu Chen|arXiv (Cornell University)|Jun 26, 2021
Human Pose and Action Recognition参考文献 47被引用数 6
ひとこと要約

この論文は、動画の行動認識を明示的な時空間的モデリングを伴わない画像分類タスクとして扱う、画期的なアプローチを提案する。動画フレームを『スーパーアイテム』に合成し、事前学習済みの画像分類器を適用することで、Kinetics400、Something-Want-What (V2)、MiT、Jesterで強力な性能を達成し、複雑な時空間的モデリングに依存する最先端の手法と同等の性能を発揮する。

ABSTRACT

We propose a new perspective on video understanding by casting the video recognition problem as an image recognition task. We show that an image classifier alone can suffice for video understanding without temporal modeling. Our approach is simple and universal. It composes input frames into a super image to train an image classifier to fulfill the task of action recognition, in exactly the same way as classifying an image. We prove the viability of such an idea by demonstrating strong and promising performance on four public datasets including Kinetics400, Something-to-something (V2), MiT and Jester, using a recently developed vision transformer. We also experiment with the prevalent ResNet image classifiers in computer vision to further validate our idea. The results on Kinetics400 are comparable to some of the best-performed CNN approaches based on spatio-temporal modeling. our code and models will be made available at this https URL.

研究の動機と目的

  • 時空間的モデリングを明示的に行わない画像分類器のみを用いて、動画理解が可能かどうかを調査すること。
  • フレームをスーパーアイテムに合成することの行動認識における有効性を評価すること。
  • 画像分類器の動画データに対する性能を、確立された時空間的モデルと比較すること。
  • Kinetics400、Something-Want-What (V2)、MiT、Jesterを含む多様な動画データセットにおいて、本手法の有効性を検証すること。

提案手法

  • 入力の動画フレームを、空間的および時間的順序を保持したまま、1つの合成画像(『スーパーアイテム』と呼ばれる)に配置する。
  • 事前学習済みのビジョントランスフォーマーやResNetの画像分類器を、行動認識の目的でスーパーアイテム表現上で微調整する。
  • 3次元畳み込みや再帰型ネットワークのような、明示的な時系列ダイナミクスのモデリングを一切回避する。
  • 本手法は普遍的であり、任意の画像分類器アーキテクチャと互換性を持つ。
  • トレーニングおよび推論をスーパーアイテム上でエンドツーエンドで実行し、動画を1つの画像入力として扱う。
  • 標準ベンチマークを用いて、複数の公開動画データセットで本手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1明示的な時空間的モデリングなしに、画像分類器のみで動画内の行動を認識できるか?
  • RQ2時空間的モデリングに特化したモデルと比較して、スーパーアイテムに基づく画像分類器の動画行動認識性能はどの程度か?
  • RQ3本手法は、行動の複雑さやフレームレートが異なる多様な動画データセットに一般化できるか?
  • RQ4画像分類器の選択(例:ビジョントランスフォーマー対ResNet)が、動画理解タスクの性能にどの程度影響を与えるか?

主な発見

  • スーパーアイテムアプローチは、明示的な時空間的モデリングを用いる最先端のCNNベースの手法と同等の性能をKinetics400で達成する。
  • 本手法は、Kinetics400、Something-Want-What (V2)、MiT、Jesterを含む複数のデータセットにおいて、強力な一般化性能を示す。
  • ビジョントランスフォーマーを画像分類器として使用すると特に優れた結果が得られ、現代の自己注意ベースのアーキテクチャと高い相性であることが示された。
  • 3次元畳み込みや再帰的コンponentsを必要としないモデルと比較して、大幅に構造的複雑性が低減された上で、競争力のある正確性を達成した。
  • フレームの合成と強力な画像分類器の効果的利用があれば、時空間的モデリングが厳密に必要ではないことが結果から裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。