Skip to main content
QUICK REVIEW

[論文レビュー] Learning Efficient Video Representation with Video Shuffle Networks

Pingchuan Ma, Yao Zhou|arXiv (Cornell University)|Nov 26, 2019
Human Pose and Action Recognition参考文献 48被引用数 4
ひとこと要約

本稿では、チャネル単位のグループ化と時間的シャッフルを用いて特徴マップをフレーム間で再編成することで、標準的な2次元畳み込みニューラルネットワークが時空間表現を学習できる、パラメータフリーでプラグイン可能なモジュールであるVideo Shuffle Networks (VSN) を提案する。本手法は、追加のパラメータやFLOPsを一切追加せずに、Something-Something-V1/V2およびMoments in Timeで最先端の性能を達成し、2D CNNベースラインよりも顕著に精度を向上させつつ、低遅延を維持する。

ABSTRACT

3D CNN shows its strong ability in learning spatiotemporal representation in recent video recognition tasks. However, inflating 2D convolution to 3D inevitably introduces additional computational costs, making it cumbersome in practical deployment. We consider whether there is a way to equip the conventional 2D convolution with temporal vision no requiring expanding its kernel. To this end, we propose the video shuffle, a parameter-free plug-in component that efficiently reallocates the inputs of 2D convolution so that its receptive field can be extended to the temporal dimension. In practical, video shuffle firstly divides each frame feature into multiple groups and then aggregate the grouped features via temporal shuffle operation. This allows the following 2D convolution aggregate the global spatiotemporal features. The proposed video shuffle can be flexibly inserted into popular 2D CNNs, forming the Video Shuffle Networks (VSN). With a simple yet efficient implementation, VSN performs surprisingly well on temporal modeling benchmarks. In experiments, VSN not only gains non-trivial improvements on Kinetics and Moments in Time, but also achieves state-of-the-art performance on Something-Something-V1, Something-Something-V2 datasets.

研究の動機と目的

  • 3D CNNの動画認識における高い計算コストを低減しつつ、強力な時間的モデリング能力を維持すること。
  • カーネルサイズを拡大したり、学習可能なパラメータを追加したりせずに、標準的な2D CNNが時間的依存関係を学習できるようにすること。
  • 軽量で汎用的かつ効率的なコンponentを設計し、既存の2D動画モデルにスムーズに統合できること。
  • 推論遅延を増加させることなく、長距離および微細な行動認識ベンチマークでの性能を向上させること。

提案手法

  • 各フレームの特徴チャネルを等しいサイズのグループに分割し、同じインデックスを持つグループ特徴を時間次元に沿って積み上げることで、時間フレーム間で再編成するパラメータフリーな操作「ビデオシャッフル」を導入する。
  • 残差ブロック内の2D畳み込みの前後でビデオシャッフルを適用し、2D畳み込みがグローバルな時空間的文脈にアクセスできるようにする。
  • 時間的モデリング後に元の空間的特徴レイアウトに回復させる逆シャッフル操作を用い、標準的な2D CNNアーキテクチャとの互換性を確保する。
  • ベースモデルとしてResNet-50およびResNet-101を用い、TSNフレームワークにビデオシャッフルを統合する。
  • 時間的モデリングを最適化するために、特定の位置にビデオシャッフルを挿入する2種類の残差ブロック変種(headtailおよびcompact)を設計する。
  • RGB入力を用いてエンドツーエンドで学習し、Kinetics、Moments in Time、Something-Somethingデータセットで評価する。

実験結果

リサーチクエスチョン

  • RQ1パラメータやFLOPsを増加させずに、2D畳み込みを効果的に時間的依存関係をモデル化できるように拡張できるか?
  • RQ2時間的シフトや3D畳み込みといった既存の時間的モデリングモジュールと比較して、提案手法のビデオシャッフル操作は性能と効率性においてどのように差をつけるか?
  • RQ32D CNN内での時間的モデリングに最適なビデオシャッフルブロックの配置と数は何か?
  • RQ4ビデオシャッフルは、Something-Something-V1/V2のような挑戦的な時間的行動認識ベンチマークで最先端の性能を達成できるか?

主な発見

  • VSN-R50はSomething-Something-V2でトップ1精度44.5%を達成し、前回の最先端を2.1%上回り、追加パラメータやFLOPsなしで実現した。
  • VSN-R101はSomething-Something-V2で46.5%の精度を達成し、ベースラインのTSN-ResNet-101を23.8ポイントも上回った。
  • Kineticsでは、VSN-R50はベースラインのTSN-ResNet-50よりも2.0%の精度向上を達成し、VSN-R101は75.4%の精度を記録、ベースラインより2.6%向上した。
  • VSNは低遅延を維持しており、VSN-R50では16.5ms、VSN-R101では28.7msの遅延を記録し、それぞれ秒間79.5および47.2フレームを処理可能で、I3Dを13倍高速に達成した。
  • コンパクトな残差ブロックバージョンは、Kineticsでheadtailバージョンを2.0%、Something-Something-V1で26.4%上回り、より優れた設計選択であることを示した。
  • ビデオシャッフルと時間的シフトモジュールを組み合わせると、最高の精度(Kineticsで73.5%、Sth-V1で46.6%)が達成され、相補的な強みを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。