[論文レビュー] Revisiting 3D ResNets for Video Recognition
本稿では、動画行動認識のためのスケーリングおよびトレーニングを施した3D ResNetの変種、R3D-RSを提案する。改善されたトレーニング戦略、軽量なアーキテクチャ的変更(ResNet-Dスタム、Squeeze-and-Excitation、セルフゲーティング)および深さと時間的分解能の同時スケーリング規則を用いる。学習を初期化して実行した場合、Kinetics-400で81.0%、Kinetics-600で83.8%のトップ1精度を達成し、Web Video Textデータで事前学習した場合、それぞれ83.5%および84.3%の精度を達成した。
A recent work from Bello shows that training and scaling strategies may be more significant than model architectures for visual recognition. This short note studies effective training and scaling strategies for video recognition models. We propose a simple scaling strategy for 3D ResNets, in combination with improved training strategies and minor architectural changes. The resulting models, termed 3D ResNet-RS, attain competitive performance of 81.0 on Kinetics-400 and 83.8 on Kinetics-600 without pre-training. When pre-trained on a large Web Video Text dataset, our best model achieves 83.5 and 84.3 on Kinetics-400 and Kinetics-600. The proposed scaling rule is further evaluated in a self-supervised setup using contrastive learning, demonstrating improved performance. Code is available at: https://github.com/tensorflow/models/tree/master/official.
研究の動機と目的
- 現代的なトレーニング戦略およびスケーリング戦略が、3D ResNetの動画認識ベンチマークにおける性能を顕著に向上させることを調査すること。
- 軽量なアーキテクチャ的変更(ResNet-Dスタム、Squeeze-and-Excitation、セルフゲーティング)が3D ResNetの精度に与える影響を評価すること。
- モデルの深さと入力の時間的分解能を同時に増やすシンプルで効果的なスケーリング規則を構築・検証すること。
- 大規模なウェブ動画データセットでの事前学習および自己教師付きコントラスト学習による性能向上の程度を評価すること。
提案手法
- ベースラインとして3D ResNet(R3D)を採用し、最初の層に5×3×3カーネル、次の2層に1×3×3カーネルを用いた3D ResNet-Dスタムを適用することで、時間的次元における特徴抽出を向上させる。
- 3Dグローバル平均プーリングを用い、チャネルごとの特徴を0.25の比率で再キャリブレーションする3D Squeeze-and-Excitationモジュールを導入する。
- 各SEブロックの後にセルフゲーティングモジュールを組み込み、学習可能なアテンションにより特徴表現をさらに精緻化する。
- モデルの深さ(50から200に)と入力フレーム数(32から48に)を同時に増やすことで、スパatiotemporalモデリングを向上させる共同スケーリング規則を採用する。
- データオーグメンテーション(RandAugment、スケールジッタリング)、ラベルスムージング(0.1)、重み減衰(4e-5)、確率的ドロップアウト(初期ドロップ率0.2)、および350エポックにまで延長されたトレーニングを用いる。
- Kinetics-400で800エポックにわたりCVRLを用いた自己教師付き事前学習を実施し、線形評価を用いて転移性能を評価する。
実験結果
リサーチクエスチョン
- RQ1改善されたトレーニング戦略および軽量なアーキテクチャ的変更が、3D ResNetの動画認識ベンチマークにおける性能に与える影響は何か?
- RQ2モデルの深さと入力の時間的分解能を同時にスケーリングするシンプルな規則が、3D ResNetsにおける標準的なスケーリングを上回る性能を発揮できるか?
- RQ3大規模なウェブ動画データセットでの事前学習および自己教師付きコントラスト学習による3D ResNet-RSの性能向上は、どの程度のものか?
- RQ4アーキテクチャ的およびトレーニングの改善による性能向上は、より高いモデルの深さに達するまで持続するのか?
主な発見
- R3D-RS-50は、学習を初期化して実行した場合、Kinetics-400で78.2%のトップ1精度を達成し、R3D-50ベースラインから+3.8%の向上を示した。
- R3D-RS-200は、事前学習なしでKinetics-400で81.0%、Kinetics-600で83.8%のトップ1精度に到達し、初期化からの強力な性能を示した。
- Web Video Text(WVT)データセットで事前学習した場合、R3D-RS-200はKinetics-400で83.5%、Kinetics-600で84.3%の精度に到達し、大規模な事前学習による顕著な向上を示した。
- Kinetics-400で自己教師付き事前学習を実施した結果、線形評価精度はR3D-RS-50の66.1%からR3D-RS-270の67.5%に向上したが、R3D-RS-200以降は収束傾向を示した。
- 入力フレーム数を32から48に増やすことで、精度が+0.3%向上したが、R3D-RS-200を超えてモデルの深さを増やすと性能が劣化した。
- RandAugment、ラベルスムージングなどの改善されたトレーニング戦略と、SE、セルフゲーティング、Dスタムといったアーキテクチャ的変更の組み合わせにより、R3D-50ベースラインから+1.0%の向上が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。