Skip to main content
QUICK REVIEW

[論文レビュー] Towards Training Stronger Video Vision Transformers for EPIC-KITCHENS-100 Action Recognition

Ziyuan Huang, Zhiwu Qing|arXiv (Cornell University)|Jun 9, 2021
Human Pose and Action Recognition参考文献 24被引用数 8
ひとこと要約

本論文は、EPIC-KITCHENS-100データセット上でVideo Vision Transformers (ViViT)の包括的なトレーニングレシピを提示し、最適化されたデータ拡張、解像度スケジューリング、初期化により、元のViViTよりも3.4%高い47.4%のアクション認識精度を達成した。著者らはさらに、ViViTと畳み込みネットワーク(例:ir-CSN-152)をアンサンブルすることで性能を向上させ、アクション認識で48.5%、動詞認識で69.2%、名詞認識で60.3%の最終テスト精度を達成した。

ABSTRACT

With the recent surge in the research of vision transformers, they have demonstrated remarkable potential for various challenging computer vision applications, such as image recognition, point cloud classification as well as video understanding. In this paper, we present empirical results for training a stronger video vision transformer on the EPIC-KITCHENS-100 Action Recognition dataset. Specifically, we explore training techniques for video vision transformers, such as augmentations, resolutions as well as initialization, etc. With our training recipe, a single ViViT model achieves the performance of 47.4\% on the validation set of EPIC-KITCHENS-100 dataset, outperforming what is reported in the original paper by 3.4%. We found that video transformers are especially good at predicting the noun in the verb-noun action prediction task. This makes the overall action prediction accuracy of video transformers notably higher than convolutional ones. Surprisingly, even the best video transformers underperform the convolutional networks on the verb prediction. Therefore, we combine the video vision transformers and some of the convolutional video networks and present our solution to the EPIC-KITCHENS-100 Action Recognition competition.

研究の動機と目的

  • 元の報告結果を超えて、EPIC-KITCHENS-100のアクション認識ベンチマークにおけるVideo Vision Transformers (ViViT)の性能を向上させること。
  • データ拡張、入力解像度、事前学習初期化、モデルアーキテクチャが、動画理解におけるViViT性能に与える影響を調査すること。
  • ViViTが動詞予測で弱い性能を示すという限界を補うために、畳み込み動画ネットワーク(例:ir-CSN-152、SlowFast)と組み合わせ、補完的な予測を実現すること。
  • ViViTの強み(名詞予測が優れている)と畳み込みモデルの強み(動詞予測が優れている)を活かした、包括的なアンサンブル戦略を構築し、全体のアクション認識精度を最大化すること。

提案手法

  • ImageNet-21kの教師付き重みを用いて事前学習されたViViT-B/16x2を、Kinetics 400、Kinetics 700、Something-Something-V2で微調整し、AdamW最適化法とコサイン学習率スケジューリングを用いた。
  • 一般化を向上させるために、色のジャマ、mixup、cutmix、ランダムエラージング、ラベルスムージングなどのデータ拡張戦略を適用した。
  • 224×224、320×320、384×384の入力解像度を検討し、バリデーションセットでの性能向上のため384×384解像度が最適であると判明した。
  • 因子分解された動画トランスフォーマーエンコーダーを用い、2.5エポックの学習率ウォームアップと0.1の重み減衰で学習を実施した。
  • ir-CSN-152モデルに長期特徴バンク(LFB)を適用し、事前学習済みViViTの特徴を初期化に用いて、名詞予測を強化した。
  • 複数のモデル(ViViT、ir-CSN-152、SlowFast)を、複数のビューからの予測を平均化することでアンサンブルし、最終的な精度を向上させた。

実験結果

リサーチクエスチョン

  • RQ1異なるデータ拡張戦略は、EPIC-KITCHENS-100データセットにおけるVideo Vision Transformersの性能にどのように影響するか?
  • RQ2ViViTの動画アクション認識性能を最大化するための最適な入力解像度と事前学習初期化戦略は何か?
  • RQ3ViViTは名詞と全体のアクション認識性能が優れているにもかかわらず、なぜ動詞予測で畳み込みネットワークに劣るのか?
  • RQ4ViViTを畳み込み動画ネットワークとアンサンブルすることで、EPIC-KITCHENS-100における最終的なアクション認識精度を顕著に向上させられるか?

主な発見

  • 提案されたトレーニングレシピで微調整された単一のViViTモデルは、EPIC-KITCHENS-100バリデーションセットで47.4%のアクション認識精度を達成し、元のViViTより3.4%高い性能を示した。
  • ViViTは名詞予測(59.6%)で優れた性能を示した一方で、動詞予測(68.4%)では劣位にあり、アクションの対象を識別する能力の強みが顕著に現れた。
  • ir-CSN-152 や SlowFast-16×8-101 といった畳み込みネットワークは、動詞予測でViViTを上回り、特に後者は68.4%の動詞認識精度を達成した。
  • ViViT特徴を用いた長期特徴バンク(LFB)の使用により、ir-CSN-152の名詞予測精度が55.9%から60.3%に向上し、アクション認識性能が顕著に向上した。
  • 最良の性能を示したViViTと畳み込みモデルをアンサンブルすることで、最終テスト精度としてアクション認識で48.5%、動詞認識で69.2%、名詞認識で60.3%を達成した。
  • 入力解像度を384×384に引き上げることでバリデーション精度は向上したが、畳み込みモデルではテスト精度に寄与しなかったため、推論では224×224を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。