Skip to main content
QUICK REVIEW

[論文レビュー] Non-local NetVLAD Encoding for Video Classification

Yongyi Tang, Xing Zhang|arXiv (Cornell University)|Sep 29, 2018
Human Pose and Action Recognition参考文献 28被引用数 9
ひとこと要約

本論文は、YouTube-8M向けに非ローカルNetVLAD符号化を用いたコン act な1モデル型動画分類システムを提案する。非ローカルブロックをNetVLADに統合することで特徴表現を向上させ、1GBのモデルサイズ制約の下でbfloat16量子化、モデル平均化、アンサンブル技術を活用し、パブリックテストセットで0.88763のGAP@20を達成。2回目のYouTube-8Mチャレンジで4位を記録した。

ABSTRACT

This paper describes our solution for the 2$^ ext{nd}$ YouTube-8M video understanding challenge organized by Google AI. Unlike the video recognition benchmarks, such as Kinetics and Moments, the YouTube-8M challenge provides pre-extracted visual and audio features instead of raw videos. In this challenge, the submitted model is restricted to 1GB, which encourages participants focus on constructing one powerful single model rather than incorporating of the results from a bunch of models. Our system fuses six different sub-models into one single computational graph, which are categorized into three families. More specifically, the most effective family is the model with non-local operations following the NetVLAD encoding. The other two family models are Soft-BoF and GRU, respectively. In order to further boost single models performance, the model parameters of different checkpoints are averaged. Experimental results demonstrate that our proposed system can effectively perform the video classification task, achieving 0.88763 on the public test set and 0.88704 on the private set in terms of GAP@20, respectively. We finally ranked at the fourth place in the YouTube-8M video understanding challenge.

研究の動機と目的

  • YouTube-8Mチャレンジにおける1GBモデルサイズ制約下で、コンパクトで1モデル型の動画分類システムを開発すること。
  • 長距離時系列モデリングを向上させるために、非ローカル演算をNetVLADプーリングに統合し、動画特徴表現を改善すること。
  • 確率的重み平均化とランダム特徴量サブサンプリングを用いた複数回の推論を活用し、1モデルの性能を向上させること。
  • bfloat16パラメータ量子化と計算グラフ統合を活用し、1GB制限内で効果的なモデルアンサンブルを実現すること。
  • 重いモデルアンサンブルに依存せずに競争力のある性能を達成することで、実世界への展開に実用的なシステムを実現すること。

提案手法

  • 非ローカルブロックをNetVLADプーリングの直後にスタックすることで、動画特徴の長距離依存性を捉える非ローカルNetVLADを導入する。
  • 従来のVLADにおけるハードクラスタリングに代わって、微分可能学習を可能にするソフトアサインメントを採用する。
  • bfloat16フォーマットを用いることでモデルサイズを半減させ、精度の著しい低下を伴わずに、1GB制限内でより多くのアンサンブルを可能にする。
  • 複数のチェックポイント間で線形モデル平均化を適用し、個々のモデルの汎化性能とロバスト性を向上させる。
  • ランダム特徴量サブサンプリングを伴う複数回のフォワードパスを実行し、予測結果を平均化することで性能を向上させる。
  • 6つのサブモデル(LFNL-NetVLAD、LFNL-NetRVLAD、EFNL-NetVLAD、Soft-BoF-4k、Soft-BoF-8k、GRU)を1つの計算グラフに統合し、推論を効率化する。

実験結果

リサーチクエスチョン

  • RQ1非ローカル演算は、大規模動画分類のためのNetVLADベースの動画特徴符号化を改善できるか?
  • RQ2モデル平均化とランダムサブサンプリングを伴う繰り返し推論は、1モデルの性能を向上させるのにどの程度効果的か?
  • RQ31GB制約下でbfloat16量子化を用いることで、モデルサイズをどの程度削減でき、性能を保持できるか?
  • RQ4多様なアーキテクチャ(非ローカルNetVLAD、GRU、Soft-BoF)は、アンサンブル設定でどの程度相乗効果を発揮するか?
  • RQ5厳密なサイズ制限下で、1つのコンパクトなモデルは、アンサンブルベースのアプローチを上回ることができるか?

主な発見

  • 非ローカルNetVLADモデルは、同一設定下でバリデーションセットで0.8702のGAP@20を達成し、ヴァニラNetVLAD(0.8698)をわずかに上回った。
  • 最終的なアンサンブルモデル(6つのサブモデルを統合)は、バリデーションセットで0.8847のGAP@20、パブリックテストセットで0.88763のGAP@20を達成した。
  • 10回のランダム実行による繰り返し推論により、バリデーションセットで0.0005、パブリックテストセットで0.0005の性能向上が確認された。
  • bfloat16を用いることでモデルサイズが半減し、1GB制限内でより多くのサブモデルを含めることが可能になった。
  • 最終的な提出モデルサイズは995MBであり、1GBの制限を下回っており、効果的な圧縮と最適化が実現されたことを示した。
  • 本システムは2回目のYouTube-8Mチャレンジで4位を記録し、多くのアンサンブルベース手法を上回り、コンパクトで1モデル型の設計の有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。