Skip to main content
QUICK REVIEW

[論文レビュー] MVP-Shot: Multi-Velocity Progressive-Alignment Framework for Few-Shot Action Recognition

Hongyu Qu, Rui Yan|arXiv (Cornell University)|May 3, 2024
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、異なる速度で実行されるアクションに対応するため、複数の時間スケール(例:フレームレベルおよびセグメントレベル)における特徴を統合的に学習・アライメントする、新しいマルチ・ボリューム・プログレッシブ・アライメントフレームワーク、MVP-Shotを提案する。速度に依存する意味的ガイダンスを提供するプログレッシブ・セマンティック・タイルド・インタラクション(PSTI)モジュールと、クロス・ボリューム類似度統合を行うマルチ・ボリューム・フェイチャーアライメント(MVFA)モジュールを統合することで、HMDB51、UCF101、Kinetics、SSv2-smallで最先端性能を達成し、5ウェイ1ショットから5ショットの設定において既存手法を上回る性能を発揮する。

ABSTRACT

Recent few-shot action recognition (FSAR) methods typically perform semantic matching on learned discriminative features to achieve promising performance. However, most FSAR methods focus on single-scale (e.g., frame-level, segment-level, etc) feature alignment, which ignores that human actions with the same semantic may appear at different velocities. To this end, we develop a novel Multi-Velocity Progressive-alignment (MVP-Shot) framework to progressively learn and align semantic-related action features at multi-velocity levels. Concretely, a Multi-Velocity Feature Alignment (MVFA) module is designed to measure the similarity between features from support and query videos with different velocity scales and then merge all similarity scores in a residual fashion. To avoid the multiple velocity features deviating from the underlying motion semantic, our proposed Progressive Semantic-Tailored Interaction (PSTI) module injects velocity-tailored text information into the video feature via feature interaction on channel and temporal domains at different velocities. The above two modules compensate for each other to make more accurate query sample predictions under the few-shot settings. Experimental results show our method outperforms current state-of-the-art methods on multiple standard few-shot benchmarks (i.e., HMDB51, UCF101, Kinetics, and SSv2-small).

研究の動機と目的

  • 行動認識の少数ショット設定において、アクションの速度が変動するが、多くの手法が1つの時間スケールでのみ特徴アライメントを行うという限界を是正すること。
  • フレームレベルやセグメントレベルなどの複数の速度レベルにおける意味的関連性を同時に捉えることで、特徴アライメントのロバスト性を向上させること。
  • 動画特徴に速度に特化したテキスト事前知識を統合することで、マルチ・ボリューム特徴が基本的な運動意味から逸脱するのを防ぐこと。
  • 低ショット状況下でのより正確なクエリ予測を実現するため、複数のボリュームマッチング結果を段階的に融合する補完的学習フレームワークを構築すること。

提案手法

  • プログレッシブ・セマンティック・タイルド・インタラクション(PSTI)モジュールは、チャネルおよび時間ドメイン内での相互作用を通じて、速度に特化したテキスト埋め込みを動画特徴に統合し、各速度スケールにおける意味的アライメントを強化する。
  • マルチ・ボリューム・フェイチャーアライメント(MVFA)モジュールは、複数の速度スケールにおけるサポートおよびクエリ特徴間の類似度スコアを計算し、残差的な方法で統合することで、判別能を保持する。
  • フレームワークは段階的アライメントを実行する:PSTIがまず、クラス名の事前知識を用いて速度に依存する特徴を精緻化し、その後MVFAが多スケールマッチング信号を統合する。
  • モデルは、初期の視覚的特徴抽出に事前学習済みCLIPベースのバックボーンを活用し、少数ショット適応のためのPSTIおよびMVFAモジュールをその上に追加する。
  • 全フレームワークはエピソードベースのメタラーニングを用いてエンドツーエンドで訓練され、予測された行動ラベルに対するクロスエントロピー損失が使用される。
  • 時間的アライメントにはOTAMを指標として用い、注目マップを可視化することで、モデルが行動関連領域に注目していることを検証する。

実験結果

リサーチクエスチョン

  • RQ1異なるアクション速度における意味的関連性を捉えることで、マルチ・ボリューム特徴アライメントが少数ショット行動認識の性能向上に寄与するか?
  • RQ2動画特徴に速度に特化したテキスト情報を統合することは、少数ショット行動予測のロバスト性および正確性にどのような影響を与えるか?
  • RQ3複数の速度スケールからの類似度スコアを統合することは、単一スケールアライメントと比較して、より信頼性が高く一貫性のある予測をもたらすか?
  • RQ4標準的なビジョン・ランゲージモデルと比較して、提案フレームワークは背景や不要なオブジェクトへの注目をどの程度低減するか?

主な発見

  • MVP-Shotは、5ウェイ1ショットから5ショットの設定において、HMDB51、UCF101、Kinetics、SSv2-smallで最先端性能を達成し、既存の最先端手法を上回る。
  • Kineticsでは、5ウェイ1ショットで48.7%の正確度を達成し、前回の最先端手法を2.1ポイント上回った。
  • 5ウェイ5ショット評価では、UCF101で72.3%の正確度に達し、より高いショット条件下でも優れた一般化性能を示した。
  • 可視化結果から、PSTIモジュールが注目局在性を顕著に向上させ、馬に乗る騎手やアイスダンスのパフォーマーなどの行動関連オブジェクトに注目する一方で、背景への注目を低減していることが明らかになった。
  • MVFAにおけるマルチ・ボリュームアライメントは、単一速度ベースラインが誤分類したクエリを多スケール統合によって是正していることが、Kineticsでの類似度可視化で確認された。
  • アブレーションスタディにより、PSTIおよびMVFAモジュールの両方が性能向上に顕著に寄与していることが確認され、いずれかのモジュールを除去すると正確度が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。