Skip to main content
QUICK REVIEW

[論文レビュー] Hybrid Relation Guided Set Matching for Few-shot Action Recognition

Xiang Wang, Shiwei Zhang|arXiv (Cornell University)|Apr 28, 2022
Human Pose and Action Recognition被引用数 7
ひとこと要約

本稿では、動画内および動画間の関係を捉えるハイブリッド関係モジュールを用いてタスク固有の特徴抽出を強化するとともに、集合ベースの動画マッチングに二方向平均ハウスドルフ距離を導入することで、時間的ずれに強い少数ショット行動認識フレームワークであるHyRSM(Hybrid Relation Guided Set Matching)を提案する。HyRSMは6つのベンチマークで最先端性能を達成し、5ウェイ1ショット設定下でのSSv2-Fullデータセットで56.0%のトップ1精度を達成した。

ABSTRACT

Current few-shot action recognition methods reach impressive performance by learning discriminative features for each video via episodic training and designing various temporal alignment strategies. Nevertheless, they are limited in that (a) learning individual features without considering the entire task may lose the most relevant information in the current episode, and (b) these alignment strategies may fail in misaligned instances. To overcome the two limitations, we propose a novel Hybrid Relation guided Set Matching (HyRSM) approach that incorporates two key components: hybrid relation module and set matching metric. The purpose of the hybrid relation module is to learn task-specific embeddings by fully exploiting associated relations within and cross videos in an episode. Built upon the task-specific features, we reformulate distance measure between query and support videos as a set matching problem and further design a bidirectional Mean Hausdorff Metric to improve the resilience to misaligned instances. By this means, the proposed HyRSM can be highly informative and flexible to predict query categories under the few-shot settings. We evaluate HyRSM on six challenging benchmarks, and the experimental results show its superiority over the state-of-the-art methods by a convincing margin. Project page: https://hyrsm-cvpr2022.github.io/.

研究の動機と目的

  • 既存の少数ショット行動認識手法がエピソード内での動画同士の関係を無視しているという制限を是正する。
  • 時間的ずれを伴う動作や順序が可変な動作を扱う際、厳密な時間的アライメント指標の脆さを克服する。
  • タスク固有の表現を学習し、柔軟で耐障害性のある動画マッチングを可能にする統合的でエンドツーエンドのフレームワークを開発する。
  • 動画間の意味的および構造的関係をモデル化することで、少数ショット動画分類における汎化性と耐障害性を向上させる。

提案手法

  • ハイブリッド関係モジュールは、まず各動画内での長距離時間的依存性をモデル化するための内的関係関数を適用し、構造的パターンを強化する。
  • 次に、同じエピソード内の複数の動画間で相互関係関数を適用し、クロス動画の意味的ヒントを抽出することで、照合予測に関連する特徴を豊かにする。
  • 照合動画とサポート動画のマッチングを、時間的順序を厳密に要求しない集合マッチング問題として再定式化する。
  • 二方向平均ハウスドルフ距離(Bi-MHM)を提案し、部分的な動作のずれに強い動画集合間の距離を計算する。
  • エピソード的メタラーニングを用いてエンドツーエンドで訓練し、特徴量とマッチングスコアを同時に最適化する。
  • さまざまなバックボーン(ResNet-18, -34, -50)を用いた評価により、スケーラビリティと耐障害性を示した。

実験結果

リサーチクエスチョン

  • RQ1エピソード内での動画内および動画間の関係をモデル化することで、少数ショット行動認識における特徴の判別性が向上するか?
  • RQ2柔軟な距離関数を用いた集合マッチング定式化は、時間的ずれや順序可変な動作を扱う際、厳密な時間的アライメントを上回る性能を発揮するか?
  • RQ3タスク固有の関係誘導型特徴抽出戦略は、タスクに依存しない特徴抽出戦略に比べ、少数ショット設定でより良い汎化性能を示すか?
  • RQ4提案された二方向平均ハウスドルフ距離(Bi-MHM)は、ノイズや時間的ずれに対して、既存のアライメント指標に比べてより頑健であるか?

主な発見

  • HyRSMは5ウェイ1ショット設定下でSSv2-Fullデータセットで56.0%のトップ1精度を達成し、以前の最先端手法を上回った。
  • 提案された二方向平均ハウスドルフ距離(Bi-MHM)は、同じ設定下でSSv2-Fullで44.6%の精度を達成し、OTAM(42.8%)やTRX(42.0%)を上回った。
  • ハイブリッド関係モジュールは類似度可視化の結果から、正しくマッチしたペアが顕著に強調されることから、特徴の判別性が著しく向上していることが示された。
  • より深いバックボーン(例:ResNet-34)を用いることで性能が向上し、HyRSMはKinetics、HMDB51、Epic-kitchensを含むすべての6つのベンチマークで最先端性能を維持した。
  • パrameter数とFLOPsはわずかに増加したが、複雑な分類器ヘッドを備えていないため、OTAM や TRX よりも高速な推論を達成した。
  • アブレーションスタディの結果、集合マッチング指標は、標準のハウスドルフ距離や単方向指標よりもノイズやずれに対してより頑健であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。