Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Prototype-Enhanced Network for Few-Shot Action Recognition

Xinzhe Ni, Yong Liu|arXiv (Cornell University)|Dec 9, 2022
Human Pose and Action Recognition被引用数 7
ひとこと要約

本論文では、CLIPベースのテキストエンコーダーとマルチモーダルプロトタイプ強化(MPE)モジュールを介してラベルテキストからの意味情報を用いて視覚的プロトタイプを強化する、少数ショット行動認識モデルであるマルチモーダルプロトタイプ強化ネットワーク(MORN)を提案する。MORNは、視覚的およびテキスト的プロトタイプを同時に最適化することで、HMDB51、UCF101、Kinetics、SSv2で最先端の性能を達成しており、訓練中に新規に導入されたプロトタイプ品質指標PRIDEを用いることでさらなる向上が得られる。

ABSTRACT

Current methods for few-shot action recognition mainly fall into the metric learning framework following ProtoNet, which demonstrates the importance of prototypes. Although they achieve relatively good performance, the effect of multimodal information is ignored, e.g. label texts. In this work, we propose a novel MultimOdal PRototype-ENhanced Network (MORN), which uses the semantic information of label texts as multimodal information to enhance prototypes. A CLIP visual encoder and a frozen CLIP text encoder are introduced to obtain features with good multimodal initialization. Then in the visual flow, visual prototypes are computed by a visual prototype-computed module. In the text flow, a semantic-enhanced (SE) module and an inflating operation are used to obtain text prototypes. The final multimodal prototypes are then computed by a multimodal prototype-enhanced (MPE) module. Besides, we define a PRototype SImilarity DiffErence (PRIDE) to evaluate the quality of prototypes, which is used to verify our improvement on the prototype level and effectiveness of MORN. We conduct extensive experiments on four popular few-shot action recognition datasets: HMDB51, UCF101, Kinetics and SSv2, and MORN achieves state-of-the-art results. When plugging PRIDE into the training stage, the performance can be further improved.

研究の動機と目的

  • 少数ショット行動認識における単モダリティプロトタイプの限界、すなわち限られたラベル付きデータが最適でないプロトタイプ表現をもたらすという問題に取り組む。
  • 分類性能の向上を目的として、ラベルテキストからの意味情報を補助的モダリティとして活用する。
  • 特徴レベルの統合ではなく、プロトタイプの強化に特化した、シンプルでありながら効果的なフレームワークを設計する。
  • トレーニング中にプロトタイプ品質の向上を評価・誘導するための新しい指標、プロトタイプ類似度差(PRIDE)を導入する。
  • 高品質なプロトタイプが少数ショット行動認識において極めて重要であり、マルチモーダルな強化が性能を顕著に向上させることを示す。

提案手法

  • ゼロショット一般化性能に優れるように、固定されたCLIP視覚エンコーダーと固定されたCLIPテキストエンコーダーを用いて、強力なマルチモーダル特徴を初期化する。
  • 動画クリップ内の時間的関係をモデル化するため、時間的関係クロストランスフォーマー(TRX)モジュールを用いて視覚的プロトタイプを計算する。
  • ラベルテキストからのテキスト特徴を精緻化するため、マルチヘッドアテンションを用いた意味的強化(SE)モジュールを適用し、次に次元を一致させるためのインフレーティング処理を実施する。
  • 重み付き平均またはアテンションベースの統合を用いて、視覚的およびテキスト的プロトタイプをマルチモーダルプロトタイプ強化(MPE)モジュールで統合し、最終的なマルチモーダルプロトタイプを生成する。
  • プロトタイプ自身のカテゴリと他のカテゴリの平均との類似度の差を計算するPRIDEという指標を導入し、プロトタイプ品質の評価に用いる。
  • PRIDEを訓練目的に組み込むことで、さらにプロトタイプ品質とモデル性能の向上を実現する。

実験結果

リサーチクエスチョン

  • RQ1ラベルテキストからの意味情報を統合することで、少数ショット行動認識におけるプロトタイプの代表性が向上するか?
  • RQ2視覚的およびテキスト的プロトタイプを統合するマルチモーダルプロトタイプ強化は、単一モダリティまたは特徴レベルの統合手法よりも優れた性能を達成するか?
  • RQ3PRIDEのような専用指標は、少数ショット学習におけるプロトタイプ品質の向上を効果的に評価・誘導できるか?
  • RQ4PRIDE損失を用いた訓練は、複数のベンチマークで一貫した性能向上をもたらすか?
  • RQ5SEモジュール、MPE統合戦略、テキストエンコーダーの固定といった設計選択が、最終的な性能にどのように影響するか?

主な発見

  • MORNは4つのベンチマークデータセット(HMDB51:86.3%、UCF101:96.9%、Kinetics:91.6%、SSv2:71.1%)で最先端の性能を達成し、先行手法を上回った。
  • 固定されたCLIPテキストエンコーダーに意味的強化(SE)モジュールを組み合わせることで、HMDB51、UCF101、Kineticsで顕著な性能向上が得られ、両方のコンponentを併用した場合に最も良い結果が得られた。
  • SSv2では、固定されたCLIPテキストエンコーダーを用い、SEモジュールを省略した場合でも72.8%の精度を達成しており、このデータセットではSEモジュールの重要性がやや低いことが示された。
  • アブレーションスタディの結果、SEモジュールにおけるマルチヘッドアテンション(4ヘッド)とハイパーパrameter λ = 0.5 を用いることで、HMDB51で最適な性能が得られた。
  • MPEモジュールにおいて8ヘッドアテンションを用いた場合が、HMDB51、UCF101、Kineticsで最良の結果を出したが、重み付き平均を用いたシンプルな統合手法も、パrameterが少ないにもかかわらず2番目の性能を達成した。
  • 訓練段階にPRIDEを組み込むことでさらなる性能向上が得られ、PRIDEがプロトタイプ品質の測定および向上に効果的に機能することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。