Skip to main content
QUICK REVIEW

[論文レビュー] FROSTER: Frozen CLIP Is A Strong Teacher for Open-Vocabulary Action Recognition

Xiaohu Huang, Hao Zhou|arXiv (Cornell University)|Feb 5, 2024
Natural Language Processing Techniques被引用数 4
ひとこと要約

FROSTERは、一般化を維持しつつ動画固有の特徴学習を可能にする知識蒸留フレームワークを提案する。教師として固定されたCLIPモデルを用い、残留特徴蒸留を適用することで、複数のベンチマークで最先端の性能を達成し、特に一般化が求められる分布外データセットにおいて顕著な効果を示す。

ABSTRACT

In this paper, we introduce FROSTER, an effective framework for open-vocabulary action recognition. The CLIP model has achieved remarkable success in a range of image-based tasks, benefiting from its strong generalization capability stemming from pretaining on massive image-text pairs. However, applying CLIP directly to the open-vocabulary action recognition task is challenging due to the absence of temporal information in CLIP's pretraining. Further, fine-tuning CLIP on action recognition datasets may lead to overfitting and hinder its generalizability, resulting in unsatisfactory results when dealing with unseen actions. To address these issues, FROSTER employs a residual feature distillation approach to ensure that CLIP retains its generalization capability while effectively adapting to the action recognition task. Specifically, the residual feature distillation treats the frozen CLIP model as a teacher to maintain the generalizability exhibited by the original CLIP and supervises the feature learning for the extraction of video-specific features to bridge the gap between images and videos. Meanwhile, it uses a residual sub-network for feature distillation to reach a balance between the two distinct objectives of learning generalizable and video-specific features. We extensively evaluate FROSTER on open-vocabulary action recognition benchmarks under both base-to-novel and cross-dataset settings. FROSTER consistently achieves state-of-the-art performance on all datasets across the board. Project page: https://visual-ai.github.io/froster.

研究の動機と目的

  • オープンボリューム行動認識における微調整済みCLIPモデルの一般化性能の低さに取り組むこと、特に未学習または意味的に遠い行動カテゴリに対して。
  • 画像ベースのCLIP事前学習と動画行動認識の間のドメインギャップを克服し、CLIPの強力な一般化能力を損なわず、動画固有の特徴学習を可能にすること。
  • 固定されたCLIPと動画固有の学生モデルの知識を統合する軽量で効率的なフレームワークを開発し、モデルアンサンブルの計算コストを回避すること。
  • 完全微調整モデルやアダプタベースのモデルを含む多様なネットワークアーキテクチャとの互換性を確保し、実用的応用の最大限の可能性を追求すること。

提案手法

  • 訓練中にCLIPの視覚的・テキスト的エンコーダーを固定し、一般化可能な表現を維持する知識蒸留の教師として用いる。
  • 残留特徴蒸留を導入:学生モデルは、固定されたCLIPの特徴と自身の特徴の差分(残留)を予測するように学習することで、動画固有の特徴と一般化可能な特徴の両方を同時に最適化できる。
  • 残留サブネットワークを用いて、微調整による動画固有特徴の学習と蒸留による一般化可能な特徴の学習を分離し、両者の目的をバランスさせる。
  • 視覚的およびテキスト的特徴の両方で蒸留を適用し、一般化能力の低下を避けるためにプロジェクターレス設計を採用する。
  • テキスト拡張(例:クラス名の拡充)を組み込み、テキストの一般化を向上させ、ゼロショット転送性能を強化する。
  • 評価時において、学生モデルと固定CLIPを特徴レベルでアンサンブルすることで、知識蒸留の有効性を検証するが、最終的なモデルは単一の学生モデルとして動作する。

実験結果

リサーチクエスチョン

  • RQ1固定されたCLIPモデルは、微調整を行わずとも、一般化性能を向上させる有効な知識蒸留の教師として機能できるか?
  • RQ2残留特徴蒸留は、動画固有の特徴学習とCLIPの一般化能力の維持を効果的に両立できるか?
  • RQ3FROSTERは、オープンボリュームベンチマーク、特に学習セットと意味的に類似度が低いデータセットでどのように性能を発揮するか?
  • RQ4FROSTERの性能向上は、一般化要件が高まるに従ってスケーリングするか。例えば、UCF-101 や HMDB-51 と比較して Kinetics-600 で顕著か?
  • RQ5FROSTERは、完全微調整モデルやアダプタベースのモデルを含む多様なモデルアーキテクチャに効果的に適用可能か?

主な発見

  • FROSTERは、すべての評価ベンチマークで最先端の性能を達成し、ベースからノーブル設定下でKinetics-600で85.0%のトップ1精度を記録し、アンサンブル手法でさえも上回る。
  • Kinetics-600はKinetics-400からのヒューディスト距離が最大であり、一般化要件が最も高いデータセットであるが、FROSTERはこのデータセットで最大の相対的改善を達成しており、高一般化要件下での有効性を裏付けている。
  • 残留特徴蒸留は、標準的蒸留やプロジェクターベース蒸留を上回り、テキスト拡張を組み合わせた場合、Kinetics-600で74.8%のトップ1精度を達成した。
  • FROSTERはすべてのデータセットで性能を向上させ、特にK-600で最大の向上(ベースライン比約7.5%の相対的改善)を示しており、強力な一般化能力の向上を示している。
  • FROSTERは多様なアーキテクチャに有効である:完全微調整モデルおよびアダプタベースモデルの両方を向上させ、パラメータ容量がより高い完全微調整モデルでより大きな向上を示している。
  • 注意可視化により、FROSTERは固定CLIPが背景に注目するのとは異なり、動いている物体(例:手)や関連する背景の手がかり(例:シンク、テーブル)に注目していることが確認された。一方、微調整済みモデルは、重要な動きの手がかりを逃す可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。