Skip to main content
QUICK REVIEW

[論文レビュー] Open-VCLIP: Transforming CLIP to an Open-vocabulary Video Model via Interpolated Weight Optimization

Zejia Weng, Xitong Yang|arXiv (Cornell University)|Feb 1, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

Open-VCLIP は、軽量な時系列モデリングを追加し、CLIP の一般化能力を保持しながら動画に適応させるために補間重み最適化 (IWO) を用いることで、CLIP を強力なゼロショット動画分類器に変換する。UCF-101 では 87.9%、HMDB-51 では 58.3%、Kinetics-600 では 81.1% の最先端のゼロショット精度を達成し、先行手法を大きく上回る性能を発揮した。

ABSTRACT

Contrastive Language-Image Pretraining (CLIP) has demonstrated impressive zero-shot learning abilities for image understanding, yet limited effort has been made to investigate CLIP for zero-shot video recognition. We introduce Open-VCLIP, a simple yet effective approach that transforms CLIP into a strong zero-shot video classifier that can recognize unseen actions and events at test time. Our framework extends CLIP with minimal modifications to model spatial-temporal relationships in videos, making it a specialized video classifier, while striving for generalization. We formally show that training an Open-VCLIP is equivalent to continual learning with zero historical data. To address this problem, we propose Interpolated Weight Optimization, which utilizes the benefit of weight interpolation in both training and test time. We evaluate our method on three popular and challenging action recognition datasets following various zero-shot evaluation protocols and we demonstrate our approach outperforms state-of-the-art methods by clear margins. In particular, we achieve 87.9%, 58.3%, 81.1% zero-shot accuracy on UCF, HMDB and Kinetics-600 respectively, outperforming state-of-the-art methods by 8.3%, 7.8% and 12.2%. Code is released at https://github.com/wengzejia1/Open-VCLIP.

研究の動機と目的

  • CLIP(強力な画像ゼロショットモデル)を、オリジナルのオープンボキャブラリー一般化能力を失うことなく動画行動認識に適応する課題に対処すること。
  • 限定的なデータで CLIP を動画データセットに微調整することによるゼロショット性能の低下を克服すること。
  • 動画タスクへの特化と CLIP のゼロショット能力の維持のバランスを取る手法を開発すること。
  • オリジナルの事前学習データにアクセスできない状況を想定し、適応プロセスを継続的学習問題として形式的に定式化すること。
  • 深刻な忘却を防ぐ正則化戦略を提案し、効果的な動画理解を可能にすること。

提案手法

  • 動画内の空間的・時系列的関係を捉えるために、軽量な時系列モデリングモジュールを追加するなど、CLIP を最小限の変更で拡張する。
  • モデルがオリジナルの画像・テキストデータにアクセスできない状況で、新しい動画タスクを学習する継続的学習として適応プロセスを定式化する。
  • 補間重み最適化 (IWO) を導入し、重みの変化に対する ℓ₂ ノルムを用いて、元の CLIP 重みからの逸脱を正則化することで訓練を制御する。
  • 訓練時および推論時において、元の CLIP 重みと更新済み重みの間で補間を適用することで最適化の安定性を高め、一般化性能を向上させる。
  • 混合係数 λ を用いて、CLIP の元の能力の維持と動画固有の特徴への適応のトレードオフを制御する。
  • CLIP のテキストエンコーダーを維持し、視覚タワーと時系列モジュールのみを微調整することで、CLIP のテキスト誘導分類によるゼロショット推論を可能にする。

実験結果

リサーチクエスチョン

  • RQ1CLIP を、強力なゼロショット一般化能力を保持したまま、動画行動認識に効果的に適応する方法は何か?
  • RQ2オリジナルの事前学習データにアクセスできない状況で、CLIP の微調整における深刻な忘却を防ぐ正則化戦略は何か?
  • RQ3シンプルでパラメータ効率の良い CLIP の適応手法が、標準的な動画ベンチマークで最先端のゼロショット性能を達成できるか?
  • RQ4提案手法である補間重み最適化 (IWO) は、標準的な ℓ₂ 正則化やその他のパラメータ効率の良い微調整手法と比較して、ゼロショットおよびクローズドセット精度においてどのように優れているか?
  • RQ5補間ベースの最適化戦略は、未学習の動画行動における訓練時および推論時の一般化性能を向上させるか?

主な発見

  • Open-VCLIP は UCF-101 で 87.9% のゼロショット精度を達成し、前回の最先端手法を 8.3 パcentポイント上回った。
  • Open-VCLIP は HMDB-51 で 58.3% のゼロショット精度を達成し、先行手法より 7.8 パcentポイント向上した。
  • Open-VCLIP は Kinetics-600 で 81.1% のゼロショット精度を達成し、前回の最良手法を 12.2 パcentポイント以上上回った。
  • Open-VCLIP は、評価されたすべてのベンチマークでクローズドセット性能とゼロショット性能の最良のトレードオフを達成し、ST-Adapter や微調整済み VCLIP などの手法を上回った。
  • Open-VCLIP は強力なテキストから動画、動画からテキストへの検索性能を維持しており、MSR-VTT では CLIP よりテキストから動画検索で 2% の向上を達成した一方、動画からテキスト検索では CLIP を大きく上回った。
  • 補間重み最適化は一般化性能を一貫して向上させ、アブレーションスタディでは、標準的な ℓ₂ 正則化や ST-Adapter などのパラメータ効率の良い微調整手法を上回ることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。