Skip to main content
QUICK REVIEW

[論文レビュー] Learning a Condensed Frame for Memory-Efficient Video Class-Incremental Learning

Yixuan Pei, Zhiwu Qing|arXiv (Cornell University)|Nov 2, 2022
Human Pose and Action Recognition被引用数 12
ひとこと要約

FrameMaker は、1 つの動画あたりの代表フレームに複数の動画フレームを凝縮することで、メモリ使用量を顕著に削減しながら性能を維持する、メモリ効率の良い動画クラスインクリメンタル学習手法を提案する。インスタンス固有のプロンプトを導入することで、失われた空間時間的詳細を回復し、HMDB51、UCF101、Something-Something V2 で、従来手法に比べて 20% のメモリ使用量で最先端の精度を達成している。

ABSTRACT

Recent incremental learning for action recognition usually stores representative videos to mitigate catastrophic forgetting. However, only a few bulky videos can be stored due to the limited memory. To address this problem, we propose FrameMaker, a memory-efficient video class-incremental learning approach that learns to produce a condensed frame for each selected video. Specifically, FrameMaker is mainly composed of two crucial components: Frame Condensing and Instance-Specific Prompt. The former is to reduce the memory cost by preserving only one condensed frame instead of the whole video, while the latter aims to compensate the lost spatio-temporal details in the Frame Condensing stage. By this means, FrameMaker enables a remarkable reduction in memory but keep enough information that can be applied to following incremental tasks. Experimental results on multiple challenging benchmarks, i.e., HMDB51, UCF101 and Something-Something V2, demonstrate that FrameMaker can achieve better performance to recent advanced methods while consuming only 20% memory. Additionally, under the same memory consumption conditions, FrameMaker significantly outperforms existing state-of-the-arts by a convincing margin.

研究の動機と目的

  • 動画クラスインクリメンタル学習における、1 動画あたり複数フレームを保存する高コストなメモリ使用を軽減すること。
  • 認識精度を損なわず、エクジンプラメモリのオーバーヘッドを低減すること。
  • フレーム凝縮によって生じる空間時間的情報の損失を補償すること。
  • メモリ制限のある環境におけるインクリメンタル動画学習の実用的導入を可能にすること。
  • メモリ制約下で、学習可能なプロンプトを備えた1つの凝縮フレームが、複数フレームのエクジンプラに勝ることを示すこと。

提案手法

  • フレーム凝縮は、各動画ごとに微分可能な重みを学習し、フレームの重み付き和を用いて1つの凝縮フレームに統合する。
  • 凝縮フレームは、元の動画クリップの特徴埋め込みと一致するように、コントラスト損失を用いて最適化される。
  • インスタンス固有のプロンプトは、凝縮フレーム上で画素単位の微調整を実行する、学習可能なフレームごとのパラメーターベクトルを導入する。
  • プロンプトは凝縮モジュールと同時にEnd-to-Endで学習され、微細な空間時間的詳細を回復する。
  • 本手法は二重ブランチネットワークを用いる:1 つは特徴抽出、もう 1 つはプロンプトベースの微調整。
  • 1 動画あたり 1 つの凝縮フレームのみを保存することで、メモリ効率が実現される。

実験結果

リサーチクエスチョン

  • RQ11 つの凝縮フレームは、クラスインクリメンタル学習における正確な行動認識に十分な空間時間的情報を保持できるか?
  • RQ2インスタンス固有のプロンプトは、フレーム凝縮によって失われた情報を効果的に回復できるか?
  • RQ3性能を維持または向上させながら、どれほどメモリ消費量を削減できるか?
  • RQ4同一のメモリ予算下で、本手法は複数フレームのエクジンプラ保存と比較してどうなるか?
  • RQ5時間的・空間的ダイナミクスが異なる多様な行動カテゴリに、モデルは一般化できるか?

主な発見

  • FrameMaker は、HMDB51、UCF101、Something-Something V2 で、従来の最先端手法に比べて 20% のメモリ使用量にまで削減しながら、優れた精度を達成している。
  • UCF101 では、1.2MB のメモリ使用量で 85.6% の精度を達成し、同じメモリ予算下で TCD(6.0MB)を 1.4% 上回っている。
  • インスタンス固有のプロンプトは、『Hug』 や『CliffDiving』 といった難易度の高い行動において、フレーム凝縮単体に比べて最大 3.2% の性能向上をもたらしている。
  • タスクごとの分析から、プロンプトベースの微調整は、後続のインクリメンタルタスクで最も大きな向上をもたらしており、効果的な忘れの緩和が示されている。
  • アブレーションスタディにより、共有プロンプトでは平均で 0.78% の性能低下が確認され、インスタンス固有の適応の必要性が裏付けられた。
  • 凝縮重みは、運動に偏った行動において、キーフレームに有意義な注目を向けることが示され、本手法が重要な時間的コンテンツを特定できることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。