Skip to main content
QUICK REVIEW

[論文レビュー] Learning from Temporal Gradient for Semi-supervised Action Recognition

Junfei Xiao, Longlong Jing|arXiv (Cornell University)|Nov 25, 2021
Human Pose and Action Recognition参考文献 58被引用数 9
ひとこと要約

本論文は、限られたラベル付き動画データからの特徴学習を向上させるために、時間的勾配(TG)を追加モダリティとして活用する半教師あり行動認識手法を提案する。TGからRGB特徴へのブロック単位の密な知識蒸留と、モダリティ間の対照的学習を適用することで、追加の推論計算やパラメータを一切用いずに、Kinetics-400、UCF-101、HMDB-51で最先端の性能を達成した。

ABSTRACT

Semi-supervised video action recognition tends to enable deep neural networks to achieve remarkable performance even with very limited labeled data. However, existing methods are mainly transferred from current image-based methods (e.g., FixMatch). Without specifically utilizing the temporal dynamics and inherent multimodal attributes, their results could be suboptimal. To better leverage the encoded temporal information in videos, we introduce temporal gradient as an additional modality for more attentive feature extraction in this paper. To be specific, our method explicitly distills the fine-grained motion representations from temporal gradient (TG) and imposes consistency across different modalities (i.e., RGB and TG). The performance of semi-supervised action recognition is significantly improved without additional computation or parameters during inference. Our method achieves the state-of-the-art performance on three video action recognition benchmarks (i.e., Kinetics-400, UCF-101, and HMDB-51) under several typical semi-supervised settings (i.e., different ratios of labeled data).

研究の動機と目的

  • 動画を3次元画像として扱う既存の半教師あり動画手法が、時間的ダイナミクスを十分に活用しないという、性能の劣化を是正する。
  • 色に依存しない、微細な動きを明示的に表現する時間的勾配(TG)に内蔵された豊富な動き信号を活用する。
  • 知識蒸留と対照的学習によるRGBとTGモダリティ間の一貫性を強制することで、低ラベル設定下での一般化性能を向上させる。
  • 訓練時にTGを用いながらも、推論時にはRGBモデルのみを用いることで、推論効率を維持する手法を設計する。
  • 最小限のアーキテクチャ的および計算的オーバーヘッドで、複数のベンチマークで最先端の性能を達成する。

提案手法

  • 時間的勾配(TG)を新たなモダリティとして定義する。これは連続するRGBフレーム間の差分として与えられ、$TG = x_t^{RGB} - x_{t+n}^{RGB}$ で表され、微細な動き信号を捉える。
  • RGB学生モデルとTG教師ネットワークの対応する残差ブロック間で、ブロック単位の密な知識蒸留を適用し、動き表現を転送する。
  • 蒸留の過程でTGブランチにストップ・グラデント操作を適用することで、動き固有の特徴を保持し、教師モデルの劣化を防ぐ。
  • 温度調整付きの対照的損失を用いて、RGBとTGの特徴系列間のモダリティ間対照的学習を実装し、高レベル表現の一貫性を強制する。
  • 訓練中に、RGBおよびTGモデルの予測を統合する疑似ラベル融合戦略を採用し、より信頼性の高い疑似ラベルを生成する。
  • 訓練の安定化と収束の向上を図るため、教師付きウォームアップ、ラーニングレートウォームアップ、PreciseBNを導入する。

実験結果

リサーチクエスチョン

  • RQ1低ラベル設定下において、RGBよりも時間的勾配(TG)が半教師あり動画行動認識のためのより効果的なモダリティとして機能するか?
  • RQ2推論コストを増加させることなく、TGから得られる微細な動き表現をRGBベースの学生モデルに効果的に転送する方法は何か?
  • RQ3RGBとTG特徴間のマルチモーダル一貫性を強制することで、モデルの一般化性能と性能にどのような影響を与えるか?
  • RQ4疑似ラベル融合や対照的学習といった異なる訓練戦略は、半教師あり設定における性能向上にどのように寄与するか?
  • RQ5ブロック単位のアライメントや対照的損失の温度といった、さまざまなアブレーション設定が、最適な性能と安定性をもたらすか?

主な発見

  • 20%のラベル付きデータでのUCL-101上での実験で、TGを入力とすることでRGBに比べて25%高いTop-1精度を達成し、低データ環境下での優位性を示した。
  • すべての残差ブロックにわたるブロック単位の密な知識蒸留により、ベースラインのFixMatch(54.1%から74.6%へ)と比較して、Top-1精度が20.5%向上した。
  • 本手法は、すべてのラベルデータ比においてKinetics-400、UCF-101、HMDB-51で最先端の性能を達成し、先行手法を上回った。
  • 教師付きウォームアップが最も効果的な訓練テクニックであり、Top-1精度を71.9%から74.6%へ2.7%向上させ、初期段階での劣化した疑似ラベル品質の緩和に寄与した。
  • 温度を0.2または0.5に設定した対照的学習が最適な性能をもたらしたが、極端な値(0.1または1.0)では性能が低下した。
  • 蒸留におけるストップ・グラデント操作を削除すると、Top-1精度が74.6%から60.0%へ14.6%低下し、動き特徴品質の保持にその役割が不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。