Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Video Domain Adaptation for Action Recognition: A Disentanglement Perspective

Pengfei Wei, Lingdong Kong|arXiv (Cornell University)|Aug 15, 2022
Anomaly Detection Techniques and Applications被引用数 9
ひとこと要約

本論文は、動画表現をドメイン固有の静的要因とドメイン不変の動的要因に分離する、新しい非教師付き動画ドメイン適応フレームワークTranSVAEを提案する。動画生成を別々の潜在要因でモデル化し、分離制約を適用することで、空間的および時間的ドメインシフトを効果的に低減し、UCF-HMDB、Jester、Epic-Kitchensベンチマークで最先端の性能を達成した。

ABSTRACT

Unsupervised video domain adaptation is a practical yet challenging task. In this work, for the first time, we tackle it from a disentanglement view. Our key idea is to handle the spatial and temporal domain divergence separately through disentanglement. Specifically, we consider the generation of cross-domain videos from two sets of latent factors, one encoding the static information and another encoding the dynamic information. A Transfer Sequential VAE (TranSVAE) framework is then developed to model such generation. To better serve for adaptation, we propose several objectives to constrain the latent factors. With these constraints, the spatial divergence can be readily removed by disentangling the static domain-specific information out, and the temporal divergence is further reduced from both frame- and video-levels through adversarial learning. Extensive experiments on the UCF-HMDB, Jester, and Epic-Kitchens datasets verify the effectiveness and superiority of TranSVAE compared with several state-of-the-art approaches. Code is publicly available.

研究の動機と目的

  • 空間的および時間的ドメインシフトがモデルの汎化性能を妨げる非教師付き動画ドメイン適応の課題に対処すること。
  • 空間的および時間的ドメインギャップを一括で処理するが、明示的な分離が行われない既存のアプローチの限界を克服すること。
  • 生成モデルを用いて、行動関連の動的運動からドメイン固有の静的コンテンツを明示的に分離することで、効果的なドメイン適応を可能にすること。
  • 静的要因をドメイン固有のものに分離することで空間的ドメインシフトを低減し、動的要因のフレームおよび動画レベルの敵対的アライメントにより時間的ドメインシフトを低減すること。
  • ソースラベル付きデータとターゲット非ラベル付きデータのみを用いて、分離されたドメイン不変の表現により、下流の行動認識性能を向上させること。

提案手法

  • 動画を静的ドメイン固有要因と動的行動関連要因に分離する潜在要因からなる、トランスファー順序付き変分オートエンコーダ(TranSVAE)を提案する。
  • 静的要因と動的要因の潜在変数の独立性を保証するため、相互情報量の最小化を用いて分離を強制する。
  • 静的要因にコントラスト型トライアングル損失を適用し、それらがドメイン固有であり行動コンテンツに対して不変になるようにし、空間的ドメインシフトの容易な除去を可能にする。
  • フレームレベルおよび動画レベルの敵対的学習を実装し、異なるドメイン間での動的要因をアライメントすることで、時間的ドメインシフトを低減する。
  • ソースデータの動的要因にタスク固有の監督を統合し、行動認識のための意味情報を保持する。
  • 2段階の訓練プロセスを採用:まず再構成と分離の目的関数でオートエンコーダを事前学習し、次に敵対的損失および分類損失で微調整する。

実験結果

リサーチクエスチョン

  • RQ1動画表現における静的(ドメイン固有)要因と動的(行動関連)要因の分離が、行動認識のための非教師付きドメイン適応を向上させることができるか?
  • RQ2分離によって空間的および時間的ドメインシフトを分離することで、統合的アライメント手法よりも優れた汎化性能が得られるか?
  • RQ3静的要因をどれだけ除去することで空間的ドメインシフトを排除しつつ、動的要因に行動意味を保持できるか?
  • RQ4フレームおよび動画レベルの敵対的アライメントが、時間的ドメインシフト低減にどの程度効果的か?
  • RQ5分離された動的要因を用いて、外見を保持したままドメイン間で行動を転送でき、スタイル変換に類似した機能を実現できるか?

主な発見

  • TranSVAEはUCF-HMDBデータセットで最先端の性能を達成し、先行手法を大きく上回り、H→U設定で5.2%の絶対的向上を示した。
  • Jesterデータセットでは、2番目に良い手法よりも4.1%の向上を達成し、多様な動画ドメインにわたる強力な汎化性能を示した。
  • Epic-Kitchensでは、前回のSOTAより3.8%の精度向上を達成し、長尾分布で現実世界の動画設定においても有効であることを確認した。
  • アブレーションスタディの結果、静的要因のコントラスト損失を削除するか、動的要因の敵対的アライメントを削除すると、性能が著しく低下し、両者の必要性が裏付けられた。
  • 定性的な結果から、静的要因がドメイン固有の外見(例:キャラクタースタイル)を捉え、動的要因が行動意味をエンコードしていることが確認され、ドメイン間の要因交換により外見を保持した行動転送が可能であることが示された。
  • 偽ラベルのしきい値に頼る安定性を示し、最適な性能はタスク固有のしきい値(U→Hではη=0.93、H→Uではη=0.96)で達成された。これはハイパーパramータの変動に対しても適応が安定していることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。