Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Domain Adaptation for Video Transformers in Action Recognition

Victor G. Turrisi da Costa, Giacomo Zara|arXiv (Cornell University)|Jul 26, 2022
Human Pose and Action Recognition被引用数 4
ひとこと要約

本稿では、空間的・時間的トランスフォーマーのバックボーンと、情報ボトルネックにインspiredされたドメイン整合性損失を活用する、動画行動認識のための新しい教師なしドメイン適応(UDA)フレームワーク、UDAVTを提案する。空間的および時間的トランスフォーマーをドメイン不変特徴学習とともに同時に微調整することで、UDAVTはHMDB→UCFおよびより挑戦的なKinetics→NEC-Droneベンチマークで最先端の性能を達成し、顕著なドメインシフトに対しても頑健であることを示した。

ABSTRACT

Over the last few years, Unsupervised Domain Adaptation (UDA) techniques have acquired remarkable importance and popularity in computer vision. However, when compared to the extensive literature available for images, the field of videos is still relatively unexplored. On the other hand, the performance of a model in action recognition is heavily affected by domain shift. In this paper, we propose a simple and novel UDA approach for video action recognition. Our approach leverages recent advances on spatio-temporal transformers to build a robust source model that better generalises to the target domain. Furthermore, our architecture learns domain invariant features thanks to the introduction of a novel alignment loss term derived from the Information Bottleneck principle. We report results on two video action recognition benchmarks for UDA, showing state-of-the-art performance on HMDB$\leftrightarrow$UCF, as well as on Kinetics$ ightarrow$NEC-Drone, which is more challenging. This demonstrates the effectiveness of our method in handling different levels of domain shift. The source code is available at https://github.com/vturrisi/UDAVT.

研究の動機と目的

  • ドメインシフトの課題に対処すること。具体的には、あるドメイン(例:HMDB)で学習したモデルが、別の関連ドメイン(例:UCF や NEC-Drone)で性能を発揮しない問題に焦点を当てる。
  • 従来、画像分野で十分に発展した教師なしドメイン適応(UDA)技術を、時間的ダイナミクスを有するより複雑な動画ドメインへと拡張すること。
  • 動画トランスフォーマーにおけるドメイン不変表現を学習することで一般化性能を向上させる、堅牢でエンドツーエンドで訓練可能なUDAフレームワークを構築すること。
  • 標準的なUDAベンチマーク、特にクロスデータセット設定を含む、行動認識における提案手法の有効性を評価すること。

提案手法

  • 本手法は二段階の訓練戦略を採用する。まず、全トランスフォーマーをソースデータのみで微調整する。次に、空間的トランスフォーマーを固定し、時間的トランスフォーマーのみを新しいドメイン整合性損失を用いてさらに微調整する。
  • 主なイノベーションは、情報ボトルネック(IB)原理に基づいて導出された新しいドメイン整合性損失であり、モデルが行動クラスに関連する情報のみを保持し、ドメイン固有の変動を排除するよう促進する。
  • この損失は、2段階目の訓練中に、ターゲットデータに対するソースモデルの疑似ラベルを用いて、ドメイン間の特徴分布を統一するために適用される。
  • アーキテクチャは、空間的特徴抽出にビジョントランスフォーマー(ViT)と多層トランスフォーマーによる時間的集約を組み合わせたSTAM(Spatio-Temporal Attention Module)に基づく共有エンコーダーを採用する。
  • ドメイン整合性部の訓練を安定化させるために、ターゲット特徴のモーメンタム更新キューが使用され、特徴の一貫性が向上する。
  • 本手法は、教師ありおよび教師なしの両設定で評価され、キューの役割や疑似ラベルの品質が果たす影響についてのアブレーションスタディが実施された。

実験結果

リサーチクエスチョン

  • RQ1教師なしで、ラベルなしのターゲットデータとソースデータのみを用いて、トランスフォーマーに基づく動画モデルを新しいドメインに効果的に適応できるか?
  • RQ2従来のUDA損失と比較して、情報ボトルネックに基づく損失は、動画行動認識におけるドメイン不変特徴の整合性をどの程度効果的に実現できるか?
  • RQ3二段階の訓練戦略(まずソースデータで事前学習し、次にドメイン整合性を伴う時間ストリームでの微調整)は、ドメインシフト下でのモデル一般化性能を向上させるか?
  • RQ4ターゲットの疑似ラベルの品質は、ドメイン適応プロセスの性能にどの程度影響を与えるか?
  • RQ5再利用可能な自己教師あり対照学習手法(例:SimCLR, VICReg)は、動画行動認識のドメイン適応に再利用された場合、本手法に劣る性能を示すか?

主な発見

  • UDAVTはHMDB→UCFベンチマークで最先端の性能を達成し、以前の手法と比べて顕著な性能向上を示した。
  • より挑戦的なKinetics→NEC-Droneベンチマークでは、UDAVTは65.3%の精度を達成し、2番目に優れた手法と比較して16%以上の性能向上を実現した。
  • アブレーションスタディにより、特に教師なし設定において、モーメンタムキューと高品質な疑似ラベルの両方が最適な性能を達成するために不可欠であることが確認された。
  • 再利用された自己教師あり対照手法(例:SimCLR, VICReg)は、ドメイン適応に再利用されたが、本手法のIBベース損失に比べて依然として性能が劣った。
  • 視覚的注意マップの結果、UDAVTは空間的・時間的局在化を向上させ、モデルがシーケンス内の行動関連フレームにより正確に注目するようになった。
  • 結果から、IBベース損失がドメインシフトを効果的に低減し、クラス情報は保持しつつドメイン固有のノイズを排除する分離可能な表現を学習できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。