[論文レビュー] Contrast and Mix: Temporal Contrastive Video Domain Adaptation with Background Mixing
本稿では、敵対的訓練を用いず、背景混合と偽ラベル化を用いて、ドメイン間で不変で判別性の高い特徴を学習する、時間的対照的動画ドメイン適応フレームワークCoMixを提案する。多様な速度のビュー間の類似性を最大化し、混合背景を持つ動画を追加の陽性サンプルとして導入することで、UCF-HMDBおよびJesterベンチマークで最先端の性能を達成し、ソースオンリーベースラインに対して最大10.7%の向上を達成した。
Unsupervised domain adaptation which aims to adapt models trained on a labeled source domain to a completely unlabeled target domain has attracted much attention in recent years. While many domain adaptation techniques have been proposed for images, the problem of unsupervised domain adaptation in videos remains largely underexplored. In this paper, we introduce Contrast and Mix (CoMix), a new contrastive learning framework that aims to learn discriminative invariant feature representations for unsupervised video domain adaptation. First, unlike existing methods that rely on adversarial learning for feature alignment, we utilize temporal contrastive learning to bridge the domain gap by maximizing the similarity between encoded representations of an unlabeled video at two different speeds as well as minimizing the similarity between different videos played at different speeds. Second, we propose a novel extension to the temporal contrastive loss by using background mixing that allows additional positives per anchor, thus adapting contrastive learning to leverage action semantics shared across both domains. Moreover, we also integrate a supervised contrastive learning objective using target pseudo-labels to enhance discriminability of the latent space for video domain adaptation. Extensive experiments on several benchmark datasets demonstrate the superiority of our proposed approach over state-of-the-art methods. Project page: https://cvir.github.io/projects/comix
研究の動機と目的
- 動画行動認識における効果的な教師なしドメイン適応手法の不足、特に時間的ダイナミクスと共有される行動意味を活用する手法の不足に取り組む。
- 敵対的学習における動画ドメイン適応の限界、例えば訓練の不安定性や収束の悪さを克服する。
- 背景が異なっても行動が同じである場合に、不変な行動意味を活用することでドメイン間の特徴整合を向上させる。
- ターゲットドメインからの偽ラベルを用いて、ラベルなしの真のラベルを必要としない自己教師付き対照的学習により、潜在空間における判別力を高める。
提案手法
- 時間的依存性を捉えるために、動画をグラフとして表現するためのグラフ畳み込みネットワーク(GCN)を用いる。
- 時間的対照的学習(TCL)を採用し、同じ動画の異なる速度バージョン間の類似性を最大化し、異なる動画の異なる速度間の類似性を最小化する。
- 背景混合を導入し、ソースドメインとターゲットドメインの背景を入れ替えることで合成動画を作成し、対照的学習のための追加の陽性サンプルを生成する。
- ターゲットドメインからの偽ラベルを用いて、同一の行動クラスの特徴が埋め込み空間で近づくようにする教師あり対照的学習の目的関数を適用する。
- 時間的対照的損失、背景混合損失、偽ラベル対照的損失を統合し、一括でエンドツーエンドの学習目的関数を構築する。
- 背景抽出には時間的中央値フィルタリングを用い、これはガウス・ミックスチャネル・モデル(GMM)よりも優れていることが示された。
実験結果
リサーチクエスチョン
- RQ1敵対的訓練を用いず、時間的対照的学習がドメイン間の特徴を効果的に統合できるか?
- RQ2背景混合を用いて、ドメイン間で共有される行動意味を反映する意味のある陽性サンプルを生成できるか?
- RQ3ターゲットドメインの偽ラベルを組み込むことで、教師なし動画ドメイン適応における判別的特徴学習がどの程度向上するか?
- RQ4グラフ表現を用いることで、通常のRNNやMLPと比較して時間的特徴学習が向上するか?
- RQ5敵対的および特徴マッチングアプローチと比較して、提案手法の正確性と頑健性はどの程度か?
主な発見
- CoMixはUCF-HMDBでソースオンリーベースラインを5.2%、Jesterで10.7%上回り、強力なドメイン適応効果を示した。
- GCNを用いた場合、DANNはUCF-HMDBで7.1%、Jesterで1.8%上回り、敵対的訓練を上回ることを示した。
- GCNによるグラフ表現はUCF-HMDBで90.3%の正確度を達成し、MLP(88.1%)やLSTM(84.3%)を上回り、時間的依存性を捉える有効性を証明した。
- 時間的中央値フィルタリングによる背景抽出は、GMMよりも平均で2.3%優れており、その効率性と有効性を示した。
- t-SNEを用いた特徴可視化により、TCL、BGM、TPLの各モジュールを段階的に追加することで、ドメイン統合とクラス判別性が順次向上することが確認された。
- アブレーションスタディの結果、TCL、BGM、TPLのすべてのモジュールを組み合わせた場合が最良の性能を示し、各モジュールの補完的役割を裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。