Skip to main content
QUICK REVIEW

[論文レビュー] Video Unsupervised Domain Adaptation with Deep Learning: A Comprehensive Survey

Yuecong Xu, Haozhi Cao|arXiv (Cornell University)|Nov 17, 2022
Domain Adaptation and Few-Shot Learning参考文献 216被引用数 9
ひとこと要約

この包括的なサーベイは、ドメインシフトのための実世界の動画応用における性能低下を解消するために深層学習を用いた動画非教師ありドメイン適応(VUDA)手法をレビューする。VUDAアプローチを敵対的、乖離ベース、意味的ベース、複合的、再構成ベースの方法に分類し、マルチモーダル特徴学習、自己教師あり学習、実用的デプロイメントシナリオにおける主な課題と今後の方向性を特定する。

ABSTRACT

Video analysis tasks such as action recognition have received increasing research interest with growing applications in fields such as smart healthcare, thanks to the introduction of large-scale datasets and deep learning-based representations. However, video models trained on existing datasets suffer from significant performance degradation when deployed directly to real-world applications due to domain shifts between the training public video datasets (source video domains) and real-world videos (target video domains). Further, with the high cost of video annotation, it is more practical to use unlabeled videos for training. To tackle performance degradation and address concerns in high video annotation cost uniformly, the video unsupervised domain adaptation (VUDA) is introduced to adapt video models from the labeled source domain to the unlabeled target domain by alleviating video domain shift, improving the generalizability and portability of video models. This paper surveys recent progress in VUDA with deep learning. We begin with the motivation of VUDA, followed by its definition, and recent progress of methods for both closed-set VUDA and VUDA under different scenarios, and current benchmark datasets for VUDA research. Eventually, future directions are provided to promote further VUDA research. The repository of this survey is provided at https://github.com/xuyu0010/awesome-video-domain-adaptation.

研究の動機と目的

  • 公開データセット(ソースドメイン)から実世界の応用(ターゲットドメイン)に展開された動画モデルの性能低下を、ドメインシフトの要因として是正すること。
  • ターゲットドメインのラベルなしデータを活用することで、高価な動画アノテーションに依存するのを減らす。
  • 閉じたラベル空間と非閉じたラベル空間の両方のシナリオにおけるVUDA手法の体系的レビューを提供し、多様な手法的カテゴリーとベンチマークデータセットを含む。
  • 今後のVUDA研究におけるマルチモーダル特徴統合、効果的な特徴抽出、自己教師あり学習の分野における主な課題を特定すること。
  • 実世界でのデプロイメント可能性を高めるために、実用的シナリオと手法の改善を示唆することで、今後の研究を導くこと。

提案手法

  • VUDA手法を5つのタイプに分類する:敵対的ベース(ドメイン識別器を用いてドメイン不変特徴を学習)、乖離ベース(MMD、CORAL、MDDを用いてドメインの乖離を最小化)、意味的ベース(疑似ラベル付け、対照的学習、クラスタリングを用いる)、複合的(複数の目的を組み合わせる)、再構成ベース(オートエンコーダ構造を用いた特徴学習)。
  • 閉じたラベル空間のVUDAをレビューする。この場合、ソースドメインとターゲットドメインのラベル空間が同一であり、トレーニング中に両ドメインにアクセス可能である。
  • 非閉じたラベル空間のVUDAシナリオを分析する。オープンセット、パーシャルセット、ゼロショットドメイン適応を含み、実世界の展開においてより現実的である。
  • RGB、オプティカルフロー、音声、スケルタルデータ、深度、赤外線、LiDARなどのマルチモーダル入力を活用する方法を検討し、現在のVUDA手法におけるこれらのモダリティの未利用状態を強調する。
  • トランスフォーマーやグラフニューラルネットワーク(GNN)などの高度な特徴抽出器が、より良いドメイン統合を実現するための特徴品質を向上させる役割を果たすことを議論する。
  • 特に自然言語の監視(例:動画ラベル)を用いた対照的学習を含む自己教師あり技術の役割を検討し、ターゲットアノテーションが存在しない状況でも、クロスドメインの意味的統合を強化する。

実験結果

リサーチクエスチョン

  • RQ1敵対的、乖離ベース、意味的ベース、複合的、再構成ベースの各VUDA手法カテゴリーは、動画タスクにおける異なるドメインシフト条件において、どのように性能を発揮するか?
  • RQ2実用性とモデル一般化の観点から、閉じたラベル空間と非閉じたラベル空間のVUDAシナリオには、どのような主な違いとトレードオフがあるか?
  • RQ3RGB、オプティカルフロー、スケルタル、深度などのマルチモーダル動画特徴は、単一モーダル手法と比較して、どれほどドメイン適応性能を向上させるか?
  • RQ4自己教師あり学習技術、特にテキスト的または意味的ヒントを用いた対照的学習は、ターゲットラベルが存在しない状況で、どのように特徴統合を強化できるか?
  • RQ5センサの多様性、特徴品質、実世界への適用可能性の観点から、現在のVUDA研究における主な制限と未解決の課題は何か?

主な発見

  • 敵対的ベースおよび意味的ベースの手法は、対照的学習や疑似ラベル付けと組み合わせることで、ドメイン不変特徴学習において優れた性能を示す。
  • MMD や CORAL などの乖離ベースの手法は、分布の違いを最小化するのに効果的だが、複雑で高次元の動画特徴に対しては困難を伴うことがある。
  • 敵対的損失、メトリクス損失、対照的損失を組み合わせた複合的アプローチは、ドメイン統合と意味的整合性の両方をバランスさせるため、しばしば最先端の性能を達成する。
  • オートエンコーダ構造を用いた再構成ベースの手法は、アテンションメカニズムと組み合わせることで、分離可能でドメイン不変な表現を学習する点で有望である。
  • 現在のVUDA手法は、オープンセットやパーシャルセットなどの非閉じたラベル空間シナリオにおいては性能を発揮しないことが判明しており、より強固で柔軟な適応フレームワークの開発が求められる。
  • スケルタルデータ、深度、赤外線センサなどのマルチモーダル入力を活用することで、ドメインシフトに対するロバストネスが著しく向上するが、これらのモダリティは現在のVUDAフレームワークにおいて依然として未利用に近い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。