Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Domain Adaptation for Spatio-Temporal Action Localization

Nakul Agarwal, Yi‐Ting Chen|arXiv (Cornell University)|Oct 19, 2020
Human Pose and Action Recognition参考文献 22被引用数 4
ひとこと要約

本稿では、画像レベルおよびインスタンスレベルでの空間的・時間的特徴の共同適応によりドメインシフトを低減する、空間時系列行動検出のためのエンドツーエンド自己教師付きドメイン適応フレームワークを提案する。Faster R-CNNに、時間的および空間的特徴の画像レベルでの敵対的適応モジュール、およびインスタンスレベルでの時間的特徴の敵対的適応モジュールを統合することで、UCF-Sports、UCF-101、JHMDBの各データセットにおいて顕著な性能向上を達成した。特に視覚的・時間的差異が大きいクロスドメイン設定において顕著である。

ABSTRACT

Spatio-temporal action localization is an important problem in computer vision that involves detecting where and when activities occur, and therefore requires modeling of both spatial and temporal features. This problem is typically formulated in the context of supervised learning, where the learned classifiers operate on the premise that both training and test data are sampled from the same underlying distribution. However, this assumption does not hold when there is a significant domain shift, leading to poor generalization performance on the test data. To address this, we focus on the hard and novel task of generalizing training models to test samples without access to any labels from the latter for spatio-temporal action localization by proposing an end-to-end unsupervised domain adaptation algorithm. We extend the state-of-the-art object detection framework to localize and classify actions. In order to minimize the domain shift, three domain adaptation modules at image level (temporal and spatial) and instance level (temporal) are designed and integrated. We design a new experimental setup and evaluate the proposed method and different adaptation modules on the UCF-Sports, UCF-101 and JHMDB benchmark datasets. We show that significant performance gain can be achieved when spatial and temporal features are adapted separately, or jointly for the most effective results.

研究の動機と目的

  • 訓練データとテストデータの間のドメインシフトによって引き起こされる一般化性能の低下という課題に対処する。
  • ラベルが存在しないターゲットドメインを想定した、行動検出のための新しい自己教師付きドメイン適応フレームワークを構築する。
  • 空間的および時間的特徴をドメイン間で共同で整列させる複数のドメイン適応モジュールを設計・統合する。
  • 既存のベンチマークがこのような評価プロトコルを欠いていることから、空間時系列行動検出におけるドメイン適応の評価を可能にする新しい実験設定を確立する。
  • 空間的および時間的特徴の個別的および共同的適応が、ドメインシフト下での検出性能を顕著に向上させることを実証する。

提案手法

  • I3Dバックボーンを用いて動画特徴を抽出できるように、Faster R-CNNフレームワークを空間時系列行動検出に拡張する。
  • 3つのドメイン適応モジュールを導入する:(1) 画像レベルでの時間的特徴整列、(2) インスタンスレベルでの時間的特徴整列、(3) 画像レベルでの空間的特徴整列。
  • ドメイン分類器を用いた敵対的学習により、画像レベルおよびインスタンスレベルでドメイン不変特徴を学習する。
  • 検出ヘッドと統合してエンドツーエンドで適応モジュールを学習し、検出とドメイン整列の共同最適化を可能にする。
  • 画像レベルの時間的適応ではグローバルなシーンコンテキストを活用し、インスタンスレベルの適応ではアクター/行動のダイナミクスを活用することで、特徴の一般化性能を向上させる。
  • クロスデータセット適応(例:UCF-101 → JHMDB)を用いた新しい評価プロトコルを設計し、ドメインシフト下での性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1ラベルが存在しないターゲットアノテーションのもとで、自己教師付きドメイン適応が空間時系列行動検出におけるドメインシフトを効果的に低減できるか?
  • RQ2画像レベルとインスタンスレベルの時間的特徴整列は、どちらが検出性能の向上に寄与するか?
  • RQ3空間的特徴整列は、検出誤りを低減し、プロポーザル品質を向上させるにあたり、どの程度の貢献を果たすか?
  • RQ4空間的および時間的特徴の共同適応は、個別的適応よりも優れた性能を達成するか?
  • RQ5UCF-101とJHMDBの間で生じる視覚的および時間的差異は、モデルの一般化性能にどのように影響するか?また、適応によってその影響を軽減できるか?

主な発見

  • 提案手法は、UCF-Sports、UCF-101、JHMDBの各データセットにおいて、自己教師付きドメイン適応設定下で顕著な性能向上を達成し、ベースラインと比較してmAPが向上した。
  • 空間的および時間的特徴の共同適応が最良の性能を示し、特に視覚的・時間的ドメインシフトが大きい状況では、個別的適応モジュールを上回った。
  • インスタンスレベルでの時間的適応により、誤検出および誤分類のエラーが低減され、行動ダイナミクスのモデリングが向上したことが示された。
  • 画像レベルでの空間的適応により、領域プロポーザルネットワーク(RPN)の品質が向上し、誤検出エラーが顕著に低減された。
  • 3つの適応モジュールをすべて統合したモデルは、トップ1000検出結果における誤検出率が最低で、正しく検出された検出数も最多であった。
  • ベースラインモデルは、大規模な学習データ(例:UCF-101)を用いてもJHMDBでは性能が著しく低かったが、これはドメインシフトの影響、特にWalkおよびBasketballクラスにおいて顕著であった。一方、適応によりそのギャップが顕著に縮小された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。