Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Cross-Domain Action Recognition with Co-Attention

Boxiao Pan, Zhangjie Cao|arXiv (Cornell University)|Dec 22, 2019
Human Pose and Action Recognition参考文献 43被引用数 8
ひとこと要約

本論文は、ソースドメインとターゲットドメイン間の時間的対応するアクション情報をもつセグメントを一致させるために、新規のクロスドメイン相互注意メカニズムを用いた時系列相互注意ネットワーク(TCoN)を提案する。TCoNは、ターゲットに一致するソース特徴を生成し、これらの時間的に一致した特徴の分布をマッチングすることで、3つのベンチマークデータセットにおいて先行手法を著しく上回り、クロスドメインアクション認識分野で最先端の性能を達成する。

ABSTRACT

Action recognition has been a widely studied topic with a heavy focus on supervised learning involving sufficient labeled videos. However, the problem of cross-domain action recognition, where training and testing videos are drawn from different underlying distributions, remains largely under-explored. Previous methods directly employ techniques for cross-domain image recognition, which tend to suffer from the severe temporal misalignment problem. This paper proposes a Temporal Co-attention Network (TCoN), which matches the distributions of temporally aligned action features between source and target domains using a novel cross-domain co-attention mechanism. Experimental results on three cross-domain action recognition datasets demonstrate that TCoN improves both previous single-domain and cross-domain methods significantly under the cross-domain setting.

研究の動機と目的

  • トレーニングデータとテストデータが異なる分布に由来するドメインシフトの課題に対処すること。
  • 既存手法がクロスドメイン環境下で時間的不一致やノイズの多いセグメントマッチングを適切に処理できないという限界を克服すること。
  • ラベル付きソースドメインデータを活用して、ラベルなしのターゲットドメイン動画におけるアクション認識性能を向上させること。
  • セグメントの重要度とクロスドメイン類似度を同時に考慮する相互注意メカニズムを設計し、より良い特徴一致を実現すること。

提案手法

  • セグメントの自己重要度とクロスドメイン類似度に基づいて注意スコアを計算するクロスドメイン相互注意モジュールを提案する。
  • ソース特徴をターゲット特徴と時間的順序で一致させることで、ターゲットに一致するソース特徴を生成する。これにより、分布マッチングが向上する。
  • ターゲットに一致するソース特徴とターゲット特徴の間のドメイン差を最小化するセグメントレベルの識別器を採用する。
  • 2ストリームの adversarial 訓練設定を採用:1本目はアクション分類、2本目はセグメントレベルでのドメイン識別。
  • 時間的相互注意を適用し、ドメイン間で意味的に類似するキーフレームに注目することで、背景や関係のないセグメントからのノイズを低減する。
  • 時間的順序で一致したソース特徴を連結し、ターゲット動画と時間的に整合性を持つアクションレベルの表現を構築する。

実験結果

リサーチクエスチョン

  • RQ1ドメイン内での重要度とドメイン間での類似度の両方を考慮する相互注意メカニズムは、クロスドメインアクション認識を改善できるか?
  • RQ2ソース特徴をターゲット動画の時間的構造に合わせて一致させることで、分布マッチングと認識精度が向上するか?
  • RQ3本手法は、時間的不一致を扱う点で、既存のドメイン適応技術と比較してどのように優れているか?
  • RQ4ソースドメインとターゲットドメインに同じアクションクラスを共有しない場合、モデルの一般化性能はどの程度維持されるか?

主な発見

  • TCoNは、3つのクロスドメインアクション認識ベンチマーク(HMDB51→UCF101、UCF101→HMDB51、Jester(S)→Jester(T))で最先端の性能を達成した。
  • Jester(S)→Jester(T)のスプリットでは、トップ1正解率が89.7%に達し、前回のSOTA手法を2.1%上回った。
  • アブレーションスタディの結果、相互注意メカニズムとターゲットに一致するソース特徴の両方が不可欠であることが確認され、後者は時間的不一致を低減し、性能向上に寄与した。
  • 相互注意行列の可視化から、モデルがドメイン間でキーポイントとなるアクション段階(例:ディスクスロー動画の投げる段階)を的確に一致させていることが示された。
  • t-SNE可視化では、TCoNのターゲットに一致するソース特徴が、ソースとターゲットの特徴分布のギャップを埋め、滑らかでより凝集した特徴空間を形成していることが確認された。
  • 非重複アクションクラスを持つ挑戦的な設定(HMDB51→UCF101_all)でも、TCoNは強力な性能を維持しており、ドメインシフトに対して高いロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。