Skip to main content
QUICK REVIEW

[論文レビュー] AdapNet: Adaptability Decomposing Encoder-Decoder Network for Weakly Supervised Action Recognition and Localization

Xiaoyu Zhang, Changsheng Li|arXiv (Cornell University)|Nov 27, 2019
Human Pose and Action Recognition参考文献 59被引用数 8
ひとこと要約

AdapNetは、弱教師付きアクション認識および局所化における、トリムド動画からアントリムド動画への信頼性の高い知識伝達を可能にする、適応性分解を組み込んだ新しいエンコーダデコーダネットワークを提案する。ドメイン適応可能特徴量とドメイン固有特徴量を分離し、時系列局所化に二方向のポイントプロセスを用いることで、AdapNetはTHUMOS14およびActivityNet1.3で最先端の性能を達成した。この性能は、動画レベルのラベルのみを用いて達成された。

ABSTRACT

The point process is a solid framework to model sequential data, such as videos, by exploring the underlying relevance. As a challenging problem for high-level video understanding, weakly supervised action recognition and localization in untrimmed videos has attracted intensive research attention. Knowledge transfer by leveraging the publicly available trimmed videos as external guidance is a promising attempt to make up for the coarse-grained video-level annotation and improve the generalization performance. However, unconstrained knowledge transfer may bring about irrelevant noise and jeopardize the learning model. This paper proposes a novel adaptability decomposing encoder-decoder network to transfer reliable knowledge between trimmed and untrimmed videos for action recognition and localization via bidirectional point process modeling, given only video-level annotations. By decomposing the original features into domain-adaptable and domain-specific ones based on their adaptability, trimmed-untrimmed knowledge transfer can be safely confined within a more coherent subspace. An encoder-decoder based structure is carefully designed and jointly optimized to facilitate effective action classification and temporal localization. Extensive experiments are conducted on two benchmark datasets (i.e., THUMOS14 and ActivityNet1.3), and experimental results clearly corroborate the efficacy of our method.

研究の動機と目的

  • トリムド動画からアントリムド動画への知識伝達の信頼性を向上させることを目的とし、動画レベルのラベルしか入手できない弱教師付きアクション認識および局所化の課題に取り組む。
  • トリムドからアントリムドへの制約のない知識伝達には、不要なノイズが混入し、モデルの一般化性能が低下する可能性があるという制限を克服する。
  • ドメイン適応可能特徴量に限定することで、知識伝達を信頼性高く保証する手法を開発する。
  • 粗い動画レベルのラベルのみを用いて、アントリムド動画におけるアクションの正確な時系列的局所化を実現する。
  • 三重符号化を備えたエンコーダデコーダ構造を用いて、アクション分類と時系列境界検出を統合的に最適化するフレームワークを設計する。

提案手法

  • トリムドドメインとアントリムドドメイン間での特徴量の伝達可能性に基づき、元の動画特徴量をドメイン適応可能とドメイン固有の成分に分離する適応性分解機構を提案する。
  • ドメイン適応可能特徴量とドメイン固有特徴量をそれぞれ抽出するための、共有エンコーダとプライベートエンコーダを備えた三重符号化アーキテクチャを設計する。これにより、判別性の高い特徴量学習が可能になる。
  • フレームを前向きおよび後向きの両方向に探索する二方向ポイントプロセスモデルを実装し、アクション局所化のための時系列境界検出を精緻化する。
  • 情報損失を最小限に抑えるために、デコーダモジュールを統合し、エンコーダデコーダパス全体で空間的および時系列的関連性を保持する。
  • ドメイン適応性損失($\mathcal{L}_{\mathrm{adp}}$)とドメイン差異損失($\mathcal{L}_{\mathrm{dif}}$)を組み合わせた共同最適化損失を定式化し、分解をガイドし、一般化性能を向上させる。
  • マルチビュー時系列クラスアクティベーションマッピング(T-CAM)をクラス固有の指標として用い、自己注意表現によるフレームレベルの注目を活用して、正確なアクション局所化を実現する。

実験結果

リサーチクエスチョン

  • RQ1特徴量の適応性分解は、弱教師付きアクション認識におけるトリムドからアントリムドへの知識伝達の信頼性を向上させることができるか?
  • RQ2ドメイン適応可能特徴量とドメイン固有特徴量を分離することで、動画レベルの監督のみでアントリムド動画におけるアクション局所化性能にどのような影響を与えるか?
  • RQ3二方向ポイントプロセスモデリングは、一方向または非ポイントプロセスアプローチと比較して、時系列境界検出性能をどの程度向上させるか?
  • RQ4提案された三重符号化を備えたエンコーダデコーダ構造は、弱教師付き条件下で、標準ネットワークと比較して、アクション分類と局所化の両方で優れた性能を発揮できるか?
  • RQ5提案手法は、完全教師付きおよび弱教師付きSOTA手法と比較して、局所化精度およびドメインシフトに対するロバストネスの面で優れているか?

主な発見

  • AdapNetは、THUMOS14およびActivityNet1.3の両データセットで最先端の性能を達成し、既存の弱教師付き手法を上回るアクション局所化性能を示した。
  • いくつかの完全教師付きベースラインと同等またはそれ以上の平均平均精度(mAP@IoU=0.5)を達成した。これは、弱教師付き条件下でも強力な一般化性能を示していることを裏付けている。
  • アブレーションスタディの結果、共有エンコーダとプライベートエンコーダの両方が不可欠であることが確認された。いずれかのコンponentを削除すると、性能が著しく低下した。
  • RGBとオプティカルフローの両方の特徴量を組み込むことで、さらに精度が向上した。これは、特徴量分解におけるマルチモodal入力の利点を示している。
  • 定性的な結果から、AdapNetは複雑な背景、大きな視点変化、類似するアクションパターンを含む動画においても、競合手法よりも少ない誤検出を伴ってアクションを効果的に局所化できていることが分かった。
  • TSRNetとは異なり、制約のない知識伝達により不要なクリップに誤検出が生じるのを防ぐために、AdapNetは知識伝達を意味的に整合性のある部分空間に限定している。その結果、より正確で信頼性の高い局所化が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。