Skip to main content
QUICK REVIEW

[論文レビュー] Collaborative Attention Mechanism for Multi-View Action Recognition

Yue Bai, Zhiqiang Tao|arXiv (Cornell University)|Sep 14, 2020
Human Pose and Action Recognition参考文献 47被引用数 9
ひとこと要約

本稿では、相互支援RNN(MAR)セルを介して視点間の相互注目を活用することで、マルチビュー行動認識を向上させる共同注目メカニズム(CAM)を提案する。視点固有の注目差異を活用することで、各視点は他方の視点から、検出が難しい潜在的な時間的パターンを発見可能となり、4つのデータセットにおいて単一視点およびマルチビュー性能の両方を向上させ、EV-ActionおよびKinetics-Soundsで最先端の結果を達成する。

ABSTRACT

Multi-view action recognition (MVAR) leverages complementary temporal information from different views to improve the learning performance. Obtaining informative view-specific representation plays an essential role in MVAR. Attention has been widely adopted as an effective strategy for discovering discriminative cues underlying temporal data. However, most existing MVAR methods only utilize attention to extract representation for each view individually, ignoring the potential to dig latent patterns based on mutual-support information in attention space. To this end, we propose a collaborative attention mechanism (CAM) for solving the MVAR problem in this paper. The proposed CAM detects the attention differences among multi-view, and adaptively integrates frame-level information to benefit each other. Specifically, we extend the long short-term memory (LSTM) to a Mutual-Aid RNN (MAR) to achieve the multi-view collaboration process. CAM takes advantages of view-specific attention pattern to guide another view and discover potential information which is hard to be explored by itself. It paves a novel way to leverage attention information and enhances the multi-view representation learning. Extensive experiments on four action datasets illustrate the proposed CAM achieves better results for each view and also boosts multi-view performance.

研究の動機と目的

  • 既存のマルチビュー行動認識手法が視点を独立して扱い、注目空間における相互情報を利用しないという限界を是正すること。
  • 孤立した状態では検出が難しい、補完的で潜在的な特徴を発見することで、視点固有の表現学習を向上させること。
  • 注目空間における視点間の協調を可能にするメカニズムを構築し、個々の視点性能および最終統合精度を向上させること。
  • 異なるモodal(例:RGBと深度)の特徴を活かした解釈可能な注目ベースの手法を提供すること、特に時間的行動認識において。

提案手法

  • 視点間の双方向的注目ベースの協調を可能にするためにLSTMを拡張した相互支援RNN(MAR)セルを提案する。
  • 視点固有の時間的注目分布(Z^v)を用いて、各モダリティごとの顕著なフレームを特定する。
  • 注目差に基づき、他方の視点が見逃したフレームに注目を向けるように各視点を誘導する共同注目メカニズムを導入する。
  • 強化された単一視点表現を後期統合することで、マルチビュー認識性能を向上させる。
  • 視点間の知識を活用して注目マップを精緻化するため、注目スコアのモodulation(Z^v_M)を活用する。
  • 視点間の相互サポートに基づき、動的にフレームレベルの注目を調整する学習可能な注目メカニズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1視点間の注目協調は、マルチビュー行動認識における判別的時間的パターンの発見を向上させ得るか?
  • RQ2視点間の相互注目誘導は、個々の視点注目を超えて表現学習をどのように向上させるか?
  • RQ3提案されたCAMは、単一視点およびマルチビュー行動認識ベンチマークにおいて、どの程度性能を向上させるか?
  • RQ4注目可視化による解釈可能性は、異なるモダリティ間で補完的特徴を正しく捉えていることを確認できるか?

主な発見

  • 提案されたCAMはEV-Actionデータセットで最先端の性能を達成し、マルチビュー精度が73.59%に達し、ベースラインLSTM(71.54%)およびアブレーションモデルを上回った。
  • Kinetics-Soundsデータセットでは83.7%の精度を達成し、以前の最先端手法を1.2ポイント上回った。
  • アブレーションスタディの結果、MARセルを削除するか、1つの視点の協調を無効化すると性能が低下し、視点間協調の必要性が裏付けられた。
  • 可視化結果から、CAMは個々の視点が見逃したフレームを正しく特定していることが確認された。例えば、深度視点は「投げ上げの頂点」を検出しており、RGB視点は「手を挙げる/下ろす」を捉え、CAMは他方の視点にそれらに注目させるように誘導した。
  • 混同行列解析から、CAMは特に検出が難しい行動フェーズの誤分類率を低減しており、重要なフレームへの注目強化によってその効果が得られていることが示された。
  • モデルは複数のデータセットにわたり高いロバスト性を示し、後期統合の前から単一視点性能が一貫して向上しており、効果的な表現学習が実現していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。