Skip to main content
QUICK REVIEW

[論文レビュー] Discriminating Spatial and Temporal Relevance in Deep Taylor Decompositions for Explainable Activity Recognition

Liam Hiley, Alun Preece|ORCA Online Research @Cardiff (Cardiff University)|Aug 5, 2019
Explainable Artificial Intelligence (XAI)参考文献 15被引用数 8
ひとこと要約

本稿では、動画アクティビティ認識のための深層ターリー分解における空間的・時間的関連性を分離するための判別的手法を提案する。動きを除いた入力を用いて、動き関連のサリエンシーを分離する。元の3次元説明から空間的説明を差し引くことで、従来曖昧だった動き関連領域を明らかにし、UCF-101で解釈性を向上させつつ、計算コストを最小限に抑える。

ABSTRACT

Current techniques for explainable AI have been applied with some success to image processing. The recent rise of research in video processing has called for similar work n deconstructing and explaining spatio-temporal models. While many techniques are designed for 2D convolutional models, others are inherently applicable to any input domain. One such body of work, deep Taylor decomposition, propagates relevance from the model output distributively onto its input and thus is not restricted to image processing models. However, by exploiting a simple technique that removes motion information, we show that it is not the case that this technique is effective as-is for representing relevance in non-image tasks. We instead propose a discriminative method that produces a naïve representation of both the spatial and temporal relevance of a frame as two separate objects. This new discriminative relevance model exposes relevance in the frame attributed to motion, that was previously ambiguous in the original explanation. We observe the effectiveness of this technique on a range of samples from the UCF-101 action recognition dataset, two of which are demonstrated in this paper.

研究の動機と目的

  • 3次元動画入力に適用された深層ターリー分解において、空間的および時間的関連性が混同されているという曖昧さを解消すること。
  • 動き関連の関連性を空間的特徴から明示的に分離することで、時空間的深層学習モデルの解釈性を向上させること。
  • 標準的な3次元説明では、空間的エッジ応答が優勢であるため、動き関連領域が隠蔽されていることの実証。
  • 動画モデルにおける動き固有の関連性を抽出・可視化するための軽量で計算効率の良い手法の提供。

提案手法

  • 本手法は、クリップ内のフレームを平均化することで、時間的ダイナミクスを除去した空間的特徴のみの入力を生成する動き除去技術を用いる。
  • この動き除去入力に深層ターリー分解を適用し、空間的寄与のみを表す空間的関連性マップを生成する。
  • その後、元の3次元説明から空間的関連性マップを差し引くことで、動きに起因する残差関連性を分離する。
  • これにより、動く腕や物体といった明確な動き関連領域を視覚化できる判別的関連性モデルが得られる。
  • 本手法は深層ターリー分解の入力ドメインに依存しない性質を活用しており、任意の時空間モデルに適用可能である。
  • 本手法はUCF-101で検証され、複数の動画サンプルにおいて、元の説明、空間的のみの説明、および動きのみの説明を比較した。

実験結果

リサーチクエスチョン

  • RQ1深層ターリー分解は、3次元動画入力において空間的および時間的関連性を効果的に区別できるのか、それとも本質的に混同されているのか?
  • RQ2空間的エッジの優勢さのため、標準的な3次元説明マップでは、動画クリップ内の動き情報がどの程度曖昧に保たれているのか?
  • RQ3シンプルで低コストな手法で、動画アクティビティ認識モデルにおける動き関連領域をどのように分離できるか?
  • RQ4提案手法は、標準的な深層ターリー説明よりも、より正確で解釈性の高いサリエンシー・パターンを明らかにできるか?
  • RQ5空間的および時間的関連性の分離は、ベンチマークデータセットにおける多様な動画アクティビティに一般化可能か?

主な発見

  • 元の深層ターリー説明では、空間的および時間的関連性が混同されており、大部分のエッジやテクスチャが関連しているとマークされ、静的背景要因までも含む。
  • 動き除去入力からの空間的説明では、芝生、壁、フレームエッジといった静的特徴が強調され、標準的説明における空間的優位性を裏付けている。
  • 元の3次元説明から空間的説明を差し引くことで、元々隠れていた動き関連領域(動いている体や四肢)が分離される。
  • プルアップ動画では、動き関連性が運動の最高点および最低点でピークに達し、運動変化の急激さに対応している。
  • テニスのサーブ動画では、動き関連性がスイング中の腕とボールに一貫して分布しており、微細な動きサリエンシーを示している。
  • 本手法により、動きが明示的に分離されていない場合、モデルの予測が空間的特徴に誤って引きずられる可能性があることが明らかになった。特に、フレームのみの予測が異なるアクティビティにずれ込むのを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。