Skip to main content
QUICK REVIEW

[論文レビュー] Explaining Motion Relevance for Activity Recognition in Video Deep Learning Models

Liam Hiley, Alun Preece|arXiv (Cornell University)|Mar 31, 2020
Explainable Artificial Intelligence (XAI)被引用数 14
ひとこと要約

本稿では、3D CNNベースの動画アクティビティ認識モデルにおける動き固有の説明を分離・強化するための後処理手法である選択的関連性(selective relevance)を提案する。標準的な2D類似性マップから空間的に優勢で動きに関連のない領域をフィルタリングすることで、説明の選択的を向上させ、モデルの解釈可能性を人間の動き認識と一致させた。その結果、3D CNNは動きよりも空間的文脈に強く偏っていることが明らかになった。

ABSTRACT

A small subset of explainability techniques developed initially for image recognition models has recently been applied for interpretability of 3D Convolutional Neural Network models in activity recognition tasks. Much like the models themselves, the techniques require little or no modification to be compatible with 3D inputs. However, these explanation techniques regard spatial and temporal information jointly. Therefore, using such explanation techniques, a user cannot explicitly distinguish the role of motion in a 3D model's decision. In fact, it has been shown that these models do not appropriately factor motion information into their decision. We propose a selective relevance method for adapting the 2D explanation techniques to provide motion-specific explanations, better aligning them with the human understanding of motion as conceptually separate from static spatial features. We demonstrate the utility of our method in conjunction with several widely-used 2D explanation methods, and show that it improves explanation selectivity for motion. Our results show that the selective relevance method can not only provide insight on the role played by motion in the model's decision -- in effect, revealing and quantifying the model's spatial bias -- but the method also simplifies the resulting explanations for human consumption.

研究の動機と目的

  • 3D CNNにおける動画アクティビティ認識の分野で、動き固有の解釈可能性の欠如を是正すること。
  • 説明マップにおける時間的(動き)と空間的(文脈)な関連性を分離することで、モデル意思決定の理解を人間の認識と一致させること。
  • モデルアーキテクチャを変更せずに、3D CNNにおける空間的バイアスの程度を定量化すること。
  • 既存の2D説明技術を強化できる軽量で後処理型の手法を提供すること。
  • 簡略化された動き中心の説明を通じて、リアルタイムでのモデル挙動のデバッグと分析を可能にすること。

提案手法

  • 空間的時間的特徴マップに2D類似性手法(例:GradCAM、ガイドドバックプロパゲーション)を適用することで、3D動画入力に適応する。
  • 光流に基づく動きに敏感なしきい値処理を実施し、関連性マップ内の動きに関連する領域のみを特定・保持する。
  • 動きの代理として光流を用い、フレーム間の時間的変化を分離する動きマスクを計算する。
  • 元の関連性マップと動きマスクを乗算することで選択的関連性を適用し、空間的に優勢で動きに関係のない特徴を除外する。
  • データ駆動型しきい値(例:2標準偏差)を用いて選択的を制御し、関連性の保持とノイズ低減のバランスを取る。
  • 一貫性と動き表現の向上を評価するために、複数のベースライン説明手法を用いて手法の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1標準的な2D説明手法は、3D CNNにおいて、動きと空間的文脈をどの程度区別できないか?
  • RQ2後処理によるフィルタリング手法は、3D CNNの説明において動きに関連する領域を効果的に分離できるか?
  • RQ3選択的関連性は、時間的動画タスクにおけるモデル説明の解釈可能性と選択的をどのように向上させるか?
  • RQ4選択的関連性によって明らかにされた3D CNNにおけるアクティビティ認識の空間的バイアスの程度はどの程度か?
  • RQ5選択的関連性は、説明手法と人間の動き認識との一致を高めるか?

主な発見

  • 選択的関連性は、全テストベースライン手法において一貫して動きの表現を向上させ、不要な空間的ノイズを低減した。
  • この手法により、3D CNNモデルが分類意思決定において空間的特徴(文脈)に強く偏っていることが明らかになった。
  • DTD(Deep Taylor分解)は選択的関連性の恩恵を最も大きく受け、GradCAMやGuided GradCAMと同等の精度を達成し、文脈的ノイズの削減が最大であった。
  • GradCAMやGuided GradCAMの説明も簡素化されたが、しばしば関連性をあまりに多く除去し、疎になったり情報量が少なくなったりする傾向があった。
  • 選択的関連性手法は計算コストが極めて低く、リアルタイムでのモデルデバッグや分析に適している。
  • ベースライン説明手法間での関連性分布の一致度は低かったが、選択的関連性により一貫性が向上し、動き認識と一致するようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。