Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Moments in Time: Learning and Interpreting Models for Multi-Action Video Understanding

Mathew Monfort, Bowen Pan|arXiv (Cornell University)|Nov 1, 2019
Human Pose and Action Recognition被引用数 8
ひとこと要約

本論文は、100万本の3秒間動画にわたる200万以上のアクションラベルを含む大規模なマルチラベル動画データセットであるMulti-Moments in Time (M-MiT) を紹介する。これにより、マルチアクション動画理解のためのモデルの学習と評価が可能になる。本研究では、長尾分布への学習のためのwLSEP損失関数、マルチアクション注意の可視化のためのmCAM、および学習済みアクション概念の解釈のためのAction Network Dissectionという新しい手法を提案し、下流タスクにおけるモデルの解釈性と転移性能の向上を実証した。

ABSTRACT

Videos capture events that typically contain multiple sequential, and simultaneous, actions even in the span of only a few seconds. However, most large-scale datasets built to train models for action recognition in video only provide a single label per video. Consequently, models can be incorrectly penalized for classifying actions that exist in the videos but are not explicitly labeled and do not learn the full spectrum of information present in each video in training. Towards this goal, we present the Multi-Moments in Time dataset (M-MiT) which includes over two million action labels for over one million three second videos. This multi-label dataset introduces novel challenges on how to train and analyze models for multi-action detection. Here, we present baseline results for multi-action recognition using loss functions adapted for long tail multi-label learning, provide improved methods for visualizing and interpreting models trained for multi-label action detection and show the strength of transferring models trained on M-MiT to smaller datasets.

研究の動機と目的

  • 動画内で複数のアクションが同時にまたは連続的に発生するのを捉えられない単一ラベルの動画データセットの限界を解消すること。
  • 既存の単一ラベルデータセット(Moments in Timeなど)と同等の多様性と規模を保ちつつ、スケーラブルな大規模マルチラベル動画データセットを構築すること。
  • 動画におけるマルチアクション認識に特化した新しい学習目的関数と解釈性手法を設計すること。
  • マルチラベルアクション検出のための視覚的注意マッピングと特徴の分解を用いた、モデル分析の向上を実現すること。

提案手法

  • Moments in Timeデータセットを拡張し、100万本の3秒間動画にわたる200万以上のアクションラベルを含むマルチラベルデータセットM-MiTを構築した。
  • マルチラベル動画学習における長尾クラス分布に対処するため、LSEP損失関数の重み付き版であるwLSEPを提案した。
  • 複数の同時アクションの予測に寄与するフレーム内の空間領域を特定するため、mCAM(マルチラベルクラス活性マッピング)を導入した。
  • NetDissectフレームワークに、アクション領域の新しい単一フレームデータセットを組み込むことで、学習済み特徴をアクション概念として解釈するためのAction Network Dissectionを開発した。
  • M-MiTで訓練されたResNet-50バックボーンを用いて、解釈性と転移学習性能の評価を実施した。
  • 損失関数のアブレーションスタディ、解釈性の向上、および小規模データセットへの転移性能の評価を通じて、手法の有効性を検証した。

実験結果

リサーチクエスチョン

  • RQ11つの動画内で複数のアクションが同時に発生するが、ラベルが長尾分布に偏っている状況において、深層モデルを効果的にマルチアクション動画認識に訓練する方法は何か?
  • RQ2クラスの不均衡や長尾分布を考慮したマルチラベル動画アクション認識に最も効果的な損失関数は何か?
  • RQ3視覚的注意マッピングと特徴の分解を用いることで、マルチアクション検出のための深層モデルの解釈性をどのように向上できるか?
  • RQ4M-MiTで訓練されたモデルは、小規模な下流データセットへの転移学習において、どの程度一般化性能を示すか?
  • RQ5ネットワークの解釈フレームワークにアクション固有の概念を統合することで、意味のある学習済み特徴の特定がどのように向上するか?

主な発見

  • M-MiTデータセットには、100万本の3秒間動画にわたる200万以上のアクションラベルが含まれており、既存の動画データセットと比べてスケールとマルチラベルカバレッジが顕著に拡大されている。
  • wLSEP損失関数は、不均衡なデータに対処するためのクラス重みを組み込むことで、長尾マルチラベルアクション認識におけるモデル性能を向上させた。
  • mCAMは、同時に発生する複数のアクションの予測に寄与するフレーム内の複数の空間領域を効果的に特定でき、マルチアクション行動の局所化に優れた性能を示した。
  • Action Network Dissectionにより、Broden概念のみを用いた場合の1,351個の解釈可能な特徴から、Broden+アクション領域を組み合わせた場合の2,023個に増加した。そのうち120種類の異なるアクションを含む211個の解釈可能な概念が得られた。
  • Brodenデータセットにアクション固有の概念を追加することで、解釈可能な特徴の数が49%増加した。これは、アクション固有の概念がアクション認識特徴の解釈に不可欠であることを示している。
  • M-MiTで訓練されたモデルは、小規模な下流データセットに対しても優れた転移性能を示しており、一般化のためのより豊かな監視信号の有効性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。