Skip to main content
QUICK REVIEW

[論文レビュー] Spatio-temporal Human Action Localisation and Instance Segmentation in Temporally Untrimmed Videos

Suman Saha, Gurkirt Singh|arXiv (Cornell University)|Jul 22, 2017
Human Pose and Action Recognition参考文献 24被引用数 8
ひとこと要約

本論文は、時間的にトリムされていない動画における空間的・時間的行動検出およびインスタンスセグメンテーションのための新規フレームワークを提案する。動的計画法を用いて空間的・時間的領域を最適化し、前景・背景セグメンテーションを活用してピクセル単位のインスタンスマスクを生成する。LIRIS-HARLデータセットにおいて、先行研究の14.3倍の性能向上を達成した。

ABSTRACT

Current state-of-the-art human action recognition is focused on the classification of temporally trimmed videos in which only one action occurs per frame. In this work we address the problem of action localisation and instance segmentation in which multiple concurrent actions of the same class may be segmented out of an image sequence. We cast the action tube extraction as an energy maximisation problem in which configurations of region proposals in each frame are assigned a cost and the best action tubes are selected via two passes of dynamic programming. One pass associates region proposals in space and time for each action category, and another pass is used to solve for the tube's temporal extent and to enforce a smooth label sequence through the video. In addition, by taking advantage of recent work on action foreground-background segmentation, we are able to associate each tube with class-specific segmentations. We demonstrate the performance of our algorithm on the challenging LIRIS-HARL dataset and achieve a new state-of-the-art result which is 14.3 times better than previous methods.

研究の動機と目的

  • 時間的にトリムされていない動画において、複数の同時進行する人間の行動を検出する課題に取り組む。先行研究は単一の行動やトリム済みクリップに焦点を当てている。
  • 空間的・時間的領域を同時に局所化するとともに、ピクセル単位のインスタンスマスクを生成する。
  • 空間的局所化を無視するか、外観が類似する重複する複雑な行動に対して失敗する既存手法の限界を克服する。
  • 1フレームに複数の行動が存在するが、時間的トリムがない現実世界のシナリオでも、堅牢な検出を可能にする。
  • 時間的にトリムされていない動画における人間行動検出のための、初めての質的インスタンスマスク結果を提供する。

提案手法

  • フレーム間の領域候補設定に対するコストを割り当てることで、行動チューブ抽出をエネルギー最大化問題として定式化する。
  • 動的計画法を2回適用する:1回目は各行動カテゴリごとに空間的・時間的領域を関連付けるためのもの、2回目は時間的範囲を決定し、滑らかなラベル系列を強制するためのもの。
  • [24]の前景・背景セグメンテーションを活用し、人間マスク内の連結成分に基づいて領域候補を生成する。
  • 外観、動き、空間的重複度をバランスさせるコスト関数を用いて、時間的に一貫性のある候補を組み合わせることで、空間的・時間的チューブを構築する。
  • クラス固有のインスタンスマスクセグメンテーションを、検出されたチューブとその対応する前景マップからのセグメンテーションマスクを関連付けることで統合する。
  • 各フレームが到着する度に動的計画法を段階的に更新することで、オンライン推論用にパイプラインを適応させ、リアルタイム行動検出を実現する。

実験結果

リサーチクエスチョン

  • RQ1時間的にトリムされていない動画において、複数の同時進行する行動を統合的に空間的・時間的局所化とインスタンスマスクセグメンテーションを実行できるフレームワークは構築可能か?
  • RQ2動的計画法を効果的に適用することで、空間的・時間的領域を最適化し、時間的整合性を保証する3次元チューブ候補を最適化できるか?
  • RQ3前景・背景セグメンテーションは、複雑なシーンにおける行動インスタンスマスクの品質と正確性をどの程度向上させるか?
  • RQ4本手法は、現実的で困難なデータセットにおいて、先行研究の最先端手法と比較して、検出およびセグメンテーション性能で優れているか?
  • RQ5本手法は、リアルタイム行動検出を可能にするオンラインで段階的な推論設定に拡張可能か?

主な発見

  • 本手法は、LIRIS-HARLデータセットにおいて、先行研究の14.3倍の性能向上を達成した。
  • 時間的再現率閾値 $t_{tr} = 1$ において、HMSベースの手法は50%の再現率と65%の正確性を達成し、IACAS-51が報告する2.4%の再現率と3.7%の正確性を大きく上回った。
  • ピクセル単位の空間的再現率 $t_{sr} = 0.7$ において、HMSベースの手法は45–50%の再現率と59–65.5%の正確性を維持し、SSベースの手法よりも両方の指標で優れた性能を示した。
  • ピクセル単位の正確性閾値 $t_{sp} = 0.7$ において、HMSベースの手法は48–63%の正確性を達成したのに対し、SSベースの手法は41–53%であった。
  • 本手法は、さまざまな閾値において一貫した性能を示し、特に厳密な時間的・空間的重複制約下でも正確性、再現率、F1スコアにわたる安定性を示した。
  • 初めての質的インスタンスマスク結果が成功裏に生成され、1フレーム内で重複する行動の正確なピクセル単位のマスクが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。