Skip to main content
QUICK REVIEW

[논문 리뷰] Spatio-temporal Human Action Localisation and Instance Segmentation in Temporally Untrimmed Videos

Suman Saha, Gurkirt Singh|arXiv (Cornell University)|2017. 07. 22.
Human Pose and Action Recognition참고 문헌 24인용 수 8
한 줄 요약

이 논문은 시간적으로 잘리지 않은 영상에서 다중 동시 인간 행동을 탐지하고 인스턴스 세분화하는 새로운 스페로-타임 동작 탐지 및 인스턴스 세분화 프레임워크를 제안한다. 공간과 시간에 걸쳐 행동 튜브 제안을 최적화하기 위해 동적 프로그래밍을 사용하며, 전경-배경 세분화를 활용해 픽셀 수준의 인스턴스 마스크를 생성한다. 이는 LIRIS-HARL 데이터셋에서 이전 최고 성능 기준 14.3배 향상된 성능을 달성한다.

ABSTRACT

Current state-of-the-art human action recognition is focused on the classification of temporally trimmed videos in which only one action occurs per frame. In this work we address the problem of action localisation and instance segmentation in which multiple concurrent actions of the same class may be segmented out of an image sequence. We cast the action tube extraction as an energy maximisation problem in which configurations of region proposals in each frame are assigned a cost and the best action tubes are selected via two passes of dynamic programming. One pass associates region proposals in space and time for each action category, and another pass is used to solve for the tube's temporal extent and to enforce a smooth label sequence through the video. In addition, by taking advantage of recent work on action foreground-background segmentation, we are able to associate each tube with class-specific segmentations. We demonstrate the performance of our algorithm on the challenging LIRIS-HARL dataset and achieve a new state-of-the-art result which is 14.3 times better than previous methods.

연구 동기 및 목표

  • 이전 방법이 단일 동작, 잘린 클립에 집중하는 데 반해, 시간적으로 잘리지 않은 영상에서 다중 동시 인간 행동을 탐지하는 도전 과제를 해결한다.
  • 공간과 시간에 동시에 동작을 국소화하면서 픽셀 수준의 인스턴스 세분화 마스크를 생성한다.
  • 기존 방법이 공간 국소화를 忽略하거나 유사한 외관을 가진 복잡하고 겹치는 동작에서 실패하는 한계를 극복한다.
  • 다중 동작이 한 프레임에 존재하고 시간적으로 잘리지 않은 실세계 시나리오에서도 강건한 탐지를 가능하게 한다.
  • 시간적으로 잘리지 않은 영상에서 인간 행동 탐지에 대해 첫 번째로 질적 인스턴스 세분화 결과를 제공한다.

제안 방법

  • 모든 프레임에 걸쳐 영역 제안 구성에 대한 비용을 할당함으로써 행동 튜브 추출을 에너지 최대화 문제로 공식화한다.
  • 동적 프로그래밍을 두 번 적용한다: 하나는 각 동작 카테고리별로 공간과 시간에 걸쳐 제안을 연결하기 위한 것이고, 다른 하나는 시간 범위를 결정하고 부드러운 레이블 시퀀스를 강제하기 위한 것이다.
  • 24번 참고문헌에서 제안한 전경-배경 세분화를 활용하여 인간 마스크의 연결 성분을 기반으로 영역 제안을 생성한다.
  • 시간적으로 일관된 제안을 조합하여 공간-시간 튜브를 구성하며, 외관, 운동, 공간적 오버랩을 균형 잡는 비용 함수를 사용한다.
  • 각 검출된 튜브를 전경 맵에서 해당하는 세분화 마스크와 연결함으로써 클래스별 인스턴스 세분화를 통합한다.
  • 각 신규 프레임을 수신할 때마다 동적 프로그래밍을 점진적으로 업데이트함으로써 온라인 추론에 적합한 파이프라인으로 변형하여 실시간 동작 탐지가 가능하게 한다.

실험 결과

연구 질문

  • RQ1시간적으로 잘리지 않은 영상에서 다중 동시 동작이 존재하는 상황에서, 통합된 프레임워크가 스페로-타임 동작 국소화와 인스턴스 세분화를 동시에 수행할 수 있는가?
  • RQ2시간과 공간에 걸쳐 3차원 튜브 제안을 최적화하고 시간 일관성을 강제하기 위해 동적 프로그래밍을 효과적으로 적용할 수 있는가?
  • RQ3전경-배경 세분화가 복잡한 시나리오에서 행동 인스턴스 세분화의 품질과 정확도에 어느 정도 기여하는가?
  • RQ4어려운 실세계 데이터셋에서 이전 최고 성능 기준으로 비교했을 때, 제안된 방법의 탐지 및 세분화 성능은 어떠한가?
  • RQ5실시간 동작 탐지를 위한 온라인, 점진적 추론 환경으로 이 방법을 확장할 수 있는가?

주요 결과

  • 제안된 방법은 LIRIS-HARL 데이터셋에서 이전 최고 성능 기준 14.3배 향상된 성능을 달성한다.
  • 시간적 재현율 임계값 $t_{tr} = 1$에서 HMS 기반 접근법은 50% 재현율과 65% 정밀도를 기록하며, IACAS-51에 비해 크게 뛰어나다. IACAS-51는 각각 2.4% 재현율과 3.7% 정밀도를 보고한다.
  • 픽셀 수준의 공간 재현율 임계값 $t_{sr} = 0.7$에서 HMS 기반 접근법은 45–50% 재현율과 59–65.5% 정밀도를 유지하며, SS 기반 방법보다 두 지표에서 모두 뛰어나다.
  • 픽셀 수준의 정밀도 임계값 $t_{sp} = 0.7$에서 HMS 기반 접근법은 48–63% 정밀도를 기록하며, SS 기반 방법의 41–53%보다 높다.
  • 다양한 임계값에서 높은 일관성 있는 성능을 보이며, 특히 엄격한 시간적 및 공간적 오버랩 조건에서 정밀도, 재현율, F1-스코어 모두에서 우수한 성능을 유지한다.
  • 첫 번째로 질적 인스턴스 세분화 결과가 성공적으로 생성되었으며, 한 프레임 내에서 겹치는 동작에 대해 정확한 픽셀 수준의 마스크를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.