Skip to main content
QUICK REVIEW

[논문 리뷰] Spatio-Temporal Action Detection with Multi-Object Interaction

Huijuan Xu, Lizhi Yang|arXiv (Cornell University)|2020. 04. 01.
Human Pose and Action Recognition참고 문헌 43인용 수 6
한 줄 요약

이 논문은 외부 객체 검출기 없이 액션 튜브 내에서 다중 객체 상호작용을 동시에 공간적 및 시간적 회귀를 통해 국한하는 엔드 투 엔드 스펙트럴 행동 검출 프레임워크인 STAR 모델을 제안한다. UCF101-24에서 53.0% mAP@0.5의 경쟁력 있는 성능를 달성하며, 다중 객체 상호작용 튜브가 주석 처리된 새로운 대규모 데이터셋인 something-STAR를 도입한다.

ABSTRACT

Spatio-temporal action detection in videos requires localizing the action both spatially and temporally in the form of an "action tube". Nowadays, most spatio-temporal action detection datasets (e.g. UCF101-24, AVA, DALY) are annotated with action tubes that contain a single person performing the action, thus the predominant action detection models simply employ a person detection and tracking pipeline for localization. However, when the action is defined as an interaction between multiple objects, such methods may fail since each bounding box in the action tube contains multiple objects instead of one person. In this paper, we study the spatio-temporal action detection problem with multi-object interaction. We introduce a new dataset that is annotated with action tubes containing multi-object interactions. Moreover, we propose an end-to-end spatio-temporal action detection model that performs both spatial and temporal regression simultaneously. Our spatial regression may enclose multiple objects participating in the action. During test time, we simply connect the regressed bounding boxes within the predicted temporal duration using a simple heuristic. We report the baseline results of our proposed model on this new dataset, and also show competitive results on the standard benchmark UCF101-24 using only RGB input.

연구 동기 및 목표

  • 기존 스펙트럴 행동 검출 방법이 단일 인물 행동에만 초점을 맞추고 다중 객체 상호작용에서는 실패하는 한계를 해결하기 위해.
  • 행동를 단일 주체의 움직임으로 정의하는 것이 아니라, 더 넓은 공간적 국한이 필요한 다중 물체 간의 상호작용으로 정의하기 위해.
  • 외부 검출기나 복잡한 후처리에 의존하지 않고 동시에 공간적 및 시간적 경계를 회귀하는 모델을 개발하기 위해.
  • 행동 튜브가 주석 처리된 새로운 대규모 데이터셋 something-STAR를 만들기 위해.
  • 추론 중 공유된 3D 컨벌루션과 단순한 박스 연결을 통한 엔드 투 엔드 회귀가 고속과 경쟁력 있는 정확도를 달성할 수 있음을 입증하기 위해.

제안 방법

  • STAR 모델은 공유된 특징을 사용하는 3D 컨벌루션 네트워크 기반을 활용하여 엔드 투 엔드 방식으로 공간 행동 박스와 시간 지속 시간을 동시에 회귀한다.
  • 공간적 회귀는 개별적인 사람 중심 박스가 아니라 모든 상호작용하는 물체를 포함하는 단일 경계 상자(박스)를 생성한다.
  • 시간적 회귀는 행동의 시작 및 종료 타임스탬프를 예측하여 슬라이딩 윈도우나 히우리스틱 연결이 필요 없이 직접적인 시간 국한을 가능하게 한다.
  • 추론 중 모델은 예측된 시간 지속 기간 내에서 회귀된 공간 박스들을 단순한 IoU 기반 히우리스틱을 사용해 연결하여 복잡한 최적화를 피한다.
  • 모델은 옵티컬 플로우가 필요 없도록 오직 RGB 입력만을 사용하여 훈련되며, 운동적 맥락을 캡처하기 위해 3D 컨벌루션을 활용한다.
  • 아키텍처는 효율적이며 다양한 공간적 및 시간적 해상도를 지원하며, 최적의 성능는 25 fps 및 176×176 해상도에서 달성된다.

실험 결과

연구 질문

  • RQ1단일 인물 행동이 아닌 다수의 상호작용하는 물체를 포함하는 행동으로 스펙트럴 행동 검출을 효과적으로 확장할 수 있는가?
  • RQ2개별 객체 검출 및 추적에 의존하는 파이프라인 기반 방법보다, 동시에 공간적 및 시간적 회귀를 수행하는 통합형 엔드 투 엔드 모델이 더 우수한 성능를 보일 수 있는가?
  • RQ3옵티컬 플로우를 사용하는 이중 스트림 모델과 비교해, 오직 RGB 입력과 3D 컨벌루션만을 사용할 경우 정확도와 추론 속도에 어떤 영향을 미치는가?
  • RQ4UCF101-24와 같은 표준 벤치마크에서 사람 중심 행동에 적용했을 때, 제안된 모델의 성능가 기존 최고 수준의 방법들과 비교해 어떻게 되는가?
  • RQ5예측된 시간 창 내에서 공간 박스를 연결하는 단순한 히우리스틱이 복잡한 후처리를 대체하면서도 정확도를 유지할 수 있는가?

주요 결과

  • STAR 모델은 오직 RGB 입력만을 사용하여 UCF101-24 벤치마크에서 53.0% mAP@0.5를 달성하며, 옵티컬 플로우나 외부 검출기가 없이도 뛰어난 성능를 보여준다.
  • 단일 TITAN X (Pascal)에서 250 fps의 추론 속도를 기록하여 이전 방법들이 40 fps 이하로 작동하는 것과 비교해 뚜렷한 우수성을 보인다.
  • 사람 중심 행동에 특별히 설계되지 않았음에도 불구하고 UCF101-24에서 경쟁력 있는 결과를 보이며, 표준 벤치마크에 대한 강력한 일반화 능력을 나타낸다.
  • 제안된 something-STAR 데이터셋은 총 3207개의 영상으로 구성되어 있으며, 훈련용 2293개, 테스트용 914개로 나뉘어져 있으며, 다중 객체 상호작용 튜브가 주석 처리되어 있다.
  • 모델의 프레임 수준 mAP@0.5는 영상 수준 mAP보다 낮지만, 약한 프레임 수준 검출에도 불구하고 강력한 시간 국한 능력을 보여준다.
  • 제거 분석 결과, something-something에서 미세조정된 사전 훈련된 분류 기반 모델을 사용할 경우 Sports-1M 가중치를 사용하는 것보다 성능 향상이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.