Skip to main content
QUICK REVIEW

[논문 리뷰] Faster-TAD: Towards Temporal Action Detection with Proposal Generation and Classification in a Unified Network

Shimin Chen, Chen Chen|arXiv (Cornell University)|2022. 04. 06.
Human Pose and Action Recognition인용 수 7
한 줄 요약

Faster-TAD는 일관된 단일 스테이지 네트워크를 제안하여 시간적 행동 검출을 수행하며, 제안 영역 생성, 분류, 경계 보정을 통합적으로 수행한다. 이는 근접-카테고리, 자기 어텐션, 교차 어텐션 메커니즘을 갖춘 컨텍스트 적응형 제안 모듈, 다양한 오프셋을 가진 가짜 제안 생성 블록, 원자적 행동 특징을 활용하여 ActivityNet-1.3에서 40.01%의 최고 성능 mAP과 SoccerNet-Action Spotting에서 54.09%의 최고 성능 mAP를 달성한다.

ABSTRACT

Temporal action detection (TAD) aims to detect the semantic labels and boundaries of action instances in untrimmed videos. Current mainstream approaches are multi-step solutions, which fall short in efficiency and flexibility. In this paper, we propose a unified network for TAD, termed Faster-TAD, by re-purposing a Faster-RCNN like architecture. To tackle the unique difficulty in TAD, we make important improvements over the original framework. We propose a new Context-Adaptive Proposal Module and an innovative Fake-Proposal Generation Block. What's more, we use atomic action features to improve the performance. Faster-TAD simplifies the pipeline of TAD and gets remarkable performance on lots of benchmarks, i.e., ActivityNet-1.3 (40.01% mAP), HACS Segments (38.39% mAP), SoccerNet-Action Spotting (54.09% mAP). It outperforms existing single-network detector by a large margin.

연구 동기 및 목표

  • 다단계 시간적 행동 검출 파이프라인의 비효율성과 유연성 부족 문제를 해결한다.
  • 제안 영역 간 및 원본 비디오와의 컨텍스트적·의미적 정보를 활용하여 제안 품질 향상과 행동 분류 성능 향상을 도모한다.
  • 다양한 오프셋을 가진 새로운 가짜 제안 생성 블록을 통해 경계 보정의 강건성 향상을 도모한다.
  • 복잡하고 장시간 지속되는 인간 행동 검출에 있어 원자적 행동 특징의 이점을 입증한다.
  • 다단계 정련 없이 통합적이고 엔드 투 엔드로 훈련 가능한 프레임워크에서 최고 성능을 달성한다.

제안 방법

  • 다중 작업 손실를 사용하여 제안 영역 생성, 분류, 경계 보정을 동시에 최적화하는 Faster-RCNN 유사 아키텍처를 적용한다.
  • 근접-카테고리 제안, 자기 어텐션, 교차 어텐션 블록을 조합한 컨텍스트 적응형 제안 모듈을 도입하여 제안의 의미 정보를 풍부하게 한다.
  • 정답에 비해 다양한 오프셋을 가진 가짜 제안을 생성하여 회귀 일반화 성능을 향상시키는 가짜 제안 생성 블록을 제안한다.
  • SEAL 데이터셋에서 사전 훈련된 원자적 행동 특징을 보조 입력으로 활용하여 복잡한 활동 검출을 위한 표현력을 향상시킨다.
  • 기존 앵커 기반 방법을 대체하여 경계 매칭 신뢰도 맵을 사용하여 제안 영역를 생성함으로써 극단적인 지속시간 변동에 대응한다.
  • 검출 헤드 간에 특징을 공유하여 엔드 투 엔드 훈련과 파rameter 효율성을 확보한다.

실험 결과

연구 질문

  • RQ1통합적 단일 스테이지 네트워크가 파이프라인 단순화를 동시에 달성하면서도 시간적 행동 검출에서 최고 성능을 낼 수 있는가?
  • RQ2제안 영역 간 및 원본 비디오와의 관계를 모델링함으로써 컨텍스트 적응형 어텐션 메커니즘이 제안 분류 성능 향상에 얼마나 효과적인가?
  • RQ3정답에 비해 다양한 오프셋을 가진 가짜 제안을 생성함으로써 경계 보정의 강건성이 향상되는가?
  • RQ4원자적 행동 특징이 복잡하고 장시간 지속되는 인간 행동 검출에 얼마나 기여하는가?
  • RQ5통합 네트워크가 표준 벤치마크에서 정확도와 효율성 측면에서 다단계 방법을 초월할 수 있는가?

주요 결과

  • Faster-TAD는 ActivityNet-1.3에서 40.01% mAP를 달성하여 기존 단일 네트워크 검출기보다 크게 뛰어난 성능을 보였다.
  • HACS Segments에서 Faster-TAD는 38.39% mAP를 기록하여 다양한 데이터셋에 대한 강력한 일반화 능력을 입증했다.
  • SoccerNet-Action Spotting에서 Faster-TAD는 3초 및 6초 클립을 사용한 Swin 백본을 활용해 54.09% mAP를 달성하여 새로운 최고 성능을 수립했다.
  • 절단 분석 결과 컨텍스트 적응형 제안 모듈은 의미적 컨텍스트 모델링을 향상시켜 0.73% mAP 향상을 이끌어냈다.
  • 가짜 제안 블록은 mAP를 0.14% 향상시켜 경계 보정의 일반화 성능 향상을 입증했다.
  • 원자적 행동 특징은 mAP를 0.89% 향상시켜 복잡한 행동 검출에서의 가치를 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.