Skip to main content
QUICK REVIEW

[논문 리뷰] Scale Matters: Temporal Scale Aggregation Network for Precise Action Localization in Untrimmed Videos

Guoqiang Gong, Liangfeng Zheng|arXiv (Cornell University)|2019. 08. 02.
Human Pose and Action Recognition참고 문헌 57인용 수 4
한 줄 요약

이 논문은 비정형 영상에서 다양한 지속시간을 가진 행동 인스턴스를 처리하기 위해 다중 확장 시간 컨볼루션(MDC) 블록을 다중 분기 아키텍처에 통합한 시간적 스케일 집합 네트워크(TSA-Net)를 제안한다. 세 가지 핵심 경계점(시작, 중간, 끝)을 탐지하고 다중 스케일의 맥락적 특징을 융합함으로써, TSA-Net은 THUMOS14에서 mAP@0.5가 46.9%이며, ActivityNet-1.3에서 평균 mAP가 34.62%로 최신 기준 성능을 달성한다.

ABSTRACT

Temporal action localization is a recently-emerging task, aiming to localize video segments from untrimmed videos that contain specific actions. Despite the remarkable recent progress, most two-stage action localization methods still suffer from imprecise temporal boundaries of action proposals. This work proposes a novel integrated temporal scale aggregation network (TSA-Net). Our main insight is that ensembling convolution filters with different dilation rates can effectively enlarge the receptive field with low computational cost, which inspires us to devise multi-dilation temporal convolution (MDC) block. Furthermore, to tackle video action instances with different durations, TSA-Net consists of multiple branches of sub-networks. Each of them adopts stacked MDC blocks with different dilation parameters, accomplishing a temporal receptive field specially optimized for specific-duration actions. We follow the formulation of boundary point detection, novelly detecting three kinds of critical points (ie, starting / mid-point / ending) and pairing them for proposal generation. Comprehensive evaluations are conducted on two challenging video benchmarks, THUMOS14 and ActivityNet-1.3. Our proposed TSA-Net demonstrates clear and consistent better performances and re-calibrates new state-of-the-art on both benchmarks. For example, our new record on THUMOS14 is 46.9% while the previous best is 42.8% under mAP@0.5.

연구 동기 및 목표

  • 다양한 행동 지속시간으로 인해 발생하는 비정형 영상 내 시간적 경계 정확도 저하 문제를 해결한다.
  • 고정된 수신장 모델과 단일 스케일 접근 방식의 한계를 극복하여 다양한 행동 길이를 효과적으로 처리한다.
  • 새로운 다중 분기 네트워크 설계를 통해 다중 스케일 시간 맥락을 융합함으로써 제안 품질을 향상시킨다.
  • 학습 가능한 호환성 함수를 활용해 시작, 중간, 끝 지점을 동시에 회귀함으로써 경계 탐지 신뢰도를 향상시킨다.
  • 무거운 시공간 특징에 의존하지 않고 대규모 벤치마크에서 최신 기준 성능을 달성한다.

제안 방법

  • 다양한 확장률을 가진 확장 컨볼루션을 사용하여 수신장을 효율적으로 확장하는 다중 확장 시간 컨볼루션(MDC) 블록을 제안한다.
  • 각기 다른 확장률을 가진 스택된 MDC 블록을 통해 다양한 행동 지속시간 스케일에 특화된 세 분기 네트워크 아키텍처를 설계한다.
  • 행동 로컬라이제이션을 경계점 탐지 작업으로 공식화하여 시작, 중간, 끝의 세 가지 유형의 핵심 점을 탐지한다.
  • 탐지된 시작점과 끝점 쌍을 조합하여 제안을 생성하며, 학습된 쌍별 호환성 함수를 사용해 신뢰도 점수를 계산한다.
  • 각 제안에 대해 베이지안 신뢰도를 회귀하기 위한 경량 서브넷을 통합하여 로컬라이제이션 정확도를 향상시킨다.
  • 이중 단계 프레임워크를 사용한다: 먼저 경계 탐지로 제안을 생성하고, 이후 호환성 인식 점수 기반 메커니즘으로 이를 정밀하게 보완한다.

실험 결과

연구 질문

  • RQ1다중 확장 시간 컨볼루션은 다양한 행동 지속시간에 걸쳐 장거리 시간 맥락을 효과적으로 캡처할 수 있는가?
  • RQ2특화된 확장률을 가진 다중 분기 아키텍처는 단일 분기 모델에 비해 경계 탐지 성능을 향상시키는가?
  • RQ3시작, 중간, 끝 지점을 동시에 탐지하는 방식은 기존의 이중 지점 탐지 방식에 비해 제안 품질을 향상시키는가?
  • RQ4제안된 호환성 함수는 제안 점수 향상과 잡음 제거에 얼마나 효과적인가?
  • RQ5제안된 방법은 THUMOS14와 ActivityNet-1.3와 같은 표준 벤치마크에서 기존 최신 기준 방법을 얼마나 뛰어넘는가?

주요 결과

  • THUMOS14에서 TSA-Net은 동일한 IoU 임계값 조건 하에 기존 최신 기준인 42.8%보다 뚜렷이 높은 46.9%의 mAP@0.5 성능을 달성한다.
  • ActivityNet-1.3에서 TSA-Net은 기존 최고 성능인 32.84%에 비해 새로운 최신 기준인 34.62%의 평균 mAP를 기록한다.
  • 제안된 호환성 함수는 THUMOS14에서 AR@AN을 2.0 포인트 향상시켜 제안 점수 보완의 효과를 입증한다.
  • P3D 특징을 사용할 경우, TSA-Net은 THUMOS14에서 mAP@0.3가 48.3%에 이르며 다양한 IoU 임계값에서의 일반화 능력을 입증한다.
  • 다른 확장률을 가진 다중 분기 설계는 0.3에서 0.7까지의 모든 IoU 임계값에서 일관되게 성능 향상을 이룬다.
  • 제거 실험 결과, MDC 블록과 삼점 탐지 전략이 모델의 뛰어난 성능을 위해 필수적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.