Skip to main content
QUICK REVIEW

[논문 리뷰] Proposal Relation Network for Temporal Action Detection

Xiang Wang, Zhiwu Qing|arXiv (Cornell University)|2021. 06. 20.
Human Pose and Action Recognition참고 문헌 20인용 수 16
한 줄 요약

이 논문은 자기주의(Self-attention)를 사용하여 상호 제안 간 관계를 모델링함으로써 기준 BMN을 초월해 제안 품질을 향상시키는 제안 관계 네트워크(Proposal Relation Network, PRN)를 제안한다. ActivityNet 2021 테스트 세트에서 44.7%의 평균 mAP을 달성하여 2020년 冠군보다 1.9% 높은 성능을 기록한다.

ABSTRACT

This technical report presents our solution for temporal action detection task in AcitivityNet Challenge 2021. The purpose of this task is to locate and identify actions of interest in long untrimmed videos. The crucial challenge of the task comes from that the temporal duration of action varies dramatically, and the target actions are typically embedded in a background of irrelevant activities. Our solution builds on BMN, and mainly contains three steps: 1) action classification and feature encoding by Slowfast, CSN and ViViT; 2) proposal generation. We improve BMN by embedding the proposed Proposal Relation Network (PRN), by which we can generate proposals of high quality; 3) action detection. We calculate the detection results by assigning the proposals with corresponding classification results. Finally, we ensemble the results under different settings and achieve 44.7% on the test set, which improves the champion result in ActivityNet 2020 by 1.9% in terms of average mAP.

연구 동기 및 목표

  • 긴 트림되지 않은 영상에서 액션 지속 시간의 높은 변동성과 배경 잡음 문제를 해결하기 위해.
  • 이중 단계의 시계열 액션 탐지 파이프라인에서 제안 생성 품질을 향상시키기 위해.
  • 종료형 시계열 종속성을 종료형 학습 가능한 모듈을 통해 모델링하기 위해.
  • ViViT와 같은 트랜스포머 기반 모델이 탐지 작업과 분류 작업에서 어떻게 다른지 평가하기 위해.
  • ActivityNet 2021 시계열 액션 탐지 벤치마크에서 최고 성능을 달성하기 위해.

제안 방법

  • 비디오 클립에서 특징 추출을 위해 Slowfast, CSN, ViViT를 백본 네트워크로 활용한다.
  • 특징의 강건성을 향상시키기 위해 시간 이동 기반의 데이터 증강 모듈을 적용한다.
  • 자기주의를 사용하여 제안 간 종속성을 모델링하는 제안 관계 네트워크(Proposal Relation Network, PRN)를 도입한다.
  • 자기주의를 통한 비국소 연산을 활용해 제안 간 장거리 시계열 관계를 포착한다.
  • 제안 생성 네트워크에서의 신뢰도 맵을 사용해 고품질의 제안을 생성한다.
  • 사전 계산된 인접 행렬이나 다단계 학습이 필요 없이 PRN 모듈의 종료형 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1제안 간 상호 관계를 모델링하면 시계열 액션 탐지에서 제안 품질이 향상되는가?
  • RQ2자기주의 기반의 관계 모델링은 기존의 컨볼루션 또는 GCN 기반 접근 방식보다 제안 생성에서 어떻게 비교되는가?
  • RQ3ViViT와 같은 트랜스포머 기반 모델은 왜 분류 작업에서는 잘 작동하지만 탐지 작업에서는 덜 잘 작동하는가?
  • RQ4시간 이동을 통한 데이터 증강이 탐지 강건성에 얼마나 기여하는가?
  • RQ5다양한 백본과 모델 간 앙상블 학습이 긴 트림되지 않은 영상에서 탐지 성능을 더욱 향상시킬 수 있는가?

주요 결과

  • PRN은 검증 세트에서 AUC를 BMN 대비 68.6%에서 69.3%로 향상시켜 더 나은 제안 품질을 나타낸다.
  • CSN 특징을 사용할 경우 PRN은 39.4% 평균 mAP를 달성하여 BMN의 38.1%를 1.3%p 뛰어넘는다.
  • 모든 모델의 앙상블은 검증 세트에서 42.0% 평균 mAP, 테스트 세트에서 44.7% 평균 mAP를 기록하며, 2020년 冠군을 1.9% 뛰어넘는다.
  • ViViT는 분류 작업에서 91.2% Top-1 정확도를 기록했지만 탐지 작업에서는 37.5% mAP에 그쳐, 분류와 탐지 간 성능 격차가 있음을 시사한다.
  • Slowfast152는 분류 작업에서 88.9%로 Slowfast101의 87.1%를 뛰어넘지만, 탐지 작업에서는 38.0%로 37.7%를 기록하며 성능이 열 劣하므로, 백본 선택이 분류보다 탐지에 더 큰 영향을 미친다.
  • 시간 이동 기반의 데이터 증강 모듈은 모델의 강건성을 향상시켜 탐지에서 더 나은 일반화 성능을 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.