Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal Convolution Based Action Proposal: Submission to ActivityNet 2017

Tianwei Lin, Xu Zhao|arXiv (Cornell University)|2017. 07. 21.
Human Pose and Action Recognition참고 문헌 14인용 수 63
한 줄 요약

이 논문은 시간적 컨볼루션과 앵커 메커니즘을 기반으로 한 시간적 액션 제안 모델 Prop-SSAD를 제안하고 TAG 제안과 정밀 경계 보강으로 ActivityNet 2017에서 제안 및 로컬라이제이션 태스크 모두에서 최첨단 결과를 달성한다.

ABSTRACT

In this notebook paper, we describe our approach in the submission to the temporal action proposal (task 3) and temporal action localization (task 4) of ActivityNet Challenge hosted at CVPR 2017. Since the accuracy in action classification task is already very high (nearly 90% in ActivityNet dataset), we believe that the main bottleneck for temporal action localization is the quality of action proposals. Therefore, we mainly focus on the temporal action proposal task and propose a new proposal model based on temporal convolutional network. Our approach achieves the state-of-the-art performances on both temporal action proposal task and temporal action localization task.

연구 동기 및 목표

  • 제안 품질이 미리 자르지 않은 비디오에서 시간적 액션 로컬라이제이션의 주요 병목 현상이라는 점을 입증한다.
  • 앵커 메커니즘을 갖춘 시간적 컨볼루션 기반의 제안 모델 Prop-SSAD를 도입한다.
  • 제안을 TAG(Temporal Actionness Grouping)로 보강하고 경계를 정밀화하여 높은 IoU에서 재현율을 향상시킨다.
  • ActivityNet 2017에서 시간적 제안 및 로컬라이제이션 태스크 모두에서 최첨단 성능을 입증한다.
  • 비디오 수준 분류 결과를 사용하여 시간적 액션 로컬라이제이션 결과를 얻을 수 있음을 보인다.

제안 방법

  • 비정지 영상에서 외관 및 모션의 스니펫 수준 이중 스트림 특성을 추출하고 길이를 256으로 재조정한다.
  • Prop-SSAD를 사용하여 다중 시간 특성 맵(길이가 각각 1,2,4,8,16,32,64인 일곱 맵)을 활용해 액션 존재 여부와 경계를 예측하는 시간적 앵커 기반 탐지기를 사용한다.
  • 제안에 대한 중첩 손실(overlap loss)로 학습하고, 초기 분류 없이 앵커 기반 예측으로 제안을 형성한다.
  • MLP를 이용한 TAG를 구현하여 액션 가능도 점수를 생성하고 추가 제안을 생성한다.
  • IoU가 최대 0.75를 초과하는 TAG 제안으로 Prop-SSAD 경계를 교체하여 정밀한 제안을 얻는다.
  • 로컬라이제이션의 경우 비디오 수준 분류 결과를 사용해 제안에 비디오 수준 액션 카테고리를 할당하고, 표준 mAP를 IoU 임계값 전반에 걸쳐 평가한다.

실험 결과

연구 질문

  • RQ1시간적 컨볼루션 및 앵커 기반 프레임워크(Prop-SSAD)가 외부 데이터 없이 고품질의 시간적 액션 제안을 생성할 수 있는가?
  • RQ2Prop-SSAD 제안과 TAG 제안의 결합이 특히 높은 IoU 임계값에서 제안 재현율을 향상시키는가?
  • RQ3정밀한 경계가 ActivityNet 2017의 시간적 액션 로컬라이제이션 성능에 어느 정도 영향을 미치는가?
  • RQ4제안된 프레임워크의 엔드 투 엔드 학습이 ActivityNet 2017 내에서 가능하고 이점이 있는가?

주요 결과

  • Prop-SSAD가 기준선을 능가하고 TAG 보강이 특히 높은 IoU 임계값에서 재현율을 향상시킨다.
  • 정교화된 Prop-SSAD가 Prop-SSAD보다 더 높은 AR-AN 점수를 달성한다(예: Table 1에서 AR-AN이 61.52에서 64.40으로 증가).
  • TAG로 정교화된 제안은 비디오 수준 분류 결과와 결합될 때 로컬라이제이션 결과가 더 좋아진다.
  • 검증 세트에서 로컬라이제이션 결과가 IoU 임계값 전반에 걸쳐 기존 방법과 비교해 경쟁력 있거나 우수한 mAP를 보이며, 테스트 세트 평균 mAP는 여러 기준보다 현저히 높은 32.26이다.
  • 로컬라이제이션을 위해 상위 N개 제안을 사용하는 것은 초기 제안의 품질이 로컬라이제이션 mAP에 긍정적 영향을 미친다는 것을 보여준다(예: Ours@1–Ours@100에서 점진적 증가).
  • 본 연구는 앵커 기제와 시간적 컨볼루션이 시간적 액션 제안 태스크에 효과적임을 도출한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.