[논문 리뷰] Temporal Action Localization in Untrimmed Videos via Multi-stage CNNs
이 논문은 3D ConvNets를 활용한 Segment-CNN 프레임워크를 제안하여 제안, 분류, 위치화 네트워크를 통해 비정형 비디오에서 동작을 로컬라이즈하고 MEXaction2 및 THUMOS 2014에서 주목할 만한 mAP 상승을 달성한다.
We address temporal action localization in untrimmed long videos. This is important because videos in real applications are usually unconstrained and contain multiple action instances plus video content of background scenes or other activities. To address this challenging issue, we exploit the effectiveness of deep networks in temporal action localization via three segment-based 3D ConvNets: (1) a proposal network identifies candidate segments in a long video that may contain actions; (2) a classification network learns one-vs-all action classification model to serve as initialization for the localization network; and (3) a localization network fine-tunes on the learned classification network to localize each action instance. We propose a novel loss function for the localization network to explicitly consider temporal overlap and therefore achieve high temporal localization accuracy. Only the proposal network and the localization network are used during prediction. On two large-scale benchmarks, our approach achieves significantly superior performances compared with other state-of-the-art systems: mAP increases from 1.7% to 7.4% on MEXaction2 and increases from 15.0% to 19.0% on THUMOS 2014, when the overlap threshold for evaluation is set to 0.5.
연구 동기 및 목표
- 주소 비정형 긴 비디오에서 다중 액션 인스턴스와 배경 콘텐츠를 포함하는 시간적 액션 로컬라이제이션을 다룬다.
- 다단계 3D ConvNets를 활용하여 시간상으로 액션을 제안, 분류 및 정확하게 로컬라이즈 한다.
- ground truth와의 IoU를 고려한 새로운 손실로 시간 로컬라이제이션 정밀도를 향상시키다.
- 분류로 시작된 로컬라이제이션 네트워크가 분류만으로는 얻기 힘든 경계보다 더 나은 경계를 산출함을 보여주다.
- 대규모 벤치마크에서 최신 기술보다 효율성과 정확도 향상을 보여주다.
제안 방법
- 슬라이딩 윈도우를 이용한 다중 스케일 세그먼트 생성을 통해 비정형 비디오에서 후보 세그먼트를 생성한다.
- 가능성이 낮은 세그먼트를 필터링하기 위해 백그라운드 대 액션을 구분하는 proposal 네트워크를 사용한다.
- K개의 액션 카테고리에 대한 분류 네트워크를 학습시켜 로컬라이제이션을 초기화한다.
- Ground truth와의 IoU가 더 높은 세그먼트에 대해 더 높은 점수를 의도적으로 유도하는 손실을 가진 로컬라이제이션 네트워크를 도입한다.
- 제안 네트워크와 로컬라이제이션 네트워크로 예측하고, 최종 탐지에 대해 조정된 임계값으로 NMS를 적용한다.
실험 결과
연구 질문
- RQ1다중 단계 Segment-CNN 프레임워크가 이전 방법들보다 비정형 비디오의 시간적 로컬라이제이션 정확도를 향상시키킬 수 있는가?
- RQ2분류 네트워크로 로컬라이제이션 네트워크를 초기화하고 중첩(overlap) 인식 손실을 사용하면 IoU에 맞춘 액션 경계가 개선되는가?
- RQ3다중 스케일 세그먼트 제안, 백그라운드 필터링, NMS가 최종 로컬라이제이션 성능에 어떤 영향을 미치는가?
- RQ4로컬라이제이션 손실 매개변수와 α 거듭제곱이 훈련 안정성과 정확도에 어떤 영향을 주는가?
주요 결과
- Segment-CNN은 MEXaction2에서 mAP를 1.7%에서 7.4%로 크게 향상시킨다.
- THUMOS 2014에서 IoU 임계값 0.5에서 mAP를 15.0%에서 19.0%로 향상시킨다.
- 제안 네트워크가 백그라운드 세그먼트를 필터링하여 정밀도와 효율성을 향상시킨다.
- 중첩 인식 손실을 가진 로컬라이제이션 네트워크가 더 높은 ground-truth 중첩과 함께 세그먼트를 우선적으로 다룬다.
- 분류 사전학습은 로컬라이제이션에 유익한 초기화를 제공하여 분류 없이보다 더 나은 결과를 낸다.
- 이 방법은 배치당 약 1초 정도 소요되며 GPU 메모리 요구가 완만하고 고차원 특징 캐시가 필요하지 않다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.