Skip to main content
QUICK REVIEW

[논문 리뷰] Contextual Multi-Scale Region Convolutional 3D Network for Activity Detection

Yancheng Bai, Huijuan Xu|arXiv (Cornell University)|2018. 01. 28.
Human Pose and Action Recognition참고 문헌 24인용 수 15
한 줄 요약

이 논문은 비트림 영상에서 다양한 지속 기간을 가진 활동을 탐지하기 위해 시간적 특징 피라미드를 사용하는 다중 척도, 엔드 투 엔드 학습 가능한 프레임워크인 컨텍스트 다중 척도 영역 컨volution 3D 네트워크(CMS-RC3D)를 제안한다. 맥락 모델링을 통해 척도별로 특화된 탐지기를 학습함으로써 CMS-RC3D는 THUMOS14에서 최신 기술 수준의 성능을 달성하고 ActivityNet에서도 향상된 성능을 보이며, THUMOS14에서 이전 방법보다 최대 4.0% mAP 향상과 ActivityNet에서 평균 mAP 5.0% 향상을 기록한다.

ABSTRACT

Activity detection is a fundamental problem in computer vision. Detecting activities of different temporal scales is particularly challenging. In this paper, we propose the contextual multi-scale region convolutional 3D network (CMS-RC3D) for activity detection. To deal with the inherent temporal scale variability of activity instances, the temporal feature pyramid is used to represent activities of different temporal scales. On each level of the temporal feature pyramid, an activity proposal detector and an activity classifier are learned to detect activities of specific temporal scales. Temporal contextual information is fused into activity classifiers for better recognition. More importantly, the entire model at all levels can be trained end-to-end. Our CMS-RC3D detector can deal with activities at all temporal scale ranges with only a single pass through the backbone network. We test our detector on two public activity detection benchmarks, THUMOS14 and ActivityNet. Extensive experiments show that the proposed CMS-RC3D detector outperforms state-of-the-art methods on THUMOS14 by a substantial margin and achieves comparable results on ActivityNet despite using a shallow feature extractor.

연구 동기 및 목표

  • 비트림 영상에서 다양한 시간 지속 기간을 가진 활동을 탐지하는 과제를 해결하기 위해.
  • 기존 방법에서 고정된 시간 해상도 특징 맵의 한계를 극복하기 위해.
  • 시간 척도 간 맥락 정보를 융합하여 탐지 정확도를 향상시키기 위해.
  • 단일 순방향 전파에서 작동하는 다중 척도 탐지기의 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 깊이 있는 이중 스트림 특징에 의존하지 않고도 공개 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 다양한 시간 해상도에서 특징 맵을 생성하기 위해 합성곱층을 사용해 다중 척도 시간 특징 피라미드를 구축한다.
  • 각 피라미드 수준에서 별도의 영역 제안 네트워크와 분류기 모델을 학습하여 특정 지속 기간 범위 내의 활동을 탐지한다.
  • 활동 분류기에 주변 시간 세그먼트의 맥락 정보를 융합하여 인식 성능을 향상시킨다.
  • 모든 피라미드 수준에서 엔드 투 엔드 학습을 수행하여 제안 생성과 분류의 공동 최적화를 가능하게 한다.
  • 백본 네트워크가 영상을 한 번만 처리하여 다중 척도 특징을 생성하는 단일 전파 추론 전략을 적용한다.
  • 분류를 위한 특징 표현을 향상시키기 위해 후기 융합 메커니즘을 통해 맥락 모델링을 통합한다.

실험 결과

연구 질문

  • RQ1다중 척도 특징 피라미드가 다양한 시간 지속 기간을 가진 활동 탐지에 기여하는가?
  • RQ2고정 해상도 기반 베이스라인 대비 척도별로 특화된 탐지기의 엔드 투 엔드 학습이 성능 향상에 기여하는가?
  • RQ3주변 시간 세그먼트의 맥락 정보가 비트림 영상에서 활동 인식에 기여하는가?
  • RQ4단일 전파 추론 전략이 다양한 시간 척도를 처리하면서도 높은 정확도를 유지할 수 있는가?
  • RQ5제안된 방법이 표준 벤치마크에서 최신 기술 수준의 탐지기와 비교해 어떻게 성능을 내는가?

주요 결과

  • CMS-RC3D는 기준 모델인 RC3D 대비 THUMOS14에서 mAP@0.5에서 4.0% 향상된 성능을 기록했다.
  • THUMOS14에서 이전 최신 기술 수준의 방법들보다 뚜렷한 격차로 앞서며, 특히 고 IoU 임계값에서 뛰어난 성능을 보였다.
  • ActivityNet v1.3에서 CMS-RC3D는 기준 모델인 RC3D 대비 평균 mAP를 5.0% 향상시켰다.
  • 깊은 두 개의 스트림 네트워크를 사용하는 방법들과 비교해도 얕은 C3D 특징 추출기를 사용했음에도 유사한 성능을 달성했다.
  • 정성적 결과 분석을 통해 다양한 활동 지속 기간에 걸쳐 안정적인 탐지 성능을 보였으며, 시작 및 종료 시간의 정확한 국소화가 가능했다.
  • 제거 실험 결과 다중 척도 표현과 맥락 모델링이 성능 향상에 핵심적인 역할을 한다는 점이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.