Skip to main content
QUICK REVIEW

[논문 리뷰] RGB Stream Is Enough for Temporal Action Detection

Chenhao Wang, Hongxiang Cai|arXiv (Cornell University)|2021. 07. 09.
Human Pose and Action Recognition참고 문헌 59인용 수 18
한 줄 요약

이 논문은 고정확도의 시계열 행동 탐지에 광학 흐름이 불필요하다는 것을 입증하며, 이미지 수준의 데이터 증강(ILD)을 사용하는 단일 RGB 스트림이 최신 기술 수준의 성능을 달성할 수 있음을 보여준다. 제안된 일단계 탐지기인 DaoTAD는 GTX 1080 Ti에서 6668 fps의 추론 속도를 기록하면서 THUMOS14에서 이중 스트림 모델과 동일한 정확도를 달성한다.

ABSTRACT

State-of-the-art temporal action detectors to date are based on two-stream input including RGB frames and optical flow. Although combining RGB frames and optical flow boosts performance significantly, optical flow is a hand-designed representation which not only requires heavy computation, but also makes it methodologically unsatisfactory that two-stream methods are often not learned end-to-end jointly with the flow. In this paper, we argue that optical flow is dispensable in high-accuracy temporal action detection and image level data augmentation (ILDA) is the key solution to avoid performance degradation when optical flow is removed. To evaluate the effectiveness of ILDA, we design a simple yet efficient one-stage temporal action detector based on single RGB stream named DaoTAD. Our results show that when trained with ILDA, DaoTAD has comparable accuracy with all existing state-of-the-art two-stream detectors while surpassing the inference speed of previous methods by a large margin and the inference speed is astounding 6668 fps on GeForce GTX 1080 Ti. Code is available at \url{https://github.com/Media-Smart/vedatad}.

연구 동기 및 목표

  • 고정확도의 시계열 행동 탐지에 광학 흐름이 필수적이라는 가정을 도전하기 위해.
  • 단일 스트림 모델에서 광학 흐름이 없을 경우 이미지 수준의 데이터 증강(ILDA)이 이를 보완할 수 있는지 조사하기 위해.
  • 이중 스트림 성능을 따라잡는 단일 RGB 입력 기반의 빠르고 효율적인 일단계 시계열 행동 탐지기를 설계하기 위해.
  • RGB만을 사용한 엔드 투 엔드 훈련이 정확도를 희생시키지 않고도 이중 스트림 방법보다 추론 속도에서 뛰어나다는 것을 입증하기 위해.

제안 방법

  • 객체 검출에서 영감을 얻은 RetinaNet과 유사한 단일 RGB 스트림 기반의 일단계 시계열 행동 탐지기인 DaoTAD를 제안한다.
  • 특징 일반화를 향상시키고 광학 흐름 없이 성능 저하를 방지하기 위해 무작위 컷, 색상 왜곡, 미끄러짐, 컷아웃을 포함한 이미지 수준의 데이터 증강(ILDA)을 적용한다.
  • 3D 특징 맵을 공간적으로 압축하면서도 시계열 역학을 유지하기 위해 평균 풀링을 사용하는 공간 압축 모듈(SRM)을 도입한다.
  • 다중 스케일의 시계열 특징 피라미드를 생성하기 위해 학습 가능한 1D 컨볼루션을 사용하는 시간 다운샘플링 모듈(TDM)을 사용한다.
  • 각 위치당 5개의 앵커를 사용하는 학습 가능한 앵커 설정을 적용하여 다양한 스케일 간의 양성 샘플 분포를 더 잘 균형 잡히게 한다.
  • 과적합을 줄이고 저수준 특징을 유지하기 위해 훈련 중 ResNet-50 I3D 백본의 2개 스테이지만 동결한다.

실험 결과

연구 질문

  • RQ1광학 흐름 없이도 단일 RGB 스트림 탐지기가 시계열 행동 탐지에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2이미지 수준의 데이터 증강(ILDA)이 광학 흐름이 없을 경우 고성능을 가능하게 하는 데 어떤 역할을 하는가?
  • RQ3앵커 설정 및 특징 피라미드 모듈의 설계가 단일 스트림 모델의 탐지 정확도에 어떤 영향을 미치는가?
  • RQ4RGB 스트림 기반의 일단계 탐지기가 기존의 이중 스트림 방법보다 현저히 더 빠른 추론 속도를 달성할 수 있는가?
  • RQ5RGB만을 사용한 엔드 투 엔드 훈련이 정확도에서 이중 스트림 모델을 따라잡거나 초월하는 데 충분한가?

주요 결과

  • ILDA로 훈련한 DaoTAD는 THUMOS14에서 [0.3:0.1:0.7] IoU 범위에서 평균 mAP 42.5%를 기록하며 최신 기술 수준의 이중 스트림 탐지기와 동일한 성능을 달성한다.
  • ILDA 없이 훈련한 경우 mAP는 42.5%에서 37.1%로 떨어지며, 광학 흐름 부족을 보완하기 위해 ILDA가 필수적임을 입증한다.
  • 무작위 컷만으로도 다른 증강 기법 대비 mAP가 3.3% 향상되며, 네 가지 ILDA 기법은 상호 보완적인 성능을 보인다.
  • DaoTAD는 GeForce GTX 1080 Ti에서 6668 fps의 추론 속도를 기록하며 이전 방법들보다 뚜렷이 뛰어난 성능을 보인다.
  • 각 위치당 5개의 앵커를 사용할 경우 RetinaNet의 기본 3개 앵커보다 더 나은 성능을 내며, 다양한 스케일 간의 양성 샘플 할당이 더 균형 잡히기 때문이다.
  • 시간 다운샘플링 모듈의 최적 채널 설정은 512이며, 이를 1024로 늘리면 과적합이 발생하고 성능이 저하된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.