[논문 리뷰] Context-Aware RCNN: A Baseline for Action Detection in Videos
이 논문은 I3D를 사용한 특징 추출 이전에 액터 영역을 고해상도로 자르고 크기를 조정하여 성능을 햖थन하는 간단하면서도 효과적인 영상 행동 검출을 위한 기준 모델인 Context-Aware RCNN을 제안한다. 또한 장면 및 장기적 맥락을 융합한다. 이는 AVA에서 28.0%의 SOTA mAP과 JHMDB에서 79.2%의 mAP를 달성하여 표준 ResNet-50 백본을 사용함에도 불구하고 이전 방법들을 능가한다.
Video action detection approaches usually conduct actor-centric action recognition over RoI-pooled features following the standard pipeline of Faster-RCNN. In this work, we first empirically find the recognition accuracy is highly correlated with the bounding box size of an actor, and thus higher resolution of actors contributes to better performance. However, video models require dense sampling in time to achieve accurate recognition. To fit in GPU memory, the frames to backbone network must be kept low-resolution, resulting in a coarse feature map in RoI-Pooling layer. Thus, we revisit RCNN for actor-centric action recognition via cropping and resizing image patches around actors before feature extraction with I3D deep network. Moreover, we found that expanding actor bounding boxes slightly and fusing the context features can further boost the performance. Consequently, we develop a surpringly effective baseline (Context-Aware RCNN) and it achieves new state-of-the-art results on two challenging action detection benchmarks of AVA and JHMDB. Our observations challenge the conventional wisdom of RoI-Pooling based pipeline and encourage researchers rethink the importance of resolution in actor-centric action recognition. Our approach can serve as a strong baseline for video action detection and is expected to inspire new ideas for this filed. The code is available at \url{https://github.com/MCG-NJU/CRCNN-Action}.
연구 동기 및 목표
- 행동 검출에서 표준 RoI-Pooling 파이프라인의 저해상도 입력으로 인해 공간적 세부 정보가 손실되어 성능이 떨어지는지 조사하는 것.
- 작은 액터 바운딩 박스로 인해 미세한 행동 인식 성능이 저하되는 문제를 해결하는 것.
- 국소적 세부 정보를 유지하고 맥락 정보를 활용하는 간단하면서도 효과적인 행동 검출 기준 모델을 개발하는 것.
- 액터 중심 행동 인식에서 RoI-Pooling 사용에 대한 전통적 사고방식을 도전하고 더 효과적인 대안을 제안하는 것.
제안 방법
- 3D CNN(I3D)를 사용한 특징 추출에 앞서 원본 영상 프레임의 액터 바운딩 박스를 고정된 고해상도로 자르고 크기를 조정하는 것.
- 핵심 프레임에서 사전 훈련된 인물 검출기를 사용해 액터 제안을 생성한 후, 자른 패치에서 특징을 추출하는 것.
- 전체 영상 클립에서 추출한 장면 특징과 단순화된 비국소 모듈에서 유도된 장기적 특징을 융합하여 맥락 이해를 향상시키는 것.
- 최종 행동 분류를 위해 액터 특징, 장면 특징, 장기적 특징을 연결하여 통합하는 것.
- 장기적 시간적 상관관계를 포착하기 위해 단순화된 비국소 블록을 적용하여 표준 풀링보다 성능을 향상시키는 것.
- 평균 풀링을 특징 통합에 사용하여 주목사용 기반 방법과 유사한 성능을 내지만 계산 비용이 낮은 것.
실험 결과
연구 질문
- RQ1작은 액터 영역에서 공간적 세부 정보 손실로 인해 RoI-Pooling 기반 파이프라인의 성능이 저하되는가?
- RQ2자르기 및 크기 조정을 통해 작은 액터의 입력 해상도를 향상시키면 액터 중심 행동 검출의 정확도가 향상되는가?
- RQ3특히 장면 및 장기적 특징을 포함한 맥락 모델링은 행동 검출 성능 향상에 얼마나 효과적인가?
- RQ4고해상도 액터 코어를 사용하는 간단한 RCNN 유사 파이프라인은 복잡한 최신 기술 모델을 능가할 수 있는가?
주요 결과
- 액터 바운딩 박스가 작을 경우 RoI-Pooling 기반 파이프라인이 심각한 성능 저하를 겪으며, 해상도가 낮아질수록 mAP가 급격히 감소한다.
- Context-Aware RCNN는 AVA 데이터셋에서 28.0%의 새로운 SOTA mAP를 달성하여 이전 최고 성능 방법(LFB)보다 2.2% 높다.
- 더 깊은 ResNet-101을 사용한 LFB에 비해 더 작은 ResNet-50 백본을 사용함에도 불구하고 성능이 뛰어나 고해상도 입력의 효과를 입증한다.
- 장면 특징 추가로 mAP는 24.7%에서 25.7%로 향상되었고, 장기적 특징을 통합함으로써 다시 28.0%로 상승하였다.
- JHMDB 데이터셋에서는 RGB 프레임만 사용하여 79.2%의 mAP를 달성하여 이 벤치마크에서 새로운 SOTA를 수립하였다.
- 단순화된 비국소 모듈은 표준 주목사용 기반 기법보다 성능이 뛰어나고 더 복잡한 주목사용 블록과 유사한 성능을 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.