[논문 리뷰] Low-Latency Human Action Recognition with Weighted Multi-Region Convolutional Neural Network
이 논문은 3D ConvNet이나 LSTM 처리를 위한 프레임 누적 없이도 시공간적 맥락을 포착할 수 있도록 전경(주요) 및 배경(보조) 영역에서 가중 다중영역 특징을 추출하는 2D ConvNet을 사용하는 저지연 인식 시스템인 WMR ConvNet을 제안한다. UCF101과 HMDB51에서 저지연 방법 중 최고 성능을 기록하며, 비디오 클립 집합이나 LSTMs를 요구하지 않음에도 불구하고 C3D와 같은 3D ConvNet 기반 모델을 능가한다.
Spatio-temporal contexts are crucial in understanding human actions in videos. Recent state-of-the-art Convolutional Neural Network (ConvNet) based action recognition systems frequently involve 3D spatio-temporal ConvNet filters, chunking videos into fixed length clips and Long Short Term Memory (LSTM) networks. Such architectures are designed to take advantage of both short term and long term temporal contexts, but also requires the accumulation of a predefined number of video frames (e.g., to construct video clips for 3D ConvNet filters, to generate enough inputs for LSTMs). For applications that require low-latency online predictions of fast-changing action scenes, a new action recognition system is proposed in this paper. Termed "Weighted Multi-Region Convolutional Neural Network" (WMR ConvNet), the proposed system is LSTM-free, and is based on 2D ConvNet that does not require the accumulation of video frames for 3D ConvNet filtering. Unlike early 2D ConvNets that are based purely on RGB frames and optical flow frames, the WMR ConvNet is designed to simultaneously capture multiple spatial and short term temporal cues (e.g., human poses, occurrences of objects in the background) with both the primary region (foreground) and secondary regions (mostly background). On both the UCF101 and HMDB51 datasets, the proposed WMR ConvNet achieves the state-of-the-art performance among competing low-latency algorithms. Furthermore, WMR ConvNet even outperforms the 3D ConvNet based C3D algorithm that requires video frame accumulation. In an ablation study with the optical flow ConvNet stream removed, the ablated WMR ConvNet nevertheless outperforms competing algorithms.
연구 동기 및 목표
- 3D ConvNet이나 LSTM 처리를 위해 비디오 프레임을 누적해야 하는 기존 동작 인식 시스템의 높은 지연 문제를 해결하기 위해.
- 비디오 프레임의 전경 및 배경 영역에서 공간적·시간적 맥락을 활용하여 저지연 온라인 동작 인식 성능을 향상시키기 위해.
- 실시간 추론을 가능하게 하면서도 높은 정확도를 유지하는 가벼운 LSTMs를 포함하지 않은 아키텍처를 개발하기 위해.
- 다중영역 공간 샘플링과 가중 융합이 저지연 환경에서 기존의 이중 스트림 또는 단일영역 접근 방식보다 우수한 성능을 낼 수 있는지 입증하기 위해.
제안 방법
- 각 비디오 프레임에서 주요 영역(전경)을 검출하고 국소화하기 위해 미세조정된 Faster R-CNN을 사용한다.
- 주요 영역에 상대적인 다양한 IoU 값을 가진 다수의 보조 영역(배경)을 추출하기 위해 Selective Search를 적용한다.
- RGB 및 옵티컬 플로우 입력에 대해 2D ConvNet을 사용하여 ROI- pooling을 적용하여 주요 및 보조 영역의 특징을 추출한다.
- RGB 및 옵티컬 플로우 스트림의 특징을 가중 합산 연산을 통해 융합하여 공간적 및 단기 시간적 신호를 통합한다.
- 공간 스트림에서는 프레임을 순차적으로 처리하고, 시간 스트림에서는 10프레임 창을 사용하여 최대 약 0.3초의 처리 지연을 보장한다(30fps 기준).
- 소프트맥스 레이어에서의 점수를 사용한 후기 융합 전략을 적용하며, 다수의 영역에서의 예측을 가중 평균하여 통합한다.
실험 결과
연구 질문
- RQ1비디오 프레임 누적 또는 3D 시공간 컨볼루션을 요구하지 않는 2D ConvNet 기반 시스템이 높은 동작 인식 정확도를 달성할 수 있는가?
- RQ2특히 배경 영역을 포함한 다수의 공간적 영역을 통합함으로써 저지연 환경에서 인식 성능 향상이 가능한가?
- RQ3주요 및 보조 영역에서의 특징을 가중 융합하는 방법이 SVM 기반 융합이나 특징 수준의 연결과 비교해 얼마나 효과적인가?
- RQ4옵티컬 플로우나 LSTM 구성 요소를 포함하지 않은 시스템이 이러한 구성 요소에 의존하는 최신 기술 모델을 능가할 수 있는가?
주요 결과
- WMR ConvNet은 UCF101에서 85.7%의 정확도, HMDB51에서 66.7%의 정확도를 기록하며, 모든 경쟁 저지연 2D ConvNet 방법보다 뛰어나며, iDT 및 C3D와 비교해 UCF101에서 유사하거나 뛰어난 성능을 보였다.
- 옵티컬 플로우 스트림 없이도, 추론된 WMR ConvNet은 UCF101에서 78.8%의 정확도를 기록하며, 동적 이미지 네트워크 및 기타 RGB 전용 방법을 능가했다.
- 점수 수준의 특징을 가중 합산 융합 방식은 SVM 기반 융합 및 특징 수준의 연결 방식보다 우수하며, UCF101 스플릿-1에서 75.9%의 정확도를 기록했다.
- RGB 프레임의 바운딩 박스를 주요 영역으로 사용할 경우 옵티컬 플로우 크기 기반 영역 선택보다 더 우수한 성능를 보였으며, 이는 RGB 신호가 더 정보가 많다는 것을 시사한다.
- 최대 처리 지연가 0.3초에 불과하여, 클립 기반 3D ConvNet이나 LSTM 시스템이 몇 초에서 수십 초에 이르는 지연을 겪을 수 있는 것과 비교해 현저히 낮았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.