[논문 리뷰] MVFNet: Multi-View Fusion Network for Efficient Video Recognition
MVFNet는 효율적인 1D 채널 별로 분리된 컨볼루션을 사용하여 높이-너비, 높이-시간, 너비-시간의 세 가지 공간-시간적 시점에서 비디오 동적 특성을 모델링하는 다중 시야 융합(MVF) 모듈을 제안한다. 2D CNN 기반 모델에 통합되었을 때, 표준 2D CNN과 유사한 FLOPs를 유지하면서도 여러 벤치마크에서 최신 기준 성능을 달성하며, 3D-CNN 및 TSM, ECO와 같은 효율적인 2D 기반 방법보다 뛰어난 성능을 보였다.
Conventionally, spatiotemporal modeling network and its complexity are the two most concentrated research topics in video action recognition. Existing state-of-the-art methods have achieved excellent accuracy regardless of the complexity meanwhile efficient spatiotemporal modeling solutions are slightly inferior in performance. In this paper, we attempt to acquire both efficiency and effectiveness simultaneously. First of all, besides traditionally treating H x W x T video frames as space-time signal (viewing from the Height-Width spatial plane), we propose to also model video from the other two Height-Time and Width-Time planes, to capture the dynamics of video thoroughly. Secondly, our model is designed based on 2D CNN backbones and model complexity is well kept in mind by design. Specifically, we introduce a novel multi-view fusion (MVF) module to exploit video dynamics using separable convolution for efficiency. It is a plug-and-play module and can be inserted into off-the-shelf 2D CNNs to form a simple yet effective model called MVFNet. Moreover, MVFNet can be thought of as a generalized video modeling framework and it can specialize to be existing methods such as C2D, SlowOnly, and TSM under different settings. Extensive experiments are conducted on popular benchmarks (i.e., Something-Something V1 & V2, Kinetics, UCF-101, and HMDB-51) to show its superiority. The proposed MVFNet can achieve state-of-the-art performance with 2D CNN's complexity.
연구 동기 및 목표
- 비디오 동작 인식에서 정확도와 계산 효율성 사이의 상충 관계를 해결하기 위해.
- 기존의 표준 공간-시간 평면을 초월하여 3D 비디오 시점의 여러 관점에서의 동적 특성을 캡처함으로써 스펙트로-시간 모델링을 향상시키기 위해.
- 2D CNN의 성능을 최소한의 FLOP 증가로 향상시킬 수 있는 즉시 사용 가능한 모듈을 설계하기 위해.
- C2D, SlowOnly, TSM와 같은 기존 방법에 대해 다양한 설정에서 MVFNet이 일반화 가능한지를 보여주기 위해.
제안 방법
- MVF 모듈은 시간, 높이, 너비의 동적 특성을 각각 별도로 모델링하기 위해 T, H, W 차원에 따라 세 개의 독립적인 1D 채널 별로 분리된 컨볼루션을 적용한다.
- 특징 맵을 분할: 한 부분은 다중 시야 모델링을 위해 세 개의 1D 컨볼루션을 처리하고, 다른 부분은 원래 활성화를 유지하기 위해 직접 연결된다.
- 이 모듈은 표준 ResNet 블록에 통합되어 MVF 블록을 형성하며, 이를 반복적으로 쌓아 MVFNet을 구성한다.
- 아키텍처는 2D CNN 기반 모델과 호환되며, 아키텍처의 대대적인 수정 없이 즉시 사용 가능한 통합을 지원하도록 설계되었다.
- 광학 흐름이나 3D 컨볼루션을 필요로 하지 않는 엔드 투 엔드 학습이 가능하다.
- 모델은 기존 방법에 특화될 수 있다: 예를 들어 특정 시야를 비활성화하면 TSM 또는 C2D를 복원할 수 있다.
실험 결과
연구 질문
- RQ13D 비디오의 여러 시점(H-W, H-T, W-T)에서 모델링을 통해 표준 2D+T 모델링을 초월한 스펙트로-시간 표현을 향상시킬 수 있는가?
- RQ2분리형 1D 컨볼루션 기반의 즉시 사용 가능한 모듈이 2D CNN 수준의 복잡도로 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ3다양한 설정에서 MVFNet이 TSM, C2D, 또는 SlowOnly와 같은 기존 방법에 일반화되는가?
- RQ4MVFNet이 낮은 FLOPs 수준을 유지하면서도 3D-CNN과 효율적인 2D 기반 모델을 모두 초월하는 정확도를 달성할 수 있는가?
주요 결과
- Something-Something V1에서 MVFNet는 16프레임과 99G FLOPs로 52.6%의 Top-1 정확도를 달성했으며, I3D, ECO, TSM보다 낮은 FLOPs로 성능을 뛰어넘었다.
- Kinetics-400에서 MVFNet-R50는 8프레임 입력으로 76.0%의 정확도를 기록했으며, TSM(74.1%)과 NL I3D-R50(74.9%)를 뛰어넘었고, FLOPs는 2.1배 적게 사용했다.
- 16프레임로는 MVFNet-R50가 77.0%의 정확도를 기록했으며, NL I3D-R50(76.5%)를 뛰어넘었고, FLOPs는 4.2배 적게 사용했다.
- 16- 및 8프레임 앙상블을 사용한 MVFNet-En는 Kinetics-400에서 79.1%의 정확도를 기록했으며, SlowFast(78.9%)를 초월했고, FLOPs는 2.1배 적게 사용했다(188G 대비 213G).
- UCF-101과 HMDB-51에서 MVFNet는 각각 96.6%와 75.7%의 평균 클래스 정확도를 기록했으며, 2D 기반 경량 모델을 능가했고, 3D-CNN 기반 모델과 비교해도 동등하거나 슈퍼어리어한 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.