Skip to main content
QUICK REVIEW

[논문 리뷰] Busy-Quiet Video Disentangling for Video Classification

Guoxi Huang, Adrian G. Borş|arXiv (Cornell University)|2021. 03. 29.
Generative Adversarial Networks and Image Synthesis참고 문헌 54인용 수 5
한 줄 요약

이 논문은 시공간 주파수를 필터링하여 비디오 데이터에서 바쁜 움직임 세부 정보를 조용한 배경 콘텐츠에서 분리하는 새로운 운동 밴드패스 모듈(MBPM)을 제안한다. 이를 통해 이중 경로의 바쁜-조용함 네트워크(BQN)는 움직임 중심 영역에 대해 고복잡도로, 정적 영역에 대해 저복잡도로 처리할 수 있다. BQN은 주파수 도메인에서의 운동 필터링과 효율적인 이중경로 특징 학습을 활용하여, FLOPs를 크게 줄이며 Something-Something V1, Kinetics400, UCF101, HMDB51에서 최신 기준 성능을 달성한다.

ABSTRACT

In video data, busy motion details from moving regions are conveyed within a specific frequency bandwidth in the frequency domain. Meanwhile, the rest of the frequencies of video data are encoded with quiet information with substantial redundancy, which causes low processing efficiency in existing video models that take as input raw RGB frames. In this paper, we consider allocating intenser computation for the processing of the important busy information and less computation for that of the quiet information. We design a trainable Motion Band-Pass Module (MBPM) for separating busy information from quiet information in raw video data. By embedding the MBPM into a two-pathway CNN architecture, we define a Busy-Quiet Net (BQN). The efficiency of BQN is determined by avoiding redundancy in the feature space processed by the two pathways: one operating on Quiet features of low-resolution, while the other processes Busy features. The proposed BQN outperforms many recent video processing models on Something-Something V1, Kinetics400, UCF101 and HMDB51 datasets.

연구 동기 및 목표

  • 원본 RGB 비디오에서 정적 배경과 부드러운 무늬에 대한 불필요한 처리로 인해 기존 비디오 모델의 효율성이 떨어지는 문제를 해결하기 위해.
  • 시공간 도메인에서 저주파수이고 반복적인 성분에서 운동 관련 정보를 분리할 수 있는 학습 가능한 엔드 투 엔드 메커니즘을 개발하기 위해.
  • 움직임 콘텐츠에 따라 계산 자원을 적절히 할당하는 이중 경로 네트워크 아키텍처(바쁜-조용함 네트워크)를 설계하기 위해.
  • 비디오 데이터의 주파수 도메인 희박성 특성을 활용하여 계산 비용을 줄이고 분류 정확도를 향상시키기 위해.
  • 광학 플로우나 프레임 요약에 의존하지 않고 실시간으로 운동 표현을 생성할 수 있도록 하기 위해.

제안 방법

  • 운동 밴드패스 모듈(MBPM)은 주파수 도메인에서 학습 가능한 밴드패스 필터를 통해 비디오 시퀀스를 필터링하여 운동 관련 특징을 추출한다. 이는 빠르게 움직이는 에지와 경계가 인코딩되는 특정 대역폭을 목표로 한다.
  • 연속된 3개의 RGB 프레임마다, MBPM은 시간적 중복성을 줄이고 필수적인 운동 신호를 유지하는 단일 대표 프레임을 출력한다.
  • 바쁜-조용함 네트워크(BQN)는 두 개의 병렬 경로를 사용한다: 바쁜 경로는 MBPM 출력에서 유고해상도 운동 특징을 처리하고, 조용함 경로는 정적 콘텐츠의 저해상도 다운샘플드 표현을 처리한다.
  • 밴드패스 횡방향 연결(BPLC) 모듈은 두 경로 간의 특징을 융합하여 모델 최적화에 필수적인 상호 정보 교환을 가능하게 한다.
  • 기존의 3D CNN 백본(TSM-R50, X3D-M, I3D 등)과 호환되어 최신 기술 모델에 즉시 통합할 수 있다.
  • 전체 시스템은 엔드 투 엔드로 학습 가능하며, 시간 순서를 엄격히 유지한다. 이는 장기적인 시간적 모델링을 가능하게 하며, 프레임 요약 방법과는 다르다.

실험 결과

연구 질문

  • RQ1주파수 도메인 필터링을 통해 비디오 데이터에서 불필요한 정적 콘텐츠에서 운동 정보를 효과적으로 분리할 수 있는가?
  • RQ2바쁜 영역과 조용한 영역을 분리함으로써 계산 자원을 비례적으로 할당함으로써 더 효율적이고 정확한 비디오 분류가 가능한가?
  • RQ3시공간 주파수 필터링을 통해 유도된 학습 가능한 운동 표현이 정확도와 효율성 면에서 광학 플로우나 프레임 수준 요약보다 뛰어나게 될 수 있는가?
  • RQ4BPLC 모듈이 이중 경로 아키텍처에서 특징 융합과 전체 모델 성능을 어느 정도 향상시키는가?
  • RQ5제안된 방법이 기존 3D CNN과 비교해 표준 벤치마크에서 최신 기준 성능을 달성하면서 FLOPs를 줄일 수 있는가?

주요 결과

  • TSM-R50를 사용한 BQN은 Kinetics400에서 77.3%의 top-1 정확도를 기록했으며, I3D보다 +6.2% 높고, Oct-I3D보다 +2.7% 높으며, FLOPs는 3.7배 적게 소모한다.
  • Something-Something V1에서 BQN 48f와 TSM-R50 조합은 54.3%의 top-1 정확도를 달성했으며, 두 번째로 우수한 성능을 낸 TEA 16f보다 +2.0% 높다.
  • 앙상블 버전인 BQN En은 Something-Something V1에서 top-1 정확도 57.1%, top-5 정확도 84.2%를 기록하여 새로운 최신 기준을 수립했다.
  • X3D-M를 백본으로 사용할 경우, BQN은 일반 X3D-M보다 4배 더 많은 프레임을 처리하면서도 FLOPs는 50%만 증가시켰다. 이는 놀라운 효율성을 보여준다.
  • X3D-M를 사용한 BQN은 TSM-R50 16f보다 top-1 정확도에서 3.4% 높은 성능을 냈으며, 계산 복잡도는 그의 14%에 불과했다.
  • UCF101과 HMDB51에서 BQN은 TSM-R50를 사용해 각각 97.6%와 77.6%의 평균 클래스 정확도를 기록했으며, 광학 플로우를 사용한 I3D를 제외한 대부분의 방법보다 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.