Skip to main content
QUICK REVIEW

[논문 리뷰] VA-RED$^2$: Video Adaptive Redundancy Reduction

Bowen Pan, Rameswar Panda|arXiv (Cornell University)|2021. 02. 15.
Human Pose and Action Recognition참고 문헌 63인용 수 5
한 줄 요약

VA-RED²는 입력에 따라 동적으로 중복 계산을 줄이는 모델에 종속되지 않는 프레임워크로, 비디오 인식 모델의 중복되지 않는 특징만 선택적으로 계산하고 나머지는 저비용 선형 연산을 통해 재구성함으로써 기능한다. 공유 가중치와 미분 가능한 메커니즘을 통해 시간적 및 채널 차원에 대한 적응형 정책을 동시에 학습함으로써 I3D, R(2+1)D, X3D 모델 전반에서 정확도 손실 없이 20–40%의 FLOP 감소를 달성한다.

ABSTRACT

Performing inference on deep learning models for videos remains a challenge due to the large amount of computational resources required to achieve robust recognition. An inherent property of real-world videos is the high correlation of information across frames which can translate into redundancy in either temporal or spatial feature maps of the models, or both. The type of redundant features depends on the dynamics and type of events in the video: static videos have more temporal redundancy while videos focusing on objects tend to have more channel redundancy. Here we present a redundancy reduction framework, termed VA-RED$^2$, which is input-dependent. Specifically, our VA-RED$^2$ framework uses an input-dependent policy to decide how many features need to be computed for temporal and channel dimensions. To keep the capacity of the original model, after fully computing the necessary features, we reconstruct the remaining redundant features from those using cheap linear operations. We learn the adaptive policy jointly with the network weights in a differentiable way with a shared-weight mechanism, making it highly efficient. Extensive experiments on multiple video datasets and different visual tasks show that our framework achieves $20\% - 40\%$ reduction in computation (FLOPs) when compared to state-of-the-art methods without any performance loss. Project page: http://people.csail.mit.edu/bpan/va-red/.

연구 동기 및 목표

  • 시간과 채널을 따라 반복되는 특징 맵으로 인한 비디오 인식 모델의 높은 계산 비용 문제를 해결하기 위해.
  • 정확도 손실 없이 시간적 및 채널 차원의 중복성을 줄이기 위해.
  • 콘텐츠 동역학에 따라 입력 기반으로 계산을 적응적으로 조정하는 모델에 종속되지 않고, 미분 가능한 프레임워크를 개발하기 위해.
  • 비디오 모델의 효율적 추론을 가능하게 하기 위해 특징 계산을 위한 적응형 정책을 학습하기 위해.

제안 방법

  • 프레임워크는 입력 기반 정책을 사용하여 완전히 계산해야 할 특징 맵의 비율을 결정하며, 나머지는 저비용 선형 연산을 통해 재구성한다.
  • 공유 가중치 메커니즘을 통해 네트워크 가중치와 함께 적응형 정책을 동시에 학습함으로써 엔드 투 엔드로 미분 가능하게 한다.
  • 이 방법은 시간적 및 채널 차원 모두에 적용되며, 비디오 콘텐츠(예: 정적 또는 움직이는 물체)에 따라 동적으로 계산을 조정한다.
  • I3D, R(2+1)D, X3D와 같은 2D/3D CNN 백본에 아키텍처 수정 없이 적용된다.
  • 정확도 유지와 함께 낮은 FLOP 사용을 장려하기 위해 미세조정 중에 효율성 손실 항목을 사용한다.
  • 비디오 동작 인식, 시공간 로컬라이제이션, 세그멘테이션 작업 전반에서 검증된다.

실험 결과

연구 질문

  • RQ1비디오 모델의 중복 특징을 입력 콘텐츠에 따라 동적으로 줄일 수 있는가? 이는 계산 효율성을 향상시킬 수 있는가?
  • RQ2시간적 및 채널 차원에서 입력 기반 계산이 모델 정확도와 FLOP 감소에 어떤 영향을 미치는가?
  • RQ3미분 가능하고 공유 가중치 정책은 다양한 비디오 입력에서 계산할 특징을 적응적으로 선택할 수 있는가?
  • RQ4VA-RED²는 최신 비디오 모델에서 성능 저하 없이 FLOPs를 얼마나 줄일 수 있는가?
  • RQ5이 프레임워크는 동작 인식을 초월한 다양한 비디오 이해 작업에 일반화 가능한가?

주요 결과

  • VA-RED²는 Kinetics-400 및 Mini-Kinetics-200에서 I3D-InceptionV2 대비 40%의 FLOPs 감소를 달성했으며, 정확도 손실 없음.
  • 동일한 벤치마크에서 R(2+1)D-18 대비 30%의 계산 감소를 기록했으며, 최고 수준의 정확도 유지.
  • X3D-M에서는 약 20%의 FLOPs 감소를 기록했으며, 성능 저하 없음.
  • 절단 실험 결과, 시간적 및 채널 차원 모두에서 동적 모델링이 효율성-정확도 트레이드오프를 최적화함을 확인.
  • 시각화 결과 정책이 비디오 콘텐츠에 적응함을 확인: 복잡한 장면(예: 배구)에서는 더 많은 특징을 계산하고, 정적 또는 단순한 영상에서는 더 적은 특징을 계산.
  • 밀도 예측 작업으로 일반화되었으며, ADE-20K에서 Dilated ResNet-18를 사용할 경우 세그멘테이션에서 GFLOPs를 31.2% 감소시켰고, 평균 IoU 유지.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.