Skip to main content
QUICK REVIEW

[논문 리뷰] AdaFuse: Adaptive Temporal Fusion Network for Efficient Action Recognition

Yue Meng, Rameswar Panda|arXiv (Cornell University)|2021. 02. 10.
Human Pose and Action Recognition참고 문헌 61인용 수 21
한 줄 요약

AdaFuse는 효율적인 비디오 행동 인식을 위해 추론 중 역사적 특징 맵을 동적으로 재사용하고 불필요한 채널을 건너뛰는 적응형 시간 병합 네트워크를 제안한다. Gumbel-Softmax를 통해 미분 가능한 정책을 학습함으로써 여러 벤치마크에서 최신 기술 수준의 모델과 유사한 정확도를 유지하면서 약 40%의 FLOPs를 감소시킨다.

ABSTRACT

Temporal modelling is the key for efficient video action recognition. While understanding temporal information can improve recognition accuracy for dynamic actions, removing temporal redundancy and reusing past features can significantly save computation leading to efficient action recognition. In this paper, we introduce an adaptive temporal fusion network, called AdaFuse, that dynamically fuses channels from current and past feature maps for strong temporal modelling. Specifically, the necessary information from the historical convolution feature maps is fused with current pruned feature maps with the goal of improving both recognition accuracy and efficiency. In addition, we use a skipping operation to further reduce the computation cost of action recognition. Extensive experiments on Something V1 & V2, Jester and Mini-Kinetics show that our approach can achieve about 40% computation savings with comparable accuracy to state-of-the-art methods. The project page can be found at https://mengyuest.github.io/AdaFuse/

연구 동기 및 목표

  • 비디오 행동 인식에서 깊은 CNN의 높은 계산 비용을 줄이기 위해 시간 프레임 간의 특징 중복성을 활용한다.
  • 모델에 종속되지 않고, 각 인스턴스와 레이어마다 채널을 건너뛰거나 재사용하거나 계산할지를 결정하는 미분 가능한 메커니즘을 개발한다.
  • 비디오 특징의 시간적 일관성을 활용하여 정확도를 훼손하지 않고 효율성을 향상시킨다.
  • 기존 2D-CNN 아키텍처와 호환되는 플러그인 솔루션을 제공한다.
  • 학습된 정책 분포를 통해 데이터셋별 및 레이어별 시간 동적 특성을 이해할 수 있도록 한다.

제안 방법

  • 각 레이어의 각 채널에 대해 스킵, 재사용, 계산 중 하나를 선택하는 Gumbel-Softmax 기반의 미분 가능한 결정 정책을 도입한다.
  • 학습된 어텐션 가중치를 사용해 현재 잘라낸 특징과 이전의 특징 맵을 병합하여 시간적 맥락을 유지한다.
  • 낮은 동적 프레임에서 반복적인 특징 계산을 피하기 위해 스킵 연결을 적용하여 계산량을 줄인다.
  • 정확도와 FLOP 감소를 균형 잡는 가중치 손실를 사용하여 정 politik 네트워크를 메인 네트워크와 함께 백프로파게이션을 통해 동시에 훈련시킨다.
  • 경량화되고 확장 가능한 정책 네트워크를 설계하였으며, 효율성을 위해 은닉 크기와 정규화 하이퍼파rameter를 조정하였다.
  • TSN, TSM, ResNet 등의 기존 2D-CNN 기반 아키텍처에 AdaFuse를 플러그인으로 통합하여 즉각적인 효율성 향상을 가능하게 하였다.

실험 결과

연구 질문

  • RQ1채널 수준의 적응형 결정(스킵, 재사용, 계산)이 정확도 저하 없이 비디오 행동 인식에서 FLOPs를 크게 감소시킬 수 있는가?
  • RQ2학습된 정책은 다양한 비디오 데이터셋과 네트워크 레이어 간에 어떻게 변화하는가? 이는 시간적 동적 특성에 대해 무엇을 드러내는가?
  • RQ3정책 네트워크의 용량을 확장할 경우 모델 크기, 추론 속도, 정확도 간의 상호 교환 관계는 어떻게 되는가?
  • RQ4스킵과 재사용 연산의 조합이 효율성-정확도 트레이드오프 측면에서 난수나 단순 선택보다 어떻게 다른가?
  • RQ5정책 분포는 데이터셋 별 시간적 특성을 이해하고 향후 아키텍처 설계를 안내하는 진단 도구로 활용될 수 있는가?

주요 결과

  • AdaFuse는 Something-Something V1 및 V2, Jester, Mini-Kinetics에서 상태 최신 기술 수준의 정확도를 유지하면서 약 40%의 FLOP 감소를 달성하였다.
  • 재사용 연산이 정확도 향상에 가장 큰 기여를 하였으며, 난수 스킵 대비 Top-1 정확도를 21.5%p 향상시켰다.
  • 스킵 연산이 효율성 향상의 주요 원동력이었으며, 'Ada. Skip' 분석에서 FLOPs를 55% 감소시켰다.
  • 정책 네트워크의 은닉 크기를 1024에서 4096으로 증가시켰을 때, Something-V2에서 Top-1 정확도는 59.40%에서 60.00%로 향상되었고, FLOPs 증가율은 최소 수준이었다.
  • 정책 분포는 초기 레이어가 시간적 변화에 덜 민감하고, 후속 레이어가 입력의 동적 특성에 더 유연하게 적응한다는 것을 드러냈다.
  • 적응형 정책는 난수나 고정 정책보다 우수한 성능을 보였으며, TSN-R18를 사용하여 Something-V1에서 10.3G FLOPs와 36.9%의 Top-1 정확도를 달성하여 최적의 정확도-효율성 트레이드오프를 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.