Skip to main content
QUICK REVIEW

[논문 리뷰] AR-Net: Adaptive Frame Resolution for Efficient Action Recognition

Yue Meng, Chung-Ching Lin|arXiv (Cornell University)|2020. 07. 31.
Human Pose and Action Recognition참고 문헌 62인용 수 10
한 줄 요약

AR-Net는 각 비디오 프레임마다 최적의 입력 해상도를 동적으로 선택하는 유연하고 미분 가능한 해상도 조정 메커니즘을 제안한다. 이는 동작 인식의 효율성과 정확도를 향상시킨다. 인식 모델과 함께 공동으로 훈련되는 Gumbel-Softmax 정규화 정책 네트워크를 사용함으로써, AR-Net는 ActivityNet-v1.3에서 최대 45%의 FLOPS를 절감하면서도 균일한 해상도 기반 기준보다 정확도를 향상시킨다.

ABSTRACT

Action recognition is an open and challenging problem in computer vision. While current state-of-the-art models offer excellent recognition results, their computational expense limits their impact for many real-world applications. In this paper, we propose a novel approach, called AR-Net (Adaptive Resolution Network), that selects on-the-fly the optimal resolution for each frame conditioned on the input for efficient action recognition in long untrimmed videos. Specifically, given a video frame, a policy network is used to decide what input resolution should be used for processing by the action recognition model, with the goal of improving both accuracy and efficiency. We efficiently train the policy network jointly with the recognition model using standard back-propagation. Extensive experiments on several challenging action recognition benchmark datasets well demonstrate the efficacy of our proposed approach over state-of-the-art methods. The project page can be found at https://mengyuest.github.io/AR-Net

연구 동기 및 목표

  • 현실 세계 응용에서 최신 동작 인식 모델의 높은 계산 비용 문제를 해결하기 위해.
  • 정확도를 훼손하지 않으면서 계산량을 줄이는 프레임 단위의 해상도 적응을 가능하게 하기 위해.
  • 강화 학습의 복잡성을 피하기 위해, 역전파를 통해 정책을 공동으로 훈련시키기 위해.
  • 다양한 비디오 입력에서 정확도와 효율성 사이의 탄력적인 트레이드오프를 달성하기 위해.
  • 다양한 벤치마크 데이터셋과 백본 아키텍처에 걸쳐 일반화 가능성을 입증하기 위해.

제안 방법

  • 경량 정책 네트워크가 입력 프레임의 내용에 기반해 최적의 해상도(또는 스킵)를 예측한다.
  • Gumbel-Softmax를 사용해 이산 분포에서 샘플링함으로써 표준 역전파를 통한 미분 가능한 훈련이 가능해진다.
  • 성능와 계산량을 균형 있게 유지하기 위해 정확도 손실, 효율성 손실(GFLOPS), 균일성 정규화를 조합한 훈련 목표를 설정한다.
  • 워밍업, 공동 훈련, 미세조정 단계를 포함한 종단간 최적화 전략을 사용해 엔드 투 엔드로 훈련한다.
  • 모델에 종속되지 않으며, 다양한 2D/3D CNN 백본(예: EfficientNet 포함)에 적용 가능하다.
  • 추론 도중 실시간으로 해상도 결정을 내리며, 정보가 풍부한 프레임은 고해상도로 처리하고, 반복적이거나 저품질의 프레임은 저해상도로 변환하거나 스킵한다.

실험 결과

연구 질문

  • RQ1균일한 해상도 처리에 비해 적응형 프레임 해상도 선택이 정확도와 효율성 양면에서 향상시킬 수 있는가?
  • RQ2이산적인 해상도 선택 정책을 표준 역전파를 통해 종단간 훈련할 수 있는가?
  • RQ3정확도, 효율성, 정책 균일성에 대해 공동 최적화할 경우 모델 성능에 어떤 영향을 미치는가?
  • RQ4제안된 방법이 다양한 비디오 데이터셋과 백본 아키텍처에 걸쳐 일반화 가능한가?
  • RQ5해상도 선택 외에 프레임 스킵을 포함할 경우 효율성과 성능에 어떤 영향을 미치는가?

주요 결과

  • AR-Net는 ActivityNet-v1.3 데이터셋에서 최신 기법 대비 FLOPS를 45% 감소시키며, mAP를 73.3%에서 73.8%로 향상시켰다.
  • 해상도 선택과 프레임 스킵의 조합이 가장 우수한 성능-효율성 트레이드오프를 제공하며, 단지 하나의 기능만을 사용하는 전략보다 뛰어난 성능을 보였다.
  • 정확도, 효율성, 균일성 손실을 모두 포함한 훈련으로 GFLOPS/V가 33.47로 감소하여 균일한 기준 방법(60.06 GFLOPS/V)보다 크게 낮아졌다.
  • 낮은 계산 비용에서도 균일한 해상도 기반 기준보다 더 높은 정확도를 달성함으로써, 적응형 해상도가 효율성과 성능을 동시에 향상시킨다는 것을 입증했다.
  • 정성적 결과는 AR-Net이 정보가 풍부한 프레임(예: 핵심 동작 순간)을 정확히 식별하고 유지하는 반면, 관련 없거나 흐린 프레임은 저해상도로 변환하거나 스킵함을 보여준다.
  • 이 방법은 ActivityNet-v1.3, FCVID, Mini-Kinetics 등 다양한 데이터셋에서 효과적이며, 정확도와 효율성 측면에서 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.