[논문 리뷰] FASTER Recurrent Networks for Efficient Video Classification
FASTER는 경량 모델과 고비용 모델의 예측을 새로운 순환 단위인 FAST-GRU를 통해 조합하여 시공간적 부재를 활용하는 새로운 프레임워크로, Kinetics, UCF-101, HMDB-51에서 최신 기준 정확도를 유지하면서도 FLOPs를 10배 이상 감소시킨다. 이는 성능을 저하시키지 않은 채 최대 75%의 클립을 저비용 모델로 처리함으로써 달성된다.
Typical video classification methods often divide a video into short clips, do inference on each clip independently, then aggregate the clip-level predictions to generate the video-level results. However, processing visually similar clips independently ignores the temporal structure of the video sequence, and increases the computational cost at inference time. In this paper, we propose a novel framework named FASTER, i.e., Feature Aggregation for Spatio-TEmporal Redundancy. FASTER aims to leverage the redundancy between neighboring clips and reduce the computational cost by learning to aggregate the predictions from models of different complexities. The FASTER framework can integrate high quality representations from expensive models to capture subtle motion information and lightweight representations from cheap models to cover scene changes in the video. A new recurrent network (i.e., FAST-GRU) is designed to aggregate the mixture of different representations. Compared with existing approaches, FASTER can reduce the FLOPs by over 10x? while maintaining the state-of-the-art accuracy across popular datasets, such as Kinetics, UCF-101 and HMDB-51.
연구 동기 및 목표
- 각 클립을 독립적으로 처리하는 데에 고비용 네트워크를 사용하는 영상 분류 모델의 높은 계산 비용을 줄이기 위해.
- 영상 시퀀스의 시간적 부재를 활용하여 경량 모델과 고비용 모델의 예측을 조합함으로써 재건 계산을 최소화하기 위해.
- 클립 수준의 예측을 단순 평균화보다 더 나은 성능을 내는 학습 가능한 집계 메커니즘을 설계하기 위해.
- ImageNet 사전 훈련 없이도 최신 기준 정확도/FLOPs 트레이드오프를 달성하기 위해.
- 자원 제약이 있는 장치에서 고정확도 영상 모델의 효율적 배포를 가능하게 하기 위해.
제안 방법
- 대부분의 클립을 경량 모델로 처리하고 일부는 고비용 모델로 처리하여 FLOPs를 감소시키는 FASTER(시공간적 부재를 위한 특징 집계) 프레임워크를 제안한다.
- 공간 해상도를 유지하고 채널별 특징 압축을 적용하여 효율적인 표현 집계를 위한 새로운 게이팅 순환 단위인 FAST-GRU를 도입한다.
- 두 가지 브랜치 아키텍처를 사용한다: 세부 운동 특징을 위해 고비용 모델(예: R(2+1)D-50 또는 R3D-50), 장면 수준의 변화를 위해 경량 모델.
- 시간에 따라 두 모델의 예측을 통합하기 위해 순환 네트워크를 활용하여 평균 풀링을 넘는 장거리 의존성을 모델링한다.
- 표준 GRU와 달리 전역 평균 풀링을 피함으로써 특징 맵의 시공간 해상도를 유지한다.
- 다양한 모델 복잡도에서 유도된 이질적 표현의 최적 융합을 학습하기 위해 엔드 투 엔드로 집계 네트워크를 훈련시킨다.
실험 결과
연구 질문
- RQ1영상 시퀀스의 시간적 부재를 활용하여 영상 분류의 FLOPs를 감소시키되 정확도를 저하시키지 않을 수 있는가?
- RQ2학습 가능한 순환 집계 메커니즘이 클립 수준 예측의 단순 평균화보다 더 나은 성능을 낼 수 있는가?
- RQ3경량 및 고비용 네트워크를 모두 사용하는 하이브리드 모델이 단일 모델 기반 베이스라인보다 더 나은 정확도/FLOPs 트레이드오프를 달성할 수 있는가?
- RQ4제안된 FAST-GRU 아키텍처가 표준 RNN보다 다중 복잡도 표현의 통합을 더 효과적으로 수행할 수 있는가?
- RQ5FASTER 프레임워크는 ImageNet 사전 훈련 없이도 다양한 백본과 데이터셋에 일반화될 수 있는가?
주요 결과
- FASTER32는 8개 클립 기준 67.7 GFLOPs로 Kinetics에서 75.3%의 top-1 정확도를 달성했으며, I3D(68.4%)의 432 GFLOPs를 사용한 결과보다 뛰어나고 NL-I3D의 FLOPs의 5%에 불과하다.
- FASTER16는 16개 클립 기준 14.4 GFLOPs로 71.7%의 top-1 정확도를 기록했으며, 사전 훈련되지 않은 I3D(68.4%)보다 FLOP 비용의 절반으로 성능을 초월한다.
- 프레임워크는 정확도를 유지하면서도 FLOPs를 10배 이상 감소시켰으며, 최대 75%의 클립을 저비용 모델로 처리함으로써 이를 달성했다.
- FAST-GRU는 장거리 의존성을 효과적으로 모델링하고 특징 맵의 공간 해상도를 유지함으로써 표준 GRU와 평균 풀링보다 뛰어난 성능을 보였다.
- FASTER 프레임워크는 잘 일반화된다: R(2+1)D-50를 R3D-50로 교체하면 성능이 약간 향상되며, 동일한 FLOP 감소 효과를 유지한다.
- UCF-101과 HMDB-51에서 FASTER32는 각각 96.9%와 75.7%의 정확도를 기록했으며, 상당히 낮은 계산 비용으로 최신 기준 결과를 충족하거나 초월했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.