[논문 리뷰] Multiview Transformers for Video Recognition
이 논문은 여러 시간적 지속 시간을 가진 튜브릿(tubelets)을 사용하여 비디오의 다중 시공간적 시야(multiview)를 별도의 트랜스포머 인코더로 처리하고 횡방향 융합(lateral fusion)을 통해 처리하는 새로운 비디오 인식 아키텍처인 Multiview Transformers(MTV)를 제안한다. MTV는 6개의 비디오 데이터셋에서 최신 기준(SoA) 성능을 달성하며, 더 깊은 단일 시야 트랜스포머보다 더 적은 FLOPs를 사용한다. 또한 JFT-300M 및 WTS와 같은 대규모 데이터셋에서의 사전학습을 통해 성능을 추가로 향상시킨다.
Video understanding requires reasoning at multiple spatiotemporal resolutions -- from short fine-grained motions to events taking place over longer durations. Although transformer architectures have recently advanced the state-of-the-art, they have not explicitly modelled different spatiotemporal resolutions. To this end, we present Multiview Transformers for Video Recognition (MTV). Our model consists of separate encoders to represent different views of the input video with lateral connections to fuse information across views. We present thorough ablation studies of our model and show that MTV consistently performs better than single-view counterparts in terms of accuracy and computational cost across a range of model sizes. Furthermore, we achieve state-of-the-art results on six standard datasets, and improve even further with large-scale pretraining. Code and checkpoints are available at: https://github.com/google-research/scenic/tree/main/scenic/projects/mtv.
연구 동기 및 목표
- 비디오 이해에서 다중 해상도 시공간적 맥락을 모델링하는 데에 단일 시야 트랜스포머의 한계를 해결하기 위해.
- 피라미드 기반 또는 서브샘플링 기반의 다중 해상도 처리를 대체하기 위해 통합적이고 유연한 프레임워크를 사용하는 다중 입력 시야를 도입하기 위해.
- 다양한 시간 해상도를 동시에 처리할 수 있도록 함으로써 비디오 인식의 정확도-계산량 트레이드오프를 향상시키기 위해.
- 모델 깊이를 늘리는 것보다 시야 수를 늘리는 것이 더 큰 정확도 향상을 가져오는지 확인하기 위해.
- 감독 학습 및 자기지도 학습 사전학습을 통해 표준 비디오 벤치마크에서 최신 기준(SoA) 성능을 달성하기 위해.
제안 방법
- 비디오 클립을 다양한 시간 지속 시간을 가진 튜브릿으로 토큰화하여 다중 입력 시야를 생성한다—짧은 튜브릿은 세밀한 동작을, 긴 튜브릿은 장면 맥락을 위한 것이다.
- 각 시야는 서로 다른 용량(예: 더 작은 은닉 크기와 더 적은 레이어 수)을 가진 전용 트랜스포머 인코더로 처리된다.
- 인코더 간의 횡방향 연결을 통해 다중 시야 특징 융합이 가능해져, 거시적 및 세밀한 표현 간의 상호작용이 가능해진다.
- 최종적으로, 모든 시야의 특징을 융합하기 위해 하나의 글로벌 트랜스포머 인코더가 사용되어 통합된 표현을 생성한다.
- 아키텍처는 다양한 수의 시야를 지원하며, '소형'에서 '초대형'까지 다양한 모델 크기로 확장 가능하다.
- JFT-300M 및 WTS와 같은 데이터셋에서의 대규모 사전학습을 통해 성능을 추가로 향상시킨다.

실험 결과
연구 질문
- RQ1단일 시야 트랜스포머와 비교해 병렬적으로 다중 시야를 처리하는 것이 비디오 인식 정확도 향상에 기여하는가?
- RQ2모델 깊이를 늘리는 것보다 시야 수를 늘리는 것이 더 큰 정확도 향상을 가져오는가?
- RQ3피라미드 기반 또는 서브샘플링 기반 접근 방식과 비교해 다중 시야 설계가 더 나은 정확도-계산량 트레이드오프를 달성할 수 있는가?
- RQ4웹 스케일 비디오 데이터셋에서의 대규모 사전학습과 결합했을 때 다중 시야 설계의 효과는 어떠한가?
- RQ5MViT나 Swin에서 사용하는 기존의 다중 해상도 어텐션 메커니즘과 다중 시야 접근 방식은 상호 보완적인가?
주요 결과
- Kinetics-400에서 MTV-Base 모델은 ViViT-L-FE보다 40% 적은 FLOPs를 사용하면서도 Top-1 정확도 89.9%를 달성한다.
- WTS 사전학습을 통해 MTV는 Kinetics-400에서 89.9%의 Top-1 정확도를 기록했으며, 이는 이전 최신 기준(CoVeR)보다 2.7% 향상된 성능이다.
- Kinetics-600에서 MTV는 WTS 사전학습을 통해 90.3%의 Top-1 정확도를 달성했으며, 이는 이전 최신 기준보다 2.4% 절대적 향상이다.
- Epic-Kitchens-100에서 MTV-B(320p)는 WTS 사전학습을 통해 50.5%의 Top-1 동작 정확도를 기록했으며, 이는 새로운 최신 기준이다.
- Something-Something V2에서 MTV는 ViViT-L-FE보다 2.6% 향상되었고, MFormer보다 0.4% 향상되었다.
- Moments in Time에서 MTV-L은 WTS 사전학습을 통해 47.2%의 Top-1 정확도를 기록했으며, HowTo100M 사전학습을 사용한 VATT를 능가했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.