Skip to main content
QUICK REVIEW

[논문 리뷰] Implicit Temporal Modeling with Learnable Alignment for Video Recognition

Shuyuan Tu, Qi Dai|arXiv (Cornell University)|2023. 04. 20.
Cancer-related molecular mechanisms researchBiochemistry, Genetics and Molecular Biology인용 수 3
한 줄 요약

이 논문은 영상 인식을 위한 경량 시간 모델링 방법인 암묵적 학습 가능한 정렬(ILA)을 제안한다. 이 방법은 비용이 많이 드는 시간적 자기주의를 암묵적이고 군집화된 특징 정렬로 대체한다. 학습 가능한 마스크를 통해 프레임 쌍 간의 상호작용 포인트를 예측하고, 그 주변의 특징을 강화함으로써 ILA는 암묵적으로 시간적 의존성을 모델링한다. Swin-L과 ViViT-H보다 훨씬 적은 FLOPs를 사용하여 Kinetics-400에서 88.7%의 top-1 정확도를 달성한다.

ABSTRACT

Contrastive language-image pretraining (CLIP) has demonstrated remarkable success in various image tasks. However, how to extend CLIP with effective temporal modeling is still an open and crucial problem. Existing factorized or joint spatial-temporal modeling trades off between the efficiency and performance. While modeling temporal information within straight through tube is widely adopted in literature, we find that simple frame alignment already provides enough essence without temporal attention. To this end, in this paper, we proposed a novel Implicit Learnable Alignment (ILA) method, which minimizes the temporal modeling effort while achieving incredibly high performance. Specifically, for a frame pair, an interactive point is predicted in each frame, serving as a mutual information rich region. By enhancing the features around the interactive point, two frames are implicitly aligned. The aligned features are then pooled into a single token, which is leveraged in the subsequent spatial self-attention. Our method allows eliminating the costly or insufficient temporal self-attention in video. Extensive experiments on benchmarks demonstrate the superiority and generality of our module. Particularly, the proposed ILA achieves a top-1 accuracy of 88.7% on Kinetics-400 with much fewer FLOPs compared with Swin-L and ViViT-H. Code is released at https://github.com/Francis-Rings/ILA .

연구 동기 및 목표

  • CLIP 기반 영상 인식 모델에 효율적이고 효과적인 시간 모델링을 적용하는 데 도전한다.
  • 계산 비용은 증가시키지만 비례적 성능 향상이 없는 복잡하거나 부적절한 시간적 자기주의 메커니즘에 대한 의존도를 줄인다.
  • 명시적인 주의 없이도 암묵적이고 군집화된 프레임 정렬이 필수적인 운동 및 동작 신호를 포착할 수 있는지 탐색한다.
  • 비전 트랜스포머와 호환되는 플러그인 모듈을 개발하여 최소한의 계산 오버헤드로 시간 모델링을 향상시킨다.
  • 두 프레임 간 상호정보가 풍부한 영역이 영상 인식을 위한 강력한 시간 신호가 될 수 있음을 입증한다.

제안 방법

  • 프레임 쌍에 조건이 된 컨볼루션 모듈을 사용하여 각 프레임에 상호작용 포인트를 예측한다.
  • 상호정보가 풍부한 영역에 더 높은 가중치를 할당하고 나머지 영역에는 낮은 가중치를 할당하는 학습 가능한 마스크를 생성하여 상호정보를 강조한다.
  • 마스크를 적용하여 두 인접 프레임의 특징을 가중치를 두고 정렬함으로써 군집화된 표현을 생성한다.
  • 정렬된 특징을 하나의 상호정보 토큰으로 풀링하여 후속 공간 자기주의를 위해 준비한다.
  • 비전 트랜스포머의 각 공간 블록에 ILA 모듈을 통합하여 암묵적 공간-시간(IST) 블록을 구성한다.
  • 상호정보 토큰을 다른 프레임 토큰과 연결하여 명시적인 시간적 주의 없이도 시간 관계를 암묵적으로 모델링한다.

실험 결과

연구 질문

  • RQ1CLIP 기반 영상 모델에서 고비용 시간적 자기주의를 암묵적이고 군집화된 프레임 정렬로 대체해도 성능 저하 없이 가능할까?
  • RQ2인접 프레임 간 상호정보가 풍부한 영역을 식별하면 동작 인식에 필요한 충분한 시간 신호를 포착할 수 있을까?
  • RQ3프레임 수준 또는 공동 주의와 같은 기존 시간 모델링 접근법과 비교해 볼 때, 제안된 ILA 방법은 효율성과 정확도에서 어떻게 비교되는가?
  • RQ4ILA의 성능는 CLIP 사전학습에 의존하는 정도가 많을까, 아니면 정렬 메커니즘 자체의 설계에 의해 결정되는가?
  • RQ5ILA는 다양한 벤치마크에서 일반화 가능하며, 하류 영상 이해 작업에서 강력한 제로샷 성능을 달성할 수 있을까?

주요 결과

  • ILA는 40G FLOPs로만 Kinetics-400에서 88.7%의 top-1 정확도를 달성하여 Swin-L(87.3%)과 ViViT-H(86.7%)보다 낮은 계산 비용으로도 슈퍼어리어를 달성한다.
  • ILA는 제로샷 평가에서 SSv2에서 43.9%의 top-1 정확도를 기록하여 X-CLIP(38.1%)와 EVL(35.2%)보다 각각 5.8%와 8.7% 높다.
  • 정적 편향이 없는 시간 이해 벤치마크에서 ILA는 top-1(T) 81.9%와 시간 점수(TS) 6.1%를 기록하여 X-CLIP(2.3 TS)와 EVL(2.4 TS)를 초월한다.
  • 절단 실험 결과, 풀링과 연결을 통한 상호정보 토큰이 원소별 덧셈(80.2%)과 직접 연결(80.6%)보다 81.3%의 정확도로 더 뛰어나게 나타났다.
  • ILA는 ImageNet-21K 가중치로 초기화된 Swin-B/32f보다도 0.6%의 top-1 정확도 우수성을 유지하여 CLIP 사전학습을 초월한 내재적 우수성을 입증한다.
  • 시각화 결과, 상호작용 포인트가 시간에 따라 움직이는 물체를 따라가며 효과적으로 동적 운동 신호를 포착하고 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.