Skip to main content
QUICK REVIEW

[논문 리뷰] MeMViT: Memory-Augmented Multiscale Vision Transformer for Efficient Long-Term Video Recognition

Chao-Yuan Wu, Yanghao Li|arXiv (Cornell University)|2022. 01. 20.
Human Pose and Action Recognition인용 수 9
한 줄 요약

MeMViT는 기존 모델 대비 30배 더 긴 시간적 지원을 가능하게 하는 메모리 증강 다중스케일 비전 트랜스포머를 제안한다. 이는 프레임 간 시간적 맥락을 캐시하고 재사용함으로써 효율적인 장기 영상 인식을 가능하게 하며, 계산량은 4.5% 증가에 그친다. 계산량 증가 비용에 비해 AVA, EPIC-Kitchens-100 및 행동 예측 벤치마크에서 기존 방법을 능가한다. 이는 캐시된 키와 값에 대한 계층적 자기주의 어텐션과 효율성을 위한 공동 메모리 압축 모듈을 활용함으로써 달성된다.

ABSTRACT

While today's video recognition systems parse snapshots or short clips accurately, they cannot connect the dots and reason across a longer range of time yet. Most existing video architectures can only process <5 seconds of a video without hitting the computation or memory bottlenecks. In this paper, we propose a new strategy to overcome this challenge. Instead of trying to process more frames at once like most existing methods, we propose to process videos in an online fashion and cache "memory" at each iteration. Through the memory, the model can reference prior context for long-term modeling, with only a marginal cost. Based on this idea, we build MeMViT, a Memory-augmented Multiscale Vision Transformer, that has a temporal support 30x longer than existing models with only 4.5% more compute; traditional methods need >3,000% more compute to do the same. On a wide range of settings, the increased temporal support enabled by MeMViT brings large gains in recognition accuracy consistently. MeMViT obtains state-of-the-art results on the AVA, EPIC-Kitchens-100 action classification, and action anticipation datasets. Code and models are available at https://github.com/facebookresearch/memvit.

연구 동기 및 목표

  • 현재 모델들이 5초 한계를 가진 점을 감안해, 이에 못지않게 효율적인 장기 영상 이해를 가능하게 하기 위해.
  • 장기 영상 처리에서 계산 및 메모리 제약을 해결하기 위해 전체 장기 시퀀스를 동시에 처리하는 것을 피하기 위해.
  • 이전 맥락에 액세스할 수 있는 온라인, 점진적인 영상 모델링을 위한 메모리 기반 메커니즘 개발을 위해.
  • 계산 비용을 크게 증가시키지 않고도 장거리 행동 이해 작업의 정확도를 향상시키기 위해.
  • 오직 중요한 장거리 신호만 유지하는 압축된 메모리 모듈을 갖춘 엔드 투 엔드 학습을 가능하게 하기 위해.

제안 방법

  • MeMViT는 온라인 방식으로 영상을 처리하며, 이전 클립들로부터의 키와 값 형태의 '메모리'를 캐시하여 자기주의 어텐션 메커니즘에 활용한다.
  • 각 추론 단계에서 쿼리는 현재 프레임 토큰과 이전에 캐시된 키/값 양쪽 모두에 주목함으로써, 시간에 따라 모델의 효과적 수신 범위를 연장한다.
  • 전체 텐서 기반 접근 방식 대비 메모리 비용을 줄이기 위해 시간, 높이, 너비 차원에 따라 분해된 상대적 위치 임베딩을 사용한다.
  • 기존 영상의 가장 정보가 많은 특징만 유지하도록 엔드 투 엔드로 훈련되는 공동 메모리 압축 모듈을 도입하여 메모리 프로필을 최소화한다.
  • 다중스케일 특징 계층을 갖춘 MViT를 기반으로 하며, 인과적 어텐션과 풀링을 통해 자동적으로 일관성을 확보하는 장거리 모델링에 적합하게 변형된다.
  • 진행적 사전 훈련을 사용하여, 단일 클립에서부터 전체 10초 영상까지 점진적으로 영상 길이를 늘여 학습 안정성과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1계산량이나 메모리 사용량이 비례적으로 증가하지 않도록 하면서도, 영상 모델이 상당히 더 긴 효과적 시간적 맥락을 확보할 수 있는가?
  • RQ2이전 프레임들로부터 캐시하고 재사용하는 어텐션 키와 값의 활용이 장기 행동 인식 정확도를 어떻게 향상시키는가?
  • RQ3일반적인 영상 트랜스포머가 단일 프로세싱 패스로 장기 시퀀스를 처리하는 것에 비해, 메모리 증강 설계가 우월한 성능을 낼 수 있는가?
  • RQ4공동 메모리 압축 모듈이 장거리 영상 작업에서 성능을 유지하면서 얼마나 메모리 오버헤드를 줄일 수 있는가?
  • RQ5메모리 액세스 기반의 온라인 점진적 처리 방식이 장기 영상 이해 벤치마크에서 더 나은 일반화 및 강건성을 이끌어낼 수 있는가?

주요 결과

  • MeMViT는 기존 모델 대비 30배 더 긴 시간적 지원을 달성했으며, 계산량은 4.5% 증가에 그쳤다. 반면 기존 방법은 같은 성능 향상을 위해 3,000% 이상의 계산량 증가가 필요하다.
  • AVA 데이터셋에서 MeMViT는 시공간 행동 로컬라이제이션 분야에서 최신 기술(SOTA) 성능을 달성하며, 향상된 장거리 추론 능력을 입증했다.
  • EPIC-Kitchens-100에서 MeMViT는 행동 분류 및 행동 예측 작업 모두에서 새로운 최신 기술(SOTA) 결과를 기록했으며, 단기 기반 모델 대비 뚜렷한 정확도 향상을 보였다.
  • 제거 실험 결과, 분류기 이전에 트랜스포머 레이어를 추가하면 mAP가 27.0에서 27.0으로 상승하고, 전체 프레임 특징을 사용할 경우 mAP는 26.6까지 상승한다.
  • MeMViT의 인과적 변형은 미래 정보 유출 없이도 행동 예측을 성공적으로 수행했으며, EPIC-Kitchens-100 예측 벤치마크에서 뛰어난 성능을 기록했다.
  • 진행적 사전 훈련은 모델 수렴과 성능 향상을 이끌었으며, 특히 초기 학습 단계에서 효과적이다. 이는 모델이 점진적으로 더 긴 영상 세그먼트에 노출되도록 함으로써 달성된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.