Skip to main content
QUICK REVIEW

[논문 리뷰] MGMAE: Motion Guided Masking for Video Masked Autoencoding

Bingkun Huang, Zhiyu Zhao|arXiv (Cornell University)|2023. 08. 21.
Advanced Vision and ImagingComputer Science인용 수 3
한 줄 요약

MGMAE는 시각적 마스크 자동에코딩에서 시간적으로 일관된 마스크 볼륨을 생성하기 위해 광학 흐름을 활용하는 동작 유도 마스킹 전략을 제안한다. 이는 정보 泄露를 감소시키고 재구성 과제의 곤란함을 증가시켜 자기지도 학습 기반의 비디오 표현 학습을 향상시킨다. 이로 인해 Something-Something V2(72.3% 정확도)에서 최신 기술 수준의 성능을 달성하고, 더 긴 사전 훈련 기간 동안 Kinetics-400에서도 일관된 성능 향상을 이룬다.

ABSTRACT

Masked autoencoding has shown excellent performance on self-supervised video representation learning. Temporal redundancy has led to a high masking ratio and customized masking strategy in VideoMAE. In this paper, we aim to further improve the performance of video masked autoencoding by introducing a motion guided masking strategy. Our key insight is that motion is a general and unique prior in video, which should be taken into account during masked pre-training. Our motion guided masking explicitly incorporates motion information to build temporal consistent masking volume. Based on this masking volume, we can track the unmasked tokens in time and sample a set of temporal consistent cubes from videos. These temporal aligned unmasked tokens will further relieve the information leakage issue in time and encourage the MGMAE to learn more useful structure information. We implement our MGMAE with an online efficient optical flow estimator and backward masking map warping strategy. We perform experiments on the datasets of Something-Something V2 and Kinetics-400, demonstrating the superior performance of our MGMAE to the original VideoMAE. In addition, we provide the visualization analysis to illustrate that our MGMAE can sample temporal consistent cubes in a motion-adaptive manner for more effective video pre-training.

연구 동기 및 목표

  • 프레임 간 일관성 없는 마스킹으로 인한 비디오 마스크 자동에코딩에서의 정보 泄露 문제를 해결하기 위해.
  • 마스킹 과정에서 운동 정보를 사전으로 통합하여 자기지도 학습 기반의 비디오 표현 학습을 향상시키기 위해.
  • 재구성 과제의 곤란함을 증가시키고 비디오의 구조적 특징을 학습하도록 유도하기 위해 동적이고 운동 적응형 마스킹 전략을 설계하기 위해.
  • 더 나은 마스킹 설계로 과적합 위험을 줄여 장기적이고 더 효과적인 사전 훈련을 가능하게 하기 위해.

제안 방법

  • 접근 프레임 간 운동을 캡처하기 위해 온라인이고 경량인 광학 흐름 추정기(RAFT)를 도입하여 마스킹을 안내한다.
  • 기본 프레임에서 초기 무작위 마스크 맵을 생성하고, 추정된 광학 흐름을 사용해 이를 전방 및 후방으로 워프하여 시간적으로 일관된 마스크 볼륨을 구축한다.
  • 운동 워프링에 기반한 일관된 마스크 볼륨을 바탕으로 각 프레임에서 상위-k 토큰 선택을 수행하여 자동에코딩을 위한 가시 토큰을 샘플링한다.
  • 시간적 및 공간적 정렬을 유지하기 위해 역방향 워프를 사용하여 동작 유도 마스킹을 VideoMAE 프레임워크에 통합한다.
  • 결과로 생성된 마스크 토큰을 사용하여 비전 트랜스포머 백본을 사용한 표준 마스크 자동에코딩 훈련을 수행한다.
  • 증가된 재구성 곤란함을 활용하여 모델이 더 견고하고 일반화 가능한 비디오 표현을 학습하도록 유도한다.
(a) original video clip
(a) original video clip

실험 결과

연구 질문

  • RQ1운동 정보는 비디오 마스크 자동에코딩에서 시간적 일관성을 향상시키는 데 효과적으로 활용될 수 있는가?
  • RQ2무작위 또는 튜브 마스킹 대비 운동 유도 마스킹이 프레임 간 정보 泄露를 감소시키는가?
  • RQ3운동 적응형 마스킹 전략은 더 나은 자기지도 학습 기반의 비디오 표현 학습을 이끌 수 있는가?
  • RQ4운동 유도 마스킹은 사전 훈련의 안정성과 더 긴 훈련 스케줄의 실현 가능성에 어떤 영향을 미치는가?
  • RQ5MGMAE의 성능 향상 정도는 운동 중심 및 장면 중심 비디오 벤치마크 간에 다를 수 있는가?

주요 결과

  • MGMAE는 2400 에포크 동안 Something-Something V2에서 72.3%의 상위-1 정확도를 달성하여 VideoMAE를 1.5% 뛰어넘었다.
  • Kinetics-400에서는 1600 에포크 후 81.8%의 정확도를 기록하여 VideoMAE의 81.5%를 略로 뛰어넘었다.
  • MGMAE의 사전 훈련 손실은 VideoMAE보다 항상 0.05 높아 더 곤란한 재구성 과제임을 시사한다.
  • SSV2에서 800 에포크 시 MGMAE는 VideoMAE보다 1.4% 성능 격차를 유지하고, 2400 에포크 시 1.5% 격차를 유지하여 지속적인 성능 향상을 입증했다.
  • 시각화 결과 MGMAE의 마스크 맵이 물체 운동에 따라 적응함을 확인했으며, 더 복잡하고 다이나믹한 재구성 과제를 생성했다.
  • 운동 유도 전략은 과적합 위험을 감소시켜 더 장기적인 사전 훈련을 가능하게 하고, 최종적으로 더 나은 다운스트림 성능을 이끌어냈다.
(b) tube masking
(b) tube masking

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.