[논문 리뷰] DropMAE: Learning Representations via Masked Autoencoders with Spatial-Attention Dropout for Temporal Matching Tasks
DropMAE는 시각적 객체 추적(VOT) 및 비디오 객체 세분화(VOS)를 위한 비디오 표현 사전학습에서 시간적 대응 학습을 향상시키기 위해 적응형 공간-주의 드롭아웃을 적용한 마스킹 오토에인코드어를 제안한다. 재구성 과정에서 공간적 신호의 상호적응을 방해함으로써 시간적 특징 학습을 향상시키며, ImageNet 기반 MAE보다 2배 빠른 사전학습 속도를 기록하면서도 9개 벤치마크 중 8개에서 최신 기술 성능을 달성한다.
This paper studies masked autoencoder (MAE) video pre-training for various temporal matching-based downstream tasks, i.e., object-level tracking tasks including video object tracking (VOT) and video object segmentation (VOS), self-supervised visual correspondence learning, dense tracking tasks including optical flow estimation and long-term point tracking, and 3D point cloud tracking. Specifically, our work explores to provide a general representation to boost the temporal matching ability in various downstream tracking tasks. To achieve this, we firstly find that a simple extension of MAE, which randomly masks out frame patches in videos and reconstruct the frame pixels, heavily relies on spatial cues while ignoring temporal relations for frame reconstruction, thus leading to sub-optimal temporal matching representations. To alleviate this, we propose DropMAE, which adaptively performs spatial-attention dropout in the frame reconstruction to facilitate temporal correspondence learning in videos. We obtain several important findings with DropMAE: 1) DropMAE is a strong and efficient temporal matching learner, which achieves better fine-tuning results on matching-based tasks than the ImageNet-based MAE with 2x faster pre-training speed. 2) DropMAE is effective for different tracking tasks, i.e., object-level matching tasks including VOT and VOS, dense tracking tasks including optical flow estimation and tracking any point (TAP), and even 3D tracking in the different modality of point cloud data. Since none exists, we build ViT-based trackers for different downstream tracking tasks, and our pre-trained DropMAE model can be directly loaded in these ViT-based trackers for fine-tuning without further modifications. Experiments on 6 downstream tracking tasks demonstrate the effectiveness of DropMAE as a general pre-trained representation for diverse tracking tasks.
연구 동기 및 목표
- 비디오 사전학습에서 매칭 기반 작업(예: VOT 및 VOS)에 적합하지 않은 표준 마스킹 오토에인코드어(MAE)의 시간적 표현 학습이 최적화되지 않는 문제를 해결하기 위해.
- 프레임 내 토큰 간의 상호적응을 완화함으로써 재구성 과정에서 공간적 신호에 대한 의존도를 줄이기 위해.
- 재구성 과정에서 적응형 공간-주의 드롭아웃을 통해 시간적 대응 학습을 향상시키기 위해.
- 사전학습 비디오 데이터의 운동 다양성과 장면 다양성이 최종 추적 및 세분화 작업 성능에 미치는 영향을 조사하기 위해.
- 아키텍처 수정 없이도 기존 ViT 기반 추적기의 성능을 향상시킬 수 있는 플러그 앤 플레이형 사전학습 모델을 개발하기 위해.
제안 방법
- 재구성 과정에서 공간적 상호적응을 방해하기 위해 적응형 공간-주의 드롭아웃(ASAD)을 적용하는 DropMAE라는 마스킹 오토에인코드어를 제안한다.
- ASAD는 동일 프레임 내에서 공간적으로 가까운 패치 간의 주의 가중치를 선택적으로 드롭아웃하여, 외부 프레임 간 시간적 신호에 의존하도록 유도한다.
- 이중 단계 사전학습 파이프라인을 사용한다: 먼저 ImageNet 기반 MAE로 초기화하고, 이후 K400에서 시간적 대응 학습을 위한 미세조정을 수행한다.
- 표준 비전 트랜스포머(ViT) 인코더 및 디코더를 사용하며, 사전학습 중에는 드롭아웃을 디코더의 멀티헤드 어텐션 레이어에만 적용한다.
- 예측된 마스킹 패치와 진짜 값 간의 픽셀 단위 L2 손실을 최소화하는 재구성 목표를 채택한다.
- 랜덤 드롭아웃의 영향을 분석하기 위해 RandDrop-MAE라는 변형을 도입하여, 적응형 주의 드롭아웃에 비해 열 劣한 성능을 보임을 확인한다.
실험 결과
연구 질문
- RQ1마스킹 오토에인코드어에서 적응형 공간-주의 드롭아웃이 비디오 매칭 작업을 위한 시간적 대응 학습을 향상시키는가?
- RQ2재구성 과정에서 공간적 신호에 대한 의존도를 줄이면 VOT 및 VOS 벤치마크 성능이 향상되는가?
- RQ3사전학습 비디오 데이터의 운동 다양성과 장면 다양성 중 어느 것이 최종 추적 및 세분화 성능에 더 큰 영향을 미치는가?
- RQ4DropMAE는 아키텍처 수정 없이도 기존 ViT 기반 추적기의 백본으로 플러그 앤 플레이로 사용될 수 있는가?
- RQ5DropMAE의 성능 향상 요인이 더 나은 시간 모델링인지, 향상된 특징 일반화인지에 대한가?
주요 결과
- DropMAE는 GOT-10k에서 75.9% AO, DAVIS-17에서 92.1% J&F를 기록하며 9개의 비디오 추적 및 세분화 벤치마크 중 8개에서 최신 기술 성능을 달성한다.
- DropMAE 사전학습은 ImageNet 기반 MAE보다 2배 빠르며, 매칭 기반 작업에서 더 나은 미세조정 성능을 기록한다.
- VOT 및 VOS 성능 향상에 있어 사전학습 비디오의 운동 다양성이 장면 다양성보다 더 중요하다.
- ImageNet 기반 MAE를 초기화로 사용할 경우 DropMAE 성능 향상이 나타나, 다양한 객체 클래스의 이점이 있음을 시사한다.
- DropSeg는 DropMAE를 사용하는 추적기로, 온라인 메모리 메커니즘 없이도 DAVIS-17 및 YouTube-VOS에서 경쟁적인 성능을 기록하며, 이러한 구성 요소가 있는 방법들을 능가한다.
- A/B 테스트 결과, 랜덤 드롭아웃(RandDrop-MAE)이 ASAD에 비해 열 劣한 성능을 보여, 적응형이고 맥락 인식 가능한 주의 드롭아웃의 중요성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.