Skip to main content
QUICK REVIEW

[논문 리뷰] MorphMLP: An Efficient MLP-Like Backbone for Spatial-Temporal Representation Learning

David Junhao Zhang, Kunchang Li|arXiv (Cornell University)|2021. 11. 24.
Human Pose and Action Recognition인용 수 5
한 줄 요약

MorphMLP는 자기주의 주의를 포함하지 않는, MLP 유사 백본을 제안하며 비디오 표현 학습에 사용한다. 이는 두 가지 특수화된 완전 연결 층—진행적 공간 모델링을 위한 MorphFC_s와 시간적 의존성 학습을 위한 MorphFC_t—를 사용하여, 유사한 FLOP 예산 내에서 최신 기술 수준의 정확도를 달성하면서도 계산량을 크게 줄였다. 이는 VideoSwin 및 MViT와 같은 모델들을 능가한다.

ABSTRACT

Recently, MLP-Like networks have been revived for image recognition. However, whether it is possible to build a generic MLP-Like architecture on video domain has not been explored, due to complex spatial-temporal modeling with large computation burden. To fill this gap, we present an efficient self-attention free backbone, namely MorphMLP, which flexibly leverages the concise Fully-Connected (FC) layer for video representation learning. Specifically, a MorphMLP block consists of two key layers in sequence, i.e., MorphFC_s and MorphFC_t, for spatial and temporal modeling respectively. MorphFC_s can effectively capture core semantics in each frame, by progressive token interaction along both height and width dimensions. Alternatively, MorphFC_t can adaptively learn long-term dependency over frames, by temporal token aggregation on each spatial location. With such multi-dimension and multi-scale factorization, our MorphMLP block can achieve a great accuracy-computation balance. Finally, we evaluate our MorphMLP on a number of popular video benchmarks. Compared with the recent state-of-the-art models, MorphMLP significantly reduces computation but with better accuracy, e.g., MorphMLP-S only uses 50% GFLOPs of VideoSwin-T but achieves 0.9% top-1 improvement on Kinetics400, under ImageNet1K pretraining. MorphMLP-B only uses 43% GFLOPs of MViT-B but achieves 2.4% top-1 improvement on SSV2, even though MorphMLP-B is pretrained on ImageNet1K while MViT-B is pretrained on Kinetics400. Moreover, our method adapted to the image domain outperforms previous SOTA MLP-Like architectures. Code is available at https://github.com/MTLab/MorphMLP.

연구 동기 및 목표

  • 자기주의 주의를 포함하지 않는 MLP 유사 아키텍처가 비디오 표현 학습에 효과적으로 확장될 수 있는지 탐색하기 위해.
  • 자기주의 주의 메커니즘에 의존하지 않고 계층적 공간 의미를 효과적으로 포착하는 방법을 해결하기 위해.
  • 최소한의 계산 비용으로 장거리 시간적 의존성을 효과적으로 포착할 수 있는 효율적인 시간 모델링 메커니즘을 설계하기 위해.
  • 기존의 비전 트랜스포머와 CNN에 비해 비디오 분류에서 더 나은 정확도-계산 비용 트레이드오프를 달성하기 위해.
  • 제안된 아키텍처가 시간 차원을 제거했을 때 이미지 인식 및 세그멘테이션 작업으로 일반화되는지 검증하기 위해.

제안 방법

  • MorphMLP는 두 가지 순차적 구성 요소로 이루어진 새로운 블록 아키텍처를 사용한다: 공간 모델링을 위한 MorphFC_s와 시간 모델링을 위한 MorphFC_t.
  • MorphFC_s는 계층적 토큰 상호작용을 통해 높이 및 너비 차원에 따라 수렴 영역을 점진적으로 확장함으로써 다중 척도 공간 특징 학습을 가능하게 한다.
  • MorphFC_t는 각 공간 위치에서 모든 프레임의 특징을 시간 청크로 집계한 후, 완전 연결 층을 통해 장거리 시간적 의존성을 모델링한다.
  • 공간 및 시간 모듈는 순차적으로 스택하여 깊은 MorphMLP 백본을 구축하며, 공간 모듈 이후에 스킵 잔차 연결을 적용하여 학습 안정성을 향상시킨다.
  • 자기주의 주의를 대체하기 위해 요소화된, 점진적이고 적응적인 완전 연결 연산을 사용함으로써 FLOPs를 감소시키면서도 표현 능력을 유지한다.
  • 시간 차원을 제거하여 이미지 작업에 적응시켰으며, ImageNet-1K 및 ADE20K에서 뛰어난 성능을 보였다.

실험 결과

연구 질문

  • RQ1자기주의 주의를 포함하지 않는, MLP 유사 아키텍처가 비디오 데이터의 공간-시간 표현을 효과적으로 학습할 수 있는가?
  • RQ2공간 모델링에서 계층적이고 점진적인 토큰 상호작용은 전역 MLP나 컨볼루션 연산에 비해 특징 학습을 어떻게 향상시킬 수 있는가?
  • RQ3완전 연결 층은 더 낮은 계산 비용으로도 비디오에서 장거리 시간적 의존성을 효과적으로 대체할 수 있는가?
  • RQ4정확도와 효율성의 균형을 고려할 때 최적의 아키텍처 구성(예: 연산 순서, 잔차 연결)은 무엇인가?
  • RQ5시간 차원을 제거했을 때 제안된 MorphMLP 아키텍처가 이미지 인식 및 세그멘테이션 작업으로 일반화되는가?

주요 결과

  • MorphMLP-S는 ImageNet1K 사전학습 조건에서 Kinetics400에서 VideoSwin-T보다 0.9% 높은 상위 1위 정확도를 기록했으며, GFLOPs는 그의 50%에 불과했다.
  • MorphMLP-B는 SSV2에서 MViT-B보다 2.4% 높은 상위 1위 정확도를 기록했으며, GFLOPs는 43%에 불과했고, Kinetics400가 아닌 ImageNet1K에서 사전학습되었다.
  • MorphFC_s는 ImageNet-1K에서 표준 3×3 및 7×7 컨볼루션보다 2.3–2.4% 높은 상위 1위 정확도를 기록하여 장거리 공간적 맥락을 포착하는 데서의 우수성을 입증했다.
  • MorphFC_t는 SSV1에서 3×1×1 및 5×1×1 시간 컨볼루션보다 뛰어나 50.6%의 상위 1위 정확도를 기록했으며, 각각 47.9% 및 48.6%를 기록했다.
  • 스킵 잔차 연결이 있는 MorphFC_s 이후에 MorphFC_t를 순차적으로 적용할 경우 가장 뛰어난 성능을 기록했으며, 병렬 또는 다른 순서 구성보다 뛰어났다.
  • 전체 MorphMLP 모델은 SlowFast 및 Timesformer와 같은 최신 기술 모델들보다 더 빠른 학습 속도를 기록했으며, GPU 시간 기준으로 유사하거나 더 높은 정확도와 더 낮은 학습 비용을 제공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.