Skip to main content
QUICK REVIEW

[논문 리뷰] VMFormer: End-to-End Video Matting with Transformer

Jiachen Li, Vidit Goel|arXiv (Cornell University)|2022. 08. 26.
Image Enhancement Techniques인용 수 8
한 줄 요약

VMFormer는 시각 트랜스포머 기반으로, 학습 가능한 쿼리와 교차 attention을 사용하여 전역적 이미지 및 장거리 시간적 의존성을 모델링하는 엔드 투 엔드, 트림랩 없는 비디오 매트팅 방법을 제안한다. 실시간 추론 속도를 유지하면서 복합 기준에서 최고 성능을 달성하여 이전의 CNN 기반 방법들을 능가한다.

ABSTRACT

Video matting aims to predict the alpha mattes for each frame from a given input video sequence. Recent solutions to video matting have been dominated by deep convolutional neural networks (CNN) for the past few years, which have become the de-facto standard for both academia and industry. However, they have inbuilt inductive bias of locality and do not capture global characteristics of an image due to the CNN-based architectures. They also lack long-range temporal modeling considering computational costs when dealing with feature maps of multiple frames. In this paper, we propose VMFormer: a transformer-based end-to-end method for video matting. It makes predictions on alpha mattes of each frame from learnable queries given a video input sequence. Specifically, it leverages self-attention layers to build global integration of feature sequences with short-range temporal modeling on successive frames. We further apply queries to learn global representations through cross-attention in the transformer decoder with long-range temporal modeling upon all queries. In the prediction stage, both queries and corresponding feature maps are used to make the final prediction of alpha matte. Experiments show that VMFormer outperforms previous CNN-based video matting methods on the composited benchmarks. To our best knowledge, it is the first end-to-end video matting solution built upon a full vision transformer with predictions on the learnable queries. The project is open-sourced at https://chrisjuniorli.github.io/project/VMFormer/

연구 동기 및 목표

  • CNN 기반 비디오 매트팅 모델의 국한된 인덕티브 바이어스와 장거리 모델링의 열악함을 해결하기 위해.
  • 자기 및 교차 attention 메커니즘을 활용하여 전역적 특징 통합을 수행하는 엔드 투 엔드 비디오 매트팅 프레임워크를 개발하기 위해.
  • 과도한 계산 비용 없이 쿼리 기반 시간 모델링을 통해 강력한 장거리 시간적 의존성 모델링을 가능하게 하기 위해.
  • 어려운 비디오 매트팅 기준에서 높은 정확도를 유지하면서도 실시간 추론을 달성하기 위해.
  • 비용이 많이 드는 트림랩 애너테이션의 필요성을 제거하기 위해 트림랩 없는 엔드 투 엔드 솔루션을 설계하기 위해.

제안 방법

  • VMFormer는 이중 브랜치 아키텍처를 사용한다: CNN 백본과 트랜스포머 인코더를 갖춘 특징 모델링 브랜치, 그리고 트랜스포머 디코더를 갖춘 쿼리 모델링 브랜치로 구성되며, 각 프레임의 알파 매트를 예측한다.
  • 인코더 내 자기 attention은 각 프레임의 공간 차원을 통해 전역적 특징 통합을 가능하게 한다.
  • 디코더 내 교차 attention은 학습 가능한 쿼리와 전역적 특징 시퀀스를 연결하여 프레임 기반 예측을 생성한다.
  • 단기적 특징 기반 시간 모델링(SFTM)은 연속된 특징 맵의 순환 집합을 사용하여 국소적 시간 일관성을 향상시킨다.
  • 장거리 쿼리 기반 시간 모델링(LQTM)은 쿼리 간의 attention 가중치를 학습하여 효율적으로 장거리 시간 의존성을 모델링한다.
  • 최종 알파 매트 예측은 각 프레임의 쿼리와 해당 특징 맵 간의 행렬 곱셈을 통해 생성된다.

실험 결과

연구 질문

  • RQ1비디오 매트팅에서 전역적 공간적 의존성과 장거리 시간적 의존성을 포괄하는 뷰어 트랜스포머 기반 아키텍처가 CNN 기반 모델을 능가할 수 있는가?
  • RQ2트림랩 감독 없이도 학습 가능한 쿼리와 교차 attention을 효과적으로 활용하여 정확한 알파 매트를 생성할 수 있는가?
  • RQ3전체 특징 맵이 아닌 쿼리 수준에서 시간 모델링을 효율적으로 구현할 수 있는가? 이는 계산 비용을 감소시킬 수 있는가?
  • RQ4제안된 LQTM 모듈이 특징 기반 또는 후처리 시간 모델링 방법보다 더 나은 장거리 시간 일관성을 제공하는가?
  • RQ5순수 트랜스포머 기반 비디오 매트팅 모델이 실시간 추론을 달성하면서도 최고의 정확도를 유지할 수 있는가?

주요 결과

  • VMFormer는 VideoMatte240K, BG20K, DVM의 복합 테스트 세트에서 512×288 해상도에서 4.91 MAD, 0.55 MSE, 0.40 Grad, 0.25 Conn으로 최고 성능을 기록했다.
  • 고해상도 입력(1920×1080)에서 VMFormer는 4.81 MAD, 0.78 MSE, 4.90 Grad, 3.34 Conn을 기록했으며, 모든 CNN 기반 기준 모델을 능가했다.
  • RVM 테스트 세트에서 VMFormer는 세그멘테이션 데이터를 함께 훈련한 모델들조차도 초월했으며, 추가 사전 훈련 없이도 최고 성능을 달성했다.
  • 모델은 실시간 추론 속도를 유지했으며, 512×288 해상도에서 단일 A6000 GPU에서 CNN 기반 모델과 유사한 FPS를 기록했다.
  • 시각화 결과는 VMFormer가 특히 모호하거나 색상에 의해 가림을 입은 영역에서 더 높은 품질의 특징 맵과 더 나은 전경-배경 구분을 생성함을 보여주었다.
  • 제거 실험 결과, SFTM의 순환 집합과 LQTM의 덧셈형 attention이 더 낮은 계산 비용으로 최고의 성능을 달성하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.