Skip to main content
QUICK REVIEW

[논문 리뷰] FuseFormer: Fusing Fine-Grained Information in Transformers for Video Inpainting

Rui Liu, Hanming Deng|arXiv (Cornell University)|2021. 09. 07.
Generative Adversarial Networks and Image Synthesis참고 문헌 42인용 수 7
한 줄 요약

FuseFormer는 피처 매핑에서의 소프트 스플릿과 소프트 컴포지션 연산을 통해 세분화된 피처 융합을 향상시켜 하위 패치 수준의 상호작용을 가능하게 하는 비디오 인painting을 위한 새로운 트랜스포머 아키텍처를 제안한다. 이는 에지의 선명도와 시간적 일관성을 향상시키며, 피드포워드 네트워크에 통합된 융합 피드포워드 네트워크(F3N)를 통해 최소한의 계산 부담으로 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Transformer, as a strong and flexible architecture for modelling long-range relations, has been widely explored in vision tasks. However, when used in video inpainting that requires fine-grained representation, existed method still suffers from yielding blurry edges in detail due to the hard patch splitting. Here we aim to tackle this problem by proposing FuseFormer, a Transformer model designed for video inpainting via fine-grained feature fusion based on novel Soft Split and Soft Composition operations. The soft split divides feature map into many patches with given overlapping interval. On the contrary, the soft composition operates by stitching different patches into a whole feature map where pixels in overlapping regions are summed up. These two modules are first used in tokenization before Transformer layers and de-tokenization after Transformer layers, for effective mapping between tokens and features. Therefore, sub-patch level information interaction is enabled for more effective feature propagation between neighboring patches, resulting in synthesizing vivid content for hole regions in videos. Moreover, in FuseFormer, we elaborately insert the soft composition and soft split into the feed-forward network, enabling the 1D linear layers to have the capability of modelling 2D structure. And, the sub-patch level feature fusion ability is further enhanced. In both quantitative and qualitative evaluations, our proposed FuseFormer surpasses state-of-the-art methods. We also conduct detailed analysis to examine its superiority.

연구 동기 및 목표

  • 패치 기반 트랜스포머의 한계를 해결하기 위해, 하드 패치 분할이 인접부분의 흐림과 하위 패치 피처 상호작용 부족을 초래함을 해결한다.
  • 겹치는 소프트 연산을 도입하여 토큰화 및 재구성 과정에서 공간적 세부 정보를 유지함으로써 하위 패치 수준의 피처 융합을 가능하게 한다.
  • 모델 파라미터나 추론 비용을 크게 증가시키지 않으면서 트랜스포머의 피처 표현을 향상시킨다.
  • 이웃 패치 간 더 풍부한 피처 전파를 가능하게 하여 생성된 비디오 프레임의 공간적 및 시간적 일관성을 향상시킨다.
  • 기존 방법들을 능가하는 경량이면서 강력한 아키텍처를 개발하여 비디오 복원 및 객체 제거 벤치마크에서 성능을 높인다.

제안 방법

  • 특징 매핑에서 커널 크기 > 스트라이드를 사용하는 unfold 연산을 통해 겹치는 2D 패치를 생성함으로써 하위 패치 수준 표현을 가능하게 하는 소프트 스플릿(SS)을 도입한다.
  • 소프트 스플릿을 뒤집어, 토큰을 다시 2D 패치로 재구성하고 이웃 패치의 겹치는 픽셀 피처를 합산함으로써 소프트 컴포지션(SC)을 설계한다.
  • 트랜스포머의 토큰화 및 디토크나이제이션 단계에 SS와 SC를 통합하여 토큰과 세분화된 피처 간 효과적인 매핑을 가능하게 한다.
  • 표준 1D MLP를 재구성하여 토큰을 2D로 재형상하고 소프트 컴포지션을 적용한 후 재인코딩하는 방식으로, 2D 구조 모델링을 향상시키는 융합 피드포워드 네트워크(F3N)를 제안한다.
  • 학습 안정화 및 성능 향상을 위해 새로운 정규화 기법(식 8)을 적용한다.
  • 기본 모델 ViB-T를 비잔자 트랜스포머에 다중 프레임 패치 임베딩과 경량 컨볼루션 인코더/디코더를 사용하여 구축한 후, 소프트 연산을 통합하여 ViB-S를 만들고, 최종적으로 FuseFormer를 구성한다.

실험 결과

연구 질문

  • RQ1겹치는 패치 연산(소프트 스플릿 및 소프트 컴포지션)이 비디오 인painting 트랜스포머의 세분화된 피처 표현에 기여하는가?
  • RQ2소프트 연산을 통한 하위 패치 수준의 피처 융합은 생성된 비디오 프레임의 에지 선명도와 시각적 품질에 어떤 영향을 미치는가?
  • RQ3F3N 모듈이 모델 파라미터를 크게 증가시키지 않고 피처 학습을 얼마나 향상시킬 수 있는가?
  • RQ4소프트 연산을 트랜스포머 아키텍처에 통합하면 하드 패치 기반 방법에 비해 비디오 인painting 벤치마크에서 더 나은 성능을 내는가?
  • RQ5제안된 방법은 낮은 계산 부담과 추론 시간을 유지하면서도 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • FuseFormer는 YouTubeVOS에서 최신 기술 수준 방법들을 능가하여, 최고의 베이스라인 대비 PSNR에서 3.3% 향상되고 SSIM에서 0.7% 향상되었다.
  • FuseFormer는 VFID와 워핑 오차를 각각 7.4%, 7.8% 감소시켜 생성된 비디오의 현실성과 시간적 일관성 향상을 입증했다.
  • 사용자 연구 결과, 비디오 완성에서 68%, 객체 제거에서 71%의 시청자가 FuseFormer를 1위로 평가하여 그 시각적 품질 우수성을 확인했다.
  • 소프트 연산을 통합한 ViB-S 모델은 이미 STTN을 능가하여, 소프트 연산 자체가 최소한의 추가 비용으로도 성능 향상에 크게 기여함을 보여주었다.
  • F3N 모듈은 트랜스포머 블록 내 표준 MLP를 대체함으로써 성능 향상을 이끌어내어 하위 패치 피처 융합 향상의 효과성을 입증했다.
  • 정성적 결과에서는 FuseFormer가 더 선명한 에지를 생성하고, 더 일관된 콘텐츠를 프레임 간에 유지하며, 깊이 있는 레이어를 통해 거친 피처에서 세밀한 피처로 점진적으로 개선됨을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.