Skip to main content
QUICK REVIEW

[논문 리뷰] Free-form Video Inpainting with 3D Gated Convolution and Temporal PatchGAN

Ya-Liang Chang, Zhe Yu Liu|arXiv (Cornell University)|2019. 04. 23.
Generative Adversarial Networks and Image Synthesis참고 문헌 34인용 수 10
한 줄 요약

이 논문은 자유형 마스크 형태를 다룰 수 있도록 3D 게이팅 컨볼루션을 사용한 학습 기반 방법을 제안하며, 시간적 일관성을 확보하기 위해 새로운 시간적 패치GAN 손실을 도입한다. 이 방법은 FaceForensics 및 새로 확보한 FVI 데이터셋에서 최신 기술 수준의 성능을 달성하여 영상 품질과 일관성 면에서 이전 방법들을 능가한다.

ABSTRACT

Free-form video inpainting is a very challenging task that could be widely used for video editing such as text removal. Existing patch-based methods could not handle non-repetitive structures such as faces, while directly applying image-based inpainting models to videos will result in temporal inconsistency (see http://bit.ly/2Fu1n6b ). In this paper, we introduce a deep learn-ing based free-form video inpainting model, with proposed 3D gated convolutions to tackle the uncertainty of free-form masks and a novel Temporal PatchGAN loss to enhance temporal consistency. In addition, we collect videos and design a free-form mask generation algorithm to build the free-form video inpainting (FVI) dataset for training and evaluation of video inpainting models. We demonstrate the benefits of these components and experiments on both the FaceForensics and our FVI dataset suggest that our method is superior to existing ones. Related source code, full-resolution result videos and the FVI dataset could be found on Github https://github.com/amjltc295/Free-Form-Video-Inpainting .

연구 동기 및 목표

  • 자연스럽게 형성된 마스크 형태를 가진 영상의 자유형 인painting 문제를 해결하기 위해, 기존 방법들이 시간적 일관성을 유지하지 못하는 문제를 해결한다.
  • 반복적인 패턴이 아닌 얼굴과 같은 비반복적 구조를 다루는 데 어려움을 겪는 패치 기반 방법의 한계를 극복한다.
  • 영상 기반 인painting 모델을 영상으로 확장하면서 깜빡임이나 시간적 일관성 손실을 유발하지 않도록 한다.
  • 자유형 영상 인painting 모델의 훈련 및 평가를 위한 새로운 데이터셋과 마스크 생성 알고리즘을 개발한다.
  • 3D 게이팅 컨볼루션과 시간적 패치GAN이 영상 품질과 시간적 일관성 향상에 크게 기여함을 입증한다.

제안 방법

  • 자신의 마스크 영역, 비마스크 영역, 메쉬된 영역를 구분할 수 있도록 설계된 3D 게이팅 컨볼루션 레이어를 제안하여 자유형 마스크 불확실성 하에서 더 나은 특징 주의를 가능하게 한다.
  • 고주파 수준의 공간-시간 특징을 억제함으로써 생성된 영상의 시간적 일관성을 향상시키기 위해 시간적 패치GAN 판별자를 도입한다.
  • 다양한 마스크 대 프레임 비율을 가진 다양한 실제적인 마스크를 생성하기 위한 자유형 마스크 생성 알고리즘을 설계하여 데이터 증강에 활용한다.
  • YouTube-VOS에서 1,940개의 영상과 YouTube-BoundingBoxes에서 12,600개의 영상을 포함한 FVI 데이터셋을 구축하여 훈련 및 평가에 활용한다.
  • 생성자 모델의 현실성과 일관성을 향상시키기 위해 adversarial loss, perceptual loss, L1 loss를 조합하여 최적화한다.
  • 광학 흐름을 사용하지 않고 단일 단계의 순방향 아키텍처를 활용하여 빠른 추론과 엔드 투 엔드 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ13D 게이팅 컨볼루션은 자유형 마스크에 의해 유도되는 불확실성을 효과적으로 다룰 수 있는가?
  • RQ2기본 GAN에 비해 시간적 패치GAN 판별자가 영상 생성에서 시간적 일관성 향상에 뚜렷한 기여를 하는가?
  • RQ3이러한 복잡한 비반복적 구조(예: 얼굴)를 다룰 때 제안된 방법은 패치 기반 및 영상 기반 인painting 모델보다 어떻게 성능이 뛰어나게 되는가?
  • RQ4새로운 FVI 데이터셋은 자유형 영상 인painting 모델의 훈련 및 평가에 어느 정도 기여하는가?
  • RQ5제안된 아키텍처는 초해상도나 객체 제거와 같은 다른 영상 생성 작업으로 확장 가능한가?

주요 결과

  • 제안된 모델은 FaceForensics 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, Fréchet Video Distance(FVD)는 1.034, FID는 1.096를 기록하여 이전 방법들을 능가했다.
  • 객체 유사 마스크를 포함한 새로 도입된 FVI 데이터셋에서 모델은 FVD 0.1209, FID 1.034를 기록하여 강력한 일반화 능력과 높은 품질을 입증했다.
  • 절단 실험 결과, 3D 게이팅 컨볼루션과 시간적 패치GAN 손실 모두 필수적임을 확인하였으며, 둘 중 하나를 제거할 경우 성능 저하가 심각하게 발생했다.
  • 모델은 영상 초해상도에 성공적으로 확장되어 4배 증폭에서 LPIPS는 0.1631, FID는 1.096를 기록하였으며, SRResNet과 SRGAN을 능가하는 성능을 보였다.
  • 모델은 영상 객체 제거 및 보간 작업으로도 확장 가능하여 다양한 영상 생성 작업에 있어 뛰어난 강건성과 유연성을 입증했다.
  • 매우 다른 테스트 데이터나 매우 두꺼운 마스크를 다루는 데에는 한계가 있지만, 특히 시각적 일관성과 시간적 안정성 면에서 베이스라인 대비 뛰어난 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.