Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Flow-Guided Video Inpainting

Rui Xu, Xiaoxiao Li|arXiv (Cornell University)|2019. 05. 08.
Generative Adversarial Networks and Image Synthesis참고 문헌 26인용 수 4
한 줄 요약

이 논문은 완성된 광학 흐름 필드에 의해 안내되는 픽셀 전파 문제로 비디오 인painting을 다루는 딥 플로우 가이드드 비디오 인painting 방법을 제안한다. 경량에서 정밀으로 향하는 새로운 딥 플로우 완성 네트워크와 하드 예외 마이닝을 사용함으로써, DAVIS 및 YouTube-VOS 벤치마크에서 인painting 품질과 속도 면에서 최신 기술 수준을 크게 초월하는 성능을 달성한다. 최적화 기반 및 직접적인 딥 러닝 접근 방식보다 뛰어나다.

ABSTRACT

Video inpainting, which aims at filling in missing regions of a video, remains challenging due to the difficulty of preserving the precise spatial and temporal coherence of video contents. In this work we propose a novel flow-guided video inpainting approach. Rather than filling in the RGB pixels of each frame directly, we consider video inpainting as a pixel propagation problem. We first synthesize a spatially and temporally coherent optical flow field across video frames using a newly designed Deep Flow Completion network. Then the synthesized flow field is used to guide the propagation of pixels to fill up the missing regions in the video. Specifically, the Deep Flow Completion network follows a coarse-to-fine refinement to complete the flow fields, while their quality is further improved by hard flow example mining. Following the guide of the completed flow, the missing video regions can be filled up precisely. Our method is evaluated on DAVIS and YouTube-VOS datasets qualitatively and quantitatively, achieving the state-of-the-art performance in terms of inpainting quality and speed.

연구 동기 및 목표

  • 복잡한 운동과 임의의 누락 영역이 존재하는 상황에서 공간적 및 시간적 일관성을 유지하는 비디오 인painting 문제를 해결하기 위해.
  • 복잡한 운동에서 어려움을 겪고 고비용을 유발하는 패치 기반 최적화 방법의 한계를 극복하기 위해.
  • 직접적인 픽셀 인painting에서 플로우 가이드드 픽셀 전파로의 전환을 통해 계산 부담과 시간적 아티팩트를 줄이기 위해.
  • 코arse-to-fine 정렬과 하드 예외 마이닝을 통해 누락 영역 내 플로우 완성 품질을 향상시키기 위해.
  • 운동이나 누락 영역의 형태에 대한 가정 없이 실시간 성능를 달성하기 위해.

제안 방법

  • 시간에 따라 흐름 필드를 점진적으로 정밀화하기 위해 코어스-투-파인 스택드 아키텍처를 갖춘 딥 플로우 완성 네트워크(DFC-Net)를 설계하였다.
  • 시간적 일관성을 향상시키기 위해 연속 프레임의 배치를 처리하여 인접 프레임 간의 시간 연속성을 활용하였다.
  • 모든 단계에서 다중 척도 입력 처리를 사용하여 훈련 안정성과 흐름 정확도를 향상시켰으며, 특히 복잡한 영역에서 유리하다.
  • 운동 경계 및 동적인 영역과 같은 어려운 영역에 집중하기 위해 하드 플로우 예외 마이닝을 적용하여 완성 품질을 향상시켰다.
  • 플로우 완성 후, 추정된 플로우를 사용해 양방향으로 픽셀 전파를 수행하여 누락 영역을 채운 후 잔여 영역에 대해 이미지 인painting을 적용하였다.
  • 문제를 분리함: 먼저 플로우 완성을 우선시하고, 이어 플로우 가이드드 픽셀 전파 및 최종 이미지 인painting을 통한 정밀 조정을 수행하였다.

실험 결과

연구 질문

  • RQ1직접적인 픽셀 기반 비디오 인painting에 비해 광학 흐름 완성이 더 효율적이고 정확한 대안이 될 수 있는가?
  • RQ2어떤 형태의 누락 영역이 존재하더라도 시간적 일관성을 유지하면서 광학 흐름을 완성할 수 있는 딥 네트워크는 어떻게 설계할 수 있는가?
  • RQ3코어스-투-파인, 다중 척도, 하드 예외 마이닝 등의 아키텍처 구성 요소 중에서 플로우 완성 품질 향상에 가장 효과적인 것은 무엇인가?
  • RQ4플로우 가이드드 픽셀 전파가 잔여 인painting 부담을 얼마나 줄이고 시각적 품질을 향상시키는가?
  • RQ5실세계 비디오 데이터셋에서 최적화 기반 및 엔드 투 엔드 딥 러닝 방법과 비교해 본 결과, 제안된 방법의 속도와 성능는 어떠한가?

주요 결과

  • DAVIS 데이터셋에서 제안된 방법은 PSNR 28.26, SSIM 0.48을 기록하여 Huang 등(PSNR 27.73, SSIM 0.45)이 사용한 FlowNet2보다 뛰어난 성능을 보였다.
  • 절단 실험 결과, 플로우 가이드드 픽셀 전파로 인해 PSNR는 19.43에서 27.50으로, SSIM은 0.24에서 0.41로 향상되어 성능 향상에 핵심적인 역할을 함을 입증하였다.
  • 다중 척도 입력을 사용한 스택드 DFC-Net은 종단 오차(EPE) 0.93을 기록하여 단일 단계 DFC-Single(EPE 0.97) 및 다중 척도 미적용 버전(EPE 0.95)을 능가하였다.
  • 하드 예외 마이닝은 동적인 영역 및 경계 영역에서 플로우 품질 향상에 기여하여 종합적인 인painting 결과 향상에 기여하였다.
  • 최적화 기반 방법보다 훨씬 빠른 속도를 기록하여 90프레임 비디오를 수분 내로 처리하였다.
  • 실패 사례는 주로 물체 경계에서의 정확한 플로우 추정 실패로 인한 것으로, 향후 연구에서는 더 견고한 플로우 추정이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.