Skip to main content
QUICK REVIEW

[논문 리뷰] An Internal Learning Approach to Video Inpainting

Haotian Zhang, Long Mai|arXiv (Cornell University)|2019. 09. 17.
Generative Adversarial Networks and Image Synthesis참고 문헌 42인용 수 16
한 줄 요약

이 논문은 외부 학습 데이터에 의존하지 않고 단일 비디오 내부의 내재 학습을 활용하여 누락된 외관과 광학 흐름을 동시에 생성하는 새로운 비디오 인paint링 방법을 제안한다. Deep Image Prior(DIP) 프레임워크를 비디오에 확장하여 외관-흐름 동시 최적화를 통해, 장기간의 구멍 영역에 대해서도 강한 시간적 일관성과 낮은 왜곡을 달성한 상태최고 성능을 기록한다.

ABSTRACT

We propose a novel video inpainting algorithm that simultaneously hallucinates missing appearance and motion (optical flow) information, building upon the recent 'Deep Image Prior' (DIP) that exploits convolutional network architectures to enforce plausible texture in static images. In extending DIP to video we make two important contributions. First, we show that coherent video inpainting is possible without a priori training. We take a generative approach to inpainting based on internal (within-video) learning without reliance upon an external corpus of visual data to train a one-size-fits-all model for the large space of general videos. Second, we show that such a framework can jointly generate both appearance and flow, whilst exploiting these complementary modalities to ensure mutual consistency. We show that leveraging appearance statistics specific to each video achieves visually plausible results whilst handling the challenging problem of long-term consistency.

연구 동기 및 목표

  • 대규모 외부 데이터셋이나 사전 학습 모델에 의존하지 않고 비디오 인paint링 문제를 해결하는 것.
  • 특히 장거리 프레임 간에도 높은 시간적 일관성을 확보하는 것.
  • 입력 비디오 자체의 구조만을 사용하는 내재 학습이 비디오 생성에 효과적인 인덕티브 바이어스가 될 수 있는지 탐구하는 것.
  • 외관과 운동(광학 흐름)을 동시에 최적화하여 상호 일관성과 시각적 타당성을 향상시키는 것.
  • 표준 2D CNN 아키텍처가 단일 비디오에서 내재 학습을 통해 시간적 우선 사전 지식을 암묵적으로 학습할 수 있음을 보여주는 것.

제안 방법

  • 외부 사전 학습 없이, Deep Image Prior(DIP)에서 영감을 얻은 2D 인코더-디코더 CNN 아키텍처를 사용하여 입력 비디오에 직접 학습한다.
  • 단일 순전파에서 인paint된 외관과 광학 흐름 필드를 동시에 예측함으로써 엔드 투 엔드 최적화를 수행한다.
  • 외관과 운동 예측 간 상호 의존성을 활용하여 시간적 일관성을 강화하는 일관성 인식 학습 전략을 적용한다.
  • 프레임 k개의 윈도우드 입력을 사용하며, 네트워크는 누락 영역을 복구하기 위해 마스킹된 비디오를 학습한다.
  • 외관과 흐름에 대한 L1 손실 및 구조적 정밀도를 위한 인지 손실을 조합한 손실 함수를 사용하여 역전파를 통해 최적화한다.
  • 프레임 간 시각적 패턴의 내재적 반복성을 활용하여, 명시적 시간 모델링 없이도 장기간에 걸쳐 구조적 정보를 전파할 수 있다.

실험 결과

연구 질문

  • RQ1단일 비디오 내부의 내재 학습이 비디오 인paint링에서 대규모 외부 데이터셋의 필요성을 대체할 수 있는가?
  • RQ2외관과 운동(광학 흐름)을 동시에 최적화하면 비디오 인paint링에서 시간적 일관성이 어떻게 향상되는가?
  • RQ3명시적 순환 또는 3D 컨볼루션 없이 표준 2D CNN 아키텍처가 시간적 의존성을 얼마나 암묵적으로 학습할 수 있는가?
  • RQ4외관과 흐름을 동시에 최적화하면, 개별 프레임 또는 외관 전용 방법에 비해 더 나은 시각적 타당성과 낮은 왜곡을 달성하는가?
  • RQ5입력 프레임의 윈도우 길이가 인paint 결과의 일반화 능력과 재구성 품질에 어떤 영향을 미치는가?

주요 결과

  • 외부 학습 데이터 없이도 상태최고 성능의 비디오 인paint링 결과를 달성하였으며, 시간적 일관성과 시각적 품질에서 개별 프레임 DIP 및 패치 기반 기준 모델을 초월한다.
  • 외관과 광학 흐름의 동시 예측이 시간적 일관성을 크게 향상시켜 시각적 잡음과 운동 불일치를 감소시킨다.
  • 입력 윈도우 길이가 길어질수록 구멍 영역의 재구성 품질이 향상되어 장거리 시간적 일반화가 효과적임을 시사한다.
  • 더 큰 윈도우 길이에서는 비구멍 영역의 재구성 품질이 저하되며, 과적합의 결과로 볼 수 있어 구멍 메우기와 재구성 정밀도 사이의 상충 관계를 확인한다.
  • 학습된 특징은 장기간에 걸쳐 동일한 객체를 식별하는 데 뛰어난 개체 수준의 대응 관계를 보이며, VGG-pool5 특징이 일반적인 유사성만 캡처하는 데 비해 더 뛰어난 성능을 발휘한다.
  • 특히 복잡한 운동 상황에서 깊이 네트워크의 사전 지식을 활용함으로써 패치 기반 방법에서 흔히 발생하는 형태 왜곡을 효과적으로 방지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.