Skip to main content
QUICK REVIEW

[논문 리뷰] ReCoNet: Real-time Coherent Video Style Transfer Network

Chang Gao, Derun Gu|arXiv (Cornell University)|2018. 07. 03.
Generative Adversarial Networks and Image Synthesis참고 문헌 25인용 수 10
한 줄 요약

ReCoNet은 출력 수준의 시간 손실에 밝기 왜곡 제약을 도입하고 특징맵 수준의 시간 손실을 적용함으로써 높은 시간적 일관성과 지각적 스타일 품질을 달성하는 실시간, 피드포워드 비디오 스타일 전이 네트워크입니다. 이는 움직이는 물체와 조명 변화에서의 깜빡임과 색상 불일치를 크게 줄이며 단일 GPU에서 200 FPS 이상의 속도로 스타일화된 비디오 생성을 가능하게 합니다.

ABSTRACT

Image style transfer models based on convolutional neural networks usually suffer from high temporal inconsistency when applied to videos. Some video style transfer models have been proposed to improve temporal consistency, yet they fail to guarantee fast processing speed, nice perceptual style quality and high temporal consistency at the same time. In this paper, we propose a novel real-time video style transfer model, ReCoNet, which can generate temporally coherent style transfer videos while maintaining favorable perceptual styles. A novel luminance warping constraint is added to the temporal loss at the output level to capture luminance changes between consecutive frames and increase stylization stability under illumination effects. We also propose a novel feature-map-level temporal loss to further enhance temporal consistency on traceable objects. Experimental results indicate that our model exhibits outstanding performance both qualitatively and quantitatively.

연구 동기 및 목표

  • 움직이는 물체와 조명 변화에서의 높은 시간적 불일치, 특히 깜빡임과 색상 불안정성을 해결하기 위해.
  • 지각적 스타일 품질이나 시간적 일관성을 희생시키지 않고도 실시간 처리 속도(24 FPS 이상)를 달성하기 위해.
  • 프레임 간 밝기 변화를 모델링하여 동적 조명 조건에서의 스타일화 안정성을 향상시키기 위해.
  • 동일 물체의 추적 가능성을 높이기 위해 고수준 특징맵에서의 특징 변동을 제어함으로써 프레임 간 일관성을 향상시키기 위해.

제안 방법

  • 연속 프레임 간 밝기 변화를 모델링하기 위해 출력 수준의 시간 손실에 밝기 왜곡 제약을 도입하여 조명 효과에 대한 안정성을 향상시킵니다.
  • 동일 물체의 특징 변동을 제어하기 위해 고수준 특징맵 수준의 시간 손실을 적용하여 고수준 표현에서의 일관성을 향상시킵니다.
  • 콘텐츠 및 스타일 유지에 VGG 기반의 지각적 손실을 사용하는 피드포워드 인코더-디코더 아키텍처를 활용합니다.
  • 시간 손실에서 광학 흐름과 막힘 마스크를 가이던스로 사용하여 스타일화된 프레임이 입력 운동과 정렬되도록 합니다.
  • 출력 수준과 특징맵 수준의 제약를 조합한 다중 수준 시간 손실을 도입하여 시각적 일관성과 지각적 품질을 동시에 최적화합니다.
  • 최근 GPU에서 200 FPS 이상의 추론 속도를 달성할 수 있는 경량이고 종단 간(end-to-end) 네트워크를 설계합니다.

실험 결과

연구 질문

  • RQ1피드포워드 네트워크가 실시간 비디오 스타일 전이를 달성하면서도 높은 지각적 스타일 품질과 시간적 일관성을 유지할 수 있는가?
  • RQ2연속 프레임 간의 밝기 변화는 어떻게 모델링할 수 있으며, 이는 조명 변화에 대한 스타일화 안정성을 향상시키는가?
  • RQ3고수준 특징맵에서의 특징 일관성 강제 조건이 추적 가능한 물체의 시간적 불일치를 어느 정도 감소시키는가?
  • RQ4출력 수준과 특징맵 수준의 시간 손실이 전체 시간적 일관성에 기여하는 상대적 기여도는 얼마인가?

주요 결과

  • ReCoNet은 최신 단일 GPU에서 200 FPS 이상의 추론 속도를 달성하여 실시간 기준을 크게 초월합니다.
  • 출력 수준의 시간 손실에 밝기 왜곡 제약를 적용한 결과, 밝기 모델링이 없는 기준 방법 대비 평균으로 10.4%의 시간 오차 감소를 기록합니다.
  • 특징맵 수준의 시간 손실을 적용한 결과, 유일하게 출력 수준의 시간 손실을 사용하는 모델 대비 평균으로 12.5%의 시간 오차 감소를 기록합니다.
  • 출력 수준과 특징맵 수준의 시간 손실을 병합한 결과, MPI Sintel 데이터셋에서 평균 시간 오차가 0.0804로 가장 낮아졌습니다.
  • 사용자 연구 결과, 특히 조명 변화와 움직이는 물체가 있는 장면에서 ReCoNet이 이전 방법보다 더 지각적으로 안정적이고 시각적으로 일관성 있는 스타일화된 비디오를 생성하는 것으로 확인되었습니다.
  • 정성적 결과에서는 ReCoNet이 움직이는 물체의 원형 영역에서 깜빡임과 색상 불일치를 효과적으로 억제하며, Chen 등 [4]와 같은 기준 방법보다 시각적 안정성에서 뛰어난 성능을 보였습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.