Skip to main content
QUICK REVIEW

[논문 리뷰] Mocycle-GAN: Unpaired Video-to-Video Translation

Chen Yang, Yingwei Pan|arXiv (Cornell University)|2019. 08. 26.
Generative Adversarial Networks and Image Synthesis참고 문헌 37인용 수 8
한 줄 요약

Mocycle-GAN은 순환 GAN 아키텍처에 운동 추정을 통합하여 외관 일致성과 시간적 일관성을 강제하는 새로운 비쌍체 비디오 간 번역 프레임워크를 제안한다. 적대적 손실, 프레임 및 운동 순환 일관성, 운동 번역 제약 조건을 도입함으로써, 쌍체 훈련 데이터가 없는 환경 조건 전이 및 꽃에서 꽃으로의 번역과 같은 작업에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Unsupervised image-to-image translation is the task of translating an image from one domain to another in the absence of any paired training examples and tends to be more applicable to practical applications. Nevertheless, the extension of such synthesis from image-to-image to video-to-video is not trivial especially when capturing spatio-temporal structures in videos. The difficulty originates from the aspect that not only the visual appearance in each frame but also motion between consecutive frames should be realistic and consistent across transformation. This motivates us to explore both appearance structure and temporal continuity in video synthesis. In this paper, we present a new Motion-guided Cycle GAN, dubbed as Mocycle-GAN, that novelly integrates motion estimation into unpaired video translator. Technically, Mocycle-GAN capitalizes on three types of constrains: adversarial constraint discriminating between synthetic and real frame, cycle consistency encouraging an inverse translation on both frame and motion, and motion translation validating the transfer of motion between consecutive frames. Extensive experiments are conducted on video-to-labels and labels-to-video translation, and superior results are reported when comparing to state-of-the-art methods. More remarkably, we qualitatively demonstrate our Mocycle-GAN for both flower-to-flower and ambient condition transfer.

연구 동기 및 목표

  • 쌍체 훈련 데이터가 없는 비쌍체 비디오 간 번역 문제를 해결한다.
  • 비디오에 프레임 단위의 이미지 번역을 적용할 때 흔히 발생하는 시간적 불일치와 깜빡임 아티팩트를 해결한다.
  • 도메인 간 외관 구조와 운동 역학을 함께 모델링하여 비디오 합성 성능을 향상시킨다.
  • 시간적 일관성과 현실감을 향상시키기 위해 운동 유도 제약 조건을 도입한다.
  • 쌍체 예제 없이도 다양한 비디오 번역 작업, 예를 들어 환경 조건 전이 및 꽃 간 번역을 가능하게 한다.

제안 방법

  • 연속 프레임 간 시간 역학을 모델링하기 위해 광학 흐름을 통한 운동 추정을 통합한다.
  • 생성된 프레임의 외관이 원본 도메인과 목표 도메인 모두에서 현실적으로 보이도록 적대적 손실을 적용한다.
  • 프레임 수준과 운동 수준의 순환 일관성을 강제한다: 도메인 X에서 Y로 비디오를 번역하고 다시 되돌리면 원본을 재구성해야 한다.
  • 원본 도메인의 운동 패턴(광학 흐름)을 목표 도메인으로 전달하는 운동 번역 네트워크를 도입한다.
  • 외관과 운동 재구성 모두를 도메인 간에 공동으로 제약하는 이중 순환 일관성 손실을 사용한다.
  • 잔차 U-Net 생성자와 GAN 기반 적대적 훈련을 사용하여 모든 제약 조건을 종단 간 훈련 체계로 통합한다.

실험 결과

연구 질문

  • RQ1비쌍체 비디오 간 번역에서, 비디오 프레임 단위의 이미지 번역에 비해 운동 추정이 시간적 일관성 향상에 기여하는가?
  • RQ2쌍체 데이터 없이도 운동 순환 일관성은 비디오 번역 중 운동 역학을 유지하는 데 얼마나 효과적인가?
  • RQ3도메인 간 명시적 운동 번역이 생성된 비디오의 현실감과 일관성 향상에 기여하는가?
  • RQ4Mocycle-GAN은 환경 조건 전이 및 꽃 간 번역과 같은 다양한 비디오 번역 작업에 일반화 가능한가?
  • RQ5Mocycle-GAN은 Cycle-GAN 및 Recycle-GAN과 같은 최신 기술 수준의 기준 모델에 비해 정량적·정성적으로 어떻게 비교되는가?

주요 결과

  • Mocycle-GAN은 비디오-라벨 및 라벨-비디오 번역에서 뛰어난 성능을 보이며, 정량적·정성적 평가에서 기존 최신 기술 수준의 방법들을 능가한다.
  • 사람 평가 결과, Mocycle-GAN은 꽃 간 번역에서 77.5%의 선호도 점수, 환경 조건 전이에서 82.5%의 점수를 기록하여 Cycle-GAN 및 Recycle-GAN을 크게 앞서며 뚜렷한 우위를 보였다.
  • 운동 번역기 네트워크는 원본 도메인에서 목표 도메인으로 광학 흐름을 성공적으로 전달했으며, 목표 비디오의 진짜 값과 매우 유사한 생성된 흐름을 생성했다.
  • 정성적 결과에서는 깜빡임이 없고 시간적으로 안정된 비디오가 생성되었으며, 특히 일광에서 야간으로의 전환 및 꽃 피는 순서 번역에서 뚜렷하게 드러났다.
  • 제거 실험 결과, 높은 품질의 비디오 합성을 위해 운동 순환 일관성과 운동 번역 모두가 필수적임을 확인했다.
  • Viper 데이터셋에서 Mocycle-GAN은 기존 기준 모델 대비 더 밝고 더 자연스러운 주간 비디오를 생성했으며, 기준 모델은 더 흐리고 현실감이 떨어지는 출력을 내놓았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.