Skip to main content
QUICK REVIEW

[논문 리뷰] CoCosNet v2: Full-Resolution Correspondence Learning for Image Translation

Xingran Zhou, Bo Zhang|arXiv (Cornell University)|2020. 12. 03.
Generative Adversarial Networks and Image Synthesis참고 문헌 57인용 수 5
한 줄 요약

CoCosNet v2는 이미지 번역에서 전체 해상도의 다중 도메인 대응 학습을 위한 계층적, 미분 가능한 GRU 보강 PatchMatch 프레임워크를 제안한다. 이는 끝에서 끝까지 비지도 학습을 통해 세분화된 예시 세부 정보를 활용함으로써 512×512 및 1024×1024 해상도에서 고해상도, 사진처럼 사실적인 결과를 도출한다.

ABSTRACT

We present the full-resolution correspondence learning for cross-domain images, which aids image translation. We adopt a hierarchical strategy that uses the correspondence from coarse level to guide the fine levels. At each hierarchy, the correspondence can be efficiently computed via PatchMatch that iteratively leverages the matchings from the neighborhood. Within each PatchMatch iteration, the ConvGRU module is employed to refine the current correspondence considering not only the matchings of larger context but also the historic estimates. The proposed CoCosNet v2, a GRU-assisted PatchMatch approach, is fully differentiable and highly efficient. When jointly trained with image translation, full-resolution semantic correspondence can be established in an unsupervised manner, which in turn facilitates the exemplar-based image translation. Experiments on diverse translation tasks show that CoCosNet v2 performs considerably better than state-of-the-art literature on producing high-resolution images.

연구 동기 및 목표

  • 원본 이미지와 예시 이미지 간의 전체 해상도 의미적 대응을 학습하여 고해상도 이미지 번역에서 세분화된 무늬를 유지하는 데 도전한다.
  • 딥 네트워크에서 직접 PatchMatch를 적용할 경우 효율성과 안정성에 떨어지는 문제를 해결하기 위해 계층 전략과 GRU 보조 정밀 조정을 도입한다.
  • 지식 기반 대응 및 번역 네트워크의 끝에서 끝까지 비지도 학습을 가능하게 하여, 지도 학습이 필요한 진짜 대응 관계 없이도 원시 이미지 쌍으로부터 학습할 수 있도록 한다.
  • 대응 추정 과정에서 더 큰 맥락을 통해 기울기 흐름을 가능하게 하여 특징 학습을 향상시키고, 초기 학습 동역학의 혼란을 줄인다.

제안 방법

  • 원칙적으로 더粗한 수준(예: 64×64)에서 대응을 초기화하고, 점차 더 세밀한 해상도(128×128, 256×256, 512×512)에서 정밀 조정을 수행하는 계층 전략을 사용하며, 더粗한 매칭 결과를 더 세밀한 탐색에 안내한다.
  • 이웃 패치와 이전 추정치에서 정보를 집계함으로써 반복 과정 내에서 대응을 정밀 조정하는 GRU 보강 PatchMatch 모듈을 도입하여 맥락 인식 능력과 수렴 성능을 향상시킨다.
  • K=16개의 가장 가까운 이웃에 대해 평균을 취하는 소프트 매칭 방식을 사용하여 미분 가능성을 확보하고, 대응 모듈을 통해 역전파를 가능하게 한다.
  • 기하학적 데이터 증강(뒤집기, 무작위 자르기, 조각별 애핀 변환)을 적용하여 가짜 예시 이미지를 생성함으로써 비지도 학습 중 일반화 능력을 향상시킨다.
  • 학습된 대응을 번역 네트워크에 통합하여 다중 해상도에서 예시 특징을 왜곡하고, 이를 연결 및 적응형 정규화를 통해 스타일 전이를 조절한다.
  • 대응 및 이미지 번역 네트워크를 함께 최적화하는 방식으로, 적대적 손실과 사이클 일致성 손실을 사용하여 전체 시스템을 끝에서 끝까지 비지도 학습한다.

실험 결과

연구 질문

  • RQ1고해상도 이미지 번역을 위해 전체 해상도의 다중 도메인 대응을 끝에서 끝까지, 미분 가능하고 효율적인 방식으로 학습할 수 있는가?
  • RQ2딥 네트워크에서 기존 PatchMatch와 비교해 계층적이고 GRU 보강된 PatchMatch 전략이 대응 품질 향상과 학습 안정성 향상에 얼마나 기여하는가?
  • RQ3전체 해상도 대응 학습이 512×512 및 1024×1024 해상도에서 예시 기반 이미지 번역의 무늬 정확도와 시각적 현실감을 얼마나 향상시키는가?
  • RQ4지식 기반 대응 학습을 통해 미분 가능한 PatchMatch가 진짜 대응 관계 없이도 특징 조정을 효과적으로 이끌 수 있는가?
  • RQ5GRU로 정밀 조정된 대응과 함께 다중 해상도 왜곡 예시 특징을 통합할 경우 스타일 전이 성능이 향상되고 국소 세부 사항이 어떻게 유지되는가?

주요 결과

  • CoCosNet v2는 예시 기반 이미지 번역 분야에서 최신 기술 수준의 성능을 달성하여 512×512 및 1024×1024 해상도에서 사진처럼 사실적인 결과를 생성한다.
  • 기존 방법과 비교해 눈에 띄게 더 세밀한 무늬를 구현한 시각적으로 뛰어난 출력 결과를 생성한다. 이는 전체 해상도 대응 덕분에 예시에서 국소 세부 사항을 정확히 전달할 수 있기 때문이다.
  • 계층적 GRU 보강 PatchMatch 접근 방식은 국소 이웃 및 이전 대응 추정치를 모두 활용함으로써 학습의 불안정성을 줄이고 수렴 성능를 향상시킨다.
  • 이 방법은 완전히 미분 가능하고 비지도 학습이 가능하므로, 진짜 대응 관계가 필요 없이 대응 및 번역 네트워크를 함께 최적화할 수 있다.
  • 1장의 512×512 이미지에 대해 추론 시간이 약 0.6초로, 높은 해상도임에도 불구하고 실용적인 효율성을 보여준다.
  • 정량적 평가와 정성적 평가 모두에서 기존 최신 기술 수준의 방법들을 능가하며, 특히 세분화된 무늬와 구조적 세부 사항을 유지하는 데서 뛰어난 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.