[논문 리뷰] Dual Contrastive Learning for Unsupervised Image-to-Image Translation
이 논문은 소스 도메인과 타겟 도메인에 대해 별도의 인코더와 프로젝션 헤드를 사용하여 특징 정렬과 안정성을 향상시키는 비지도 이미지 간 번역을 위한 이중 대비 학습 프레임워크인 DCLGAN을 제안한다. 사이클 일致성 제약 조건을 피하면서 피처 수준의 특징 간 상호정보를 최대화함으로써, DCLGAN은 최신 기술 수준의 성능을 달성하고 특히 사진에서 레이블로의 번역과 같은 작업에서 모드 붕괴를 크게 줄이며, Cityscapes와 같은 벤치마크에서 지도 학습 방법과의 격차를 좁힌다.
Unsupervised image-to-image translation tasks aim to find a mapping between a source domain X and a target domain Y from unpaired training data. Contrastive learning for Unpaired image-to-image Translation (CUT) yields state-of-the-art results in modeling unsupervised image-to-image translation by maximizing mutual information between input and output patches using only one encoder for both domains. In this paper, we propose a novel method based on contrastive learning and a dual learning setting (exploiting two encoders) to infer an efficient mapping between unpaired data. Additionally, while CUT suffers from mode collapse, a variant of our method efficiently addresses this issue. We further demonstrate the advantage of our approach through extensive ablation studies demonstrating superior performance comparing to recent approaches in multiple challenging image translation tasks. Lastly, we demonstrate that the gap between unsupervised methods and supervised methods can be efficiently closed.
연구 동기 및 목표
- 기존의 비지도 이미지 간 번역 방법의 한계, 특히 모드 붕괴와 기하학적 인식 번역에서의 불안정성 문제를 해결하기 위해.
- 원천 도메인과 타겟 도메인에 대해 별도의 인코더와 프로젝션 헤드를 사용하여 쌍방향 이미지 번역에서 대비 학습을 향상시키기 위해.
- 기하학적 자유도를 제한하고 일부 구조 무관 작업에서 성능을 떨어뜨릴 수 있는 사이클 일치 손실에 의존하지 않기 위해.
- 사진에서 레이블로의 번역과 같은 다중 모달 번역 작업에서 모드 붕괴를 효과적으로 완화하는 변형인 SimDCL을 개발하기 위해.
- 개선된 대비 표현 학습을 통해 비지도 및 지도 학습 이미지 번역 방법 간의 성능 격차를 좁히기 위해.
제안 방법
- DCLGAN은 원천 도메인과 타겟 도메인에 대해 각각 별도의 인코더와 프로젝션 헤드를 사용하여 도메인 특화 임베딩을 학습하고 특징 정렬을 향상시킨다.
- 메서드는 원천 이미지와 출력 이미지의 대응 피처 간 상호정보를 최대화하기 위해 피처 수준의 다층 PatchNCE 손실을 피처 블록 기반으로 사용하며, 각 도메인에 대해 별도의 프로젝션을 적용한다.
- 이중 학습 설정을 활용하여 양 도메인을 동시에 처리함으로써 학습 안정성을 향상시키고 도메인 간 더 나은 특징 학습을 가능하게 한다.
- RGB 픽셀 특징은 PatchNCE 손실에서 제거되며, 이는 가장 작은 피처 크기이자 오해를 유도하는 신호를 유발하기 때문이다. 이로 인해 수렴 성능이 향상된다.
- 외부 음성 예시는 동일 도메인의 특징 스택을 연결하여 탐색하지만, 이는 특징 융합로 인해 시각적 품질이 약간 떨어지는 경향이 있다.
- 모드 붕괴를 완화하기 위해 대비 목표를 수정하여 다양성이 증가하는 생성 출력을 유도하는 변형인 SimDCL이 도입된다.
실험 결과
연구 질문
- RQ1원천 도메인과 타겟 도메인에 대해 별도의 인코더를 사용하는 이중 대비 학습 프레임워크가 CUT와 같은 단일 인코더 방법보다 비일치 이미지 간 번역에서 더 우수한 성능을 낼 수 있는가?
- RQ2사이클 일치 손실을 제거하면 고도로 기하학적 변화가 필요한 작업, 예를 들어 고양이→개 또는 개→고양이 번역에서 성능 향상이 이루어지는가?
- RQ3원천 도메인과 타겟 도메인에 대해 별도의 임베딩을 사용하면 사진에서 레이블로의 번역과 같은 다중 모달 번역 작업에서 모드 붕괴를 완화할 수 있는가?
- RQ4PatchNCE 손실에서 RGB 픽셀을 제거하면 대비 학습의 수렴과 성능에 어떤 영향을 미치는가?
- RQ5대비 학습이 비지도 및 지도 학습 이미지 번역 방법 간의 성능 격차를 어느 정도 좁힐 수 있는가?
주요 결과
- DCLGAN은 Horse→Zebra, Zebra→Horse, Cityscapes를 포함한 여러 이미지 번역 벤치마크에서 최신 기술 수준의 성능을 달성하며, CUT와 CycleGAN을 능가한다.
- PatchNCE 손실에서 RGB 픽셀을 제거하면 수렴과 성능이 향상되며, CUT와 같이 이를 포함할 경우 모든 작업에서 성능 저하가 발생한다.
- 단일 인코더와 공유된 프로젝션 헤드를 사용하는 것(CUT 방식)은 성능이 열 劣하므로 별도의 임베딩이 도메인 특화 변동성을 포착하는 데 필수적임을 확인한다.
- DCLGAN에 사이클 일치 손실을 추가하면 성능이 떨어지며, 특히 기하학적으로 민감한 작업에서 심각한 영향을 미친다. Cat→Dog와 Dog→Cat의 경우 FID 점수는 각각 71.1과 35.5로 DCLGAN 원본 결과보다 열 劣하다.
- 이중 학습 설정은 학습을 크게 안정화시키고 특징 학습을 향상시키며, 이를 제거하면 성능이 열 劣해진다.
- SimDCL은 모드 붕괴를 효과적으로 완화하여 사진에서 레이블로의 번역에서 다양한 입력에 대해 다양하고 현실적인 출력을 생성한다. 이는 CUT와 DCLGAN가 거의 동일한 출력을 생성하는 것과 대조된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.