[논문 리뷰] Exploring Patch-wise Semantic Relation for Contrastive Learning in Image-to-Image Translation Tasks
이 논문은 이미지 간 번역을 위한 새로운 대비 학습 프레임워크를 제안하며, 패치 수준의 의미 관계를 의미 관계 일관성(SRC) 정규화를 통해 모델링하여 특징 대응을 향상시킨다. 또한 어려운 음성 샘플을 탐색하는 전략을 도입한다. 대비 학습을 분리하고 입력 및 출력 이미지 간 패치 간 의미 관계의 일관성을 강제함으로써, 단일 모odal, 다중 모adal 번역 및 GAN 압축 작업에서 최신 기술 수준(SOTA) 성능을 달성하며, FID와 mIoU가 크게 향상된다.
Recently, contrastive learning-based image translation methods have been proposed, which contrasts different spatial locations to enhance the spatial correspondence. However, the methods often ignore the diverse semantic relation within the images. To address this, here we propose a novel semantic relation consistency (SRC) regularization along with the decoupled contrastive learning, which utilize the diverse semantics by focusing on the heterogeneous semantics between the image patches of a single image. To further improve the performance, we present a hard negative mining by exploiting the semantic relation. We verified our method for three tasks: single-modal and multi-modal image translations, and GAN compression task for image translation. Experimental results confirmed the state-of-art performance of our method in all the three tasks.
연구 동기 및 목표
- 기존의 대비 학습 방법이 이미지 내 다양한 의미 관계를 忽시하는 한계를 해결하기 위해.
- 입력 및 출력 이미지 간 패치 수준의 의미 관계 일관성을 강제하여 특징 대응을 향상시키기 위해.
- 공간적으로 변화하는 의미 관계를 기반으로 한 어려운 음성 샘플 탐색 전략을 개발하여 쉬운 음성 샘플을 피하기 위해.
- 사이클 일관성 제약 조건에 의존하지 않고도 일방적인 이미지 번역 및 GAN 정제에서 최신 기술 수준의 성능을 달성하기 위해.
제안 방법
- 대비 목적과 의미 관계 정규화를 분리하는 분리된 대비 학습(DCE)을 도입한다.
- 입력 및 출력 간 이미지 패치 간 분포 유사성과 공간적 의미 구조를 유지하기 위해 의미 관계 일관성(SRC) 정규화를 제안한다.
- 학습된 패치 수준의 관계에 따라 의미적 관련성을 기반으로 음성 샘플을 선택하는 어려운 음성 샘플 탐색 전략을 구현한다.
- 훈련 안정성을 향상시키기 위해 음성 샘플의 어려움을 제어하는 커리큘럼 학습 체계를 사용한다.
- 관계 지식을 교사 모델에서 학생 모델으로 전이하기 위해 이미지 번역 및 GAN 압축에 이 방법을 적용한다.
- 특징 유사성 맵을 활용하여 번역 전후의 의미 관계 일관성을 시각화하고 검증한다.

실험 결과
연구 질문
- RQ1패치 수준의 의미 관계를 모델링하면 일방적인 이미지 간 번역에서 특징 대응을 향상시킬 수 있는가?
- RQ2이질적인 의미 관계의 일관성을 강제하면 이미지 번역 품질에 어떤 영향을 미치는가?
- RQ3의미적 관련성을 기반으로 한 어려운 음성 샘플 탐색 전략이 대비 학습에서 무작위 또는 균일한 음성 샘플 선택보다 우월한가?
- RQ4제안된 방법은 번역 품질을 유지하면서 GAN 압축을 얼마나 향상시킬 수 있는가?
- RQ5제안된 방법은 단일 모달, 다중 모달, GAN 정제 작업 전반에 걸쳐 일반화되는가?
주요 결과
- 제안된 방법은 Horse→Zebra 데이터셋에서 최신 기술 수준의 FID 점수 34.4를 달성했으며, Cityscapes 데이터셋에서는 46.4를 기록하여 기준 모델를 초월한다.
- Cityscapes 데이터셋에서 압축된 학생 모델은 교사 모델보다 높은 mIoU(35.6)를 기록하여 의미적 일관성이 향상됨을 시사한다.
- 제거 실험 결과, SRC와 어려운 음성 샘플 탐색을 추가할수록 성능 향상이 일관되게 관찰되었으며, 전체 모델이 최고의 성능을 기록했다.
- 유사성 맵의 시각화 결과, SRC는 입력과 출력 간 일관된 의미 패턴을 강제로 유지하는 반면, 어려운 음성 샘플 탐색은 의미적으로 관련된 음성 샘플에 집중함을 확인할 수 있었다.
- 모델 크기를 줄였을 때 성능 손실가 최소화되었으며, 기준 학생 모델보다 낮은 MACs와 #Params를 기록하면서도 FID는 유지 또는 향상되었다.
- 이 방법은 단일 모달 번역, 다중 모달 번역, GAN 압축 등 다양한 작업에 효과적으로 일반화되어 있으며, 강건성과 전이 가능성(transferability)을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.