[논문 리뷰] Label-Noise Robust Multi-Domain Image-to-Image Translation
이 논문은 노이즈 있는 훈련 레이블에서 청소된 레이블 조건부 생성기를 학습하는 데에 강인한 다중 도메인 이미지 간 번역 모델인 RMIT을 제안한다. 가상의 사이클 일致성 손실과 노이즈 강인 분류 손실을 도입함으로써, RMIT는 높은 노이즈(예: 50% 레이블 뒤집힘) 조건에서도 청소된 레이블 모델에 가까운 성능을 달성하며, 노이즈 있는 감독 하에서 표준 StarGAN보다 분류 정확도와 이미지 품질 측면에서 모두 뛰어난 성능을 보인다.
Multi-domain image-to-image translation is a problem where the goal is to learn mappings among multiple domains. This problem is challenging in terms of scalability because it requires the learning of numerous mappings, the number of which increases proportional to the number of domains. However, generative adversarial networks (GANs) have emerged recently as a powerful framework for this problem. In particular, label-conditional extensions (e.g., StarGAN) have become a promising solution owing to their ability to address this problem using only a single unified model. Nonetheless, a limitation is that they rely on the availability of large-scale clean-labeled data, which are often laborious or impractical to collect in a real-world scenario. To overcome this limitation, we propose a novel model called the label-noise robust image-to-image translation model (RMIT) that can learn a clean label conditional generator even when noisy labeled data are only available. In particular, we propose a novel loss called the virtual cycle consistency loss that is able to regularize cyclic reconstruction independently of noisy labeled data, as well as we introduce advanced techniques to boost the performance in practice. Our experimental results demonstrate that RMIT is useful for obtaining label-noise robustness in various settings including synthetic and real-world noise.
연구 동기 및 목표
- 실제 응용에서 흔한 노이즈 있는 레이블 데이터만 이용 가능한 상황에서 다중 도메인 이미지 간 번역 모델을 훈련하는 문제에 대응한다.
- StarGAN과 같은 기존 GAN 기반 모델이 노이즈 있는 레이블로 훈련될 경우 번역 품질이 떨어지고 도메인 정렬이 잘못되는 문제를 해결한다.
- 청소된 레이블이 훈련 중에 필요 없이도 청소된 레이블 조건부 번역을 학습할 수 있는 통합 프레임워크를 개발하여 확장성과 실용성을 향상시킨다.
- 특히 사이클 일치성과 분류에 중점을 두어 노이즈에 강인한 손실 함수를 도입함으로써, 노이즈 있는 감독 하에서도 훈련을 안정화시킨다.
- 합성 및 실제 세계의 레이블 노이즈 설정에서 제안된 방법의 효과성을 입증하며, 기준 모델 대비 일관된 성능 향상을 보인다.
제안 방법
- 정답 레이블에 의존하지 않고 입력 이미지와 번역된 이미지 간의 사이클 재구성을 강제하는 가상의 사이클 일치성 손실을 제안하여 노이즈 강인 훈련을 가능하게 한다.
- 생성기 훈련 중에 잘못된 레이블의 영향을 줄이기 위해 노이즈 강인 분류 손실을 도입함으로써 도메인 특화 번역의 정밀도를 향상시킨다.
- 입력 이미지와 목표 도메인 레이블을 입력으로 받아, 노이즈 있는 감독 하에서도 청소된 레이블 조건부 번역을 생성하는 통합 생성기 네트워크를 설계한다.
- 이중 스트림 디스criminator/분류기 헤드를 활용: 하나는 진위 구분(대비 손실)을 위해, 다른 하나는 도메인 분류(분류 손실)를 위해 사용하며, 양쪽 모두 노이즈에 강인하도록 조정한다.
- 주의 맵과 색상 맵을 활용해 생성기가 관련 얼굴 영역에 집중하도록 유도함으로써, 분리성과 노이즈에 대한 강인성을 향상시킨다.
- 안정성과 성능을 위해 초모수를 조정한 대비 손실, 가상의 사이클 일치성 손실, 노이즈 강인 분류 손실의 조합을 사용해 모델을 종단 간(end-to-end)으로 훈련시킨다.
실험 결과
연구 질문
- RQ1훈련 시에만 노이즈 있는 레이블이 존재할 경우, 다중 도메인 이미지 간 번역 모델이 청소된 레이블 조건부 생성을 학습할 수 있는가?
- RQ2기존의 사이클 일치성 또는 사이클 손실 없이 비교했을 때, 제안된 가상의 사이클 일치성 손실은 노이즈 있는 조건에서 성능을 어떻게 향상시키는가?
- RQ3노이즈 강인 분류 손실은 잘못된 레이블 데이터가 도메인 특화 번역 품질에 끼치는 부정적 영향을 어느 정도 줄이는가?
- RQ4합성 및 실제 세계의 레이블 노이즈 조건에서 RMIT는 표준 StarGAN과 비교해 분류 정확도와 FID 측면에서 어떻게 성능을 내는가?
- RQ5노이즈 있는 데이터로 훈련된 모델이 도메인 간에 콘텐츠 보존성과 의미 일致성을 유지하는가? 비변환 행동을 피하는 방식은 무엇인가?
주요 결과
- 50% 대칭적 레이블 노이즈 조건에서 FER 데이터셋에서 RMIT는 분류 정확도(CA) 70.0%를 달성하며, 동일 조건에서 StarGAN의 65.5%보다 뚜렷이 뛰어나다.
- 비대칭 노이즈(μ=0.3) 조건에서 CelebA에서 RMIT는 CA 78.9%를 기록했고, StarGAN의 60.2%에 비해 더 뛰어난 노이즈 강인성을 보였다.
- 50% 대칭적 레이블 노이즈 조건에서도 RMIT는 청소된 데이터로 훈련된 StarGAN의 결과물과 시각적으로 유사한 이미지를 생성하지만, StarGAN는 의미 있는 번역을 학습하지 못한다.
- 가상의 사이클 일치성 손실은 청소된 레이블이 필요 없이도 사이클 재구성 정규화를 효과적으로 수행하여 안정적인 훈련과 향상된 이미지 품질을 가능하게 한다.
- RMIT는 StarGAN보다 더 큰 주의 맵을 학습하며, 이는 더 큰 도메인 특화 수정을 선호함을 나타내며, 이는 높은 분류 정확도와 관련이 있다.
- 고도의 레이블 노이즈 조건에서는 StarGAN가 비변환 모델(즉, 출력이 입력과 유사)로 수렴하는 경향이 있으나, RMIT는 노이즈 강인 훈련 목표를 통해 이러한 실패 모드를 피한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.