[논문 리뷰] Latent Normalizing Flows for Many-to-Many Cross-Domain Mappings
이 논문은 정규화 흐름을 사용하여 공유 잠재공간과 도메인 특화 잠재공간을 별도로 모델링함으로써 이미지와 텍스트 간의 다양한 다대다 다도메인 변환을 가능하게 하는 준지도 학습 프레임워크인 LNFMM을 제안한다. 정규화 흐름을 통해 데이터에 의존하는 사전 분포를 학습함으로써, 이미지 설명 생성(Bleu, CIDEr)과 텍스트에서 이미지 생성(IvOM, LPIPS) 모두에서 최신 기준 성능을 달성하며, 정확성과 다양성 측면에서 이전 방법들을 능가한다.
Learned joint representations of images and text form the backbone of several important cross-domain tasks such as image captioning. Prior work mostly maps both domains into a common latent representation in a purely supervised fashion. This is rather restrictive, however, as the two domains follow distinct generative processes. Therefore, we propose a novel semi-supervised framework, which models shared information between domains and domain-specific information separately. The information shared between the domains is aligned with an invertible neural network. Our model integrates normalizing flow-based priors for the domain-specific information, which allows us to learn diverse many-to-many mappings between the two domains. We demonstrate the effectiveness of our model on diverse tasks, including image captioning and text-to-image synthesis.
연구 동기 및 목표
- 기존 모델이 잠재공간에서 가우시안 사전 분포를 강제 적용함으로써 후행 분포 붕괴와 다도메인 생성의 다양성 감소를 초래하는 한계를 해결하기 위해.
- 공유된 의미 정보를 정렬하면서 도메인 특화 변형을 유지함으로써 이미지와 텍스트 간의 다대다 매핑을 가능하게 하기 위해.
- 클러스터링이나 스타일에 대한 추가 감독 없이도 복잡한 다중모odal 공동 분포를 잠재공간에서 학습하기 위해.
- 정규화 흐름을 통해 데이터에 의존하는 사전 분포를 모델링하여 이미지 설명 생성과 텍스트에서 이미지 생성의 정확성과 다양성을 동시에 향상시키기 위해.
제안 방법
- 모델은 공유(의미적) 및 도메인 특화 성분으로 잠재공간을 분리하며, 공유 차원은 쌍체의 이미지-텍스트 데이터로부터 학습된다.
- 도메인 특화 변형은 잔차 잠재 차원에 적용된 정규화 흐름을 통해 모델링되며, 복잡한 데이터에 의존하는 사전 분포를 가능하게 한다.
- 역행 가능한 정규화 흐름 레이어를 통해 정확한 가능도 계산과 효율적인 샘플링이 가능하여 생성 및 추론 모두를 지원한다.
- 조건부 변분 오토인코더와 정규화 흐름 사전 분포를 통합함으로써, 쌍체 데이터와 비쌍체 데이터에서의 준지도 학습이 가능해진다.
- 이미지 디코더에 판별기(discriminator)를 통합하여 텍스트에서 이미지 생성 시 이미지 품질을 향상시키지만, 공동 잠재공간은 변경하지 않는다.
- 아키텍처는 이미지에서 텍스트로, 그리고 텍스트에서 이미지로의 이중 방향 생성을 지원하며, 민감한 사전 분포 덕분에 다양한 출력을 생성한다.
실험 결과
연구 질문
- RQ1정규화 흐름은 이미지-텍스트 다도메인 생성을 위한 잠재공간에서 복잡한 다중모달 공동 분포를 효과적으로 모델링할 수 있는가?
- RQ2정규화 흐름을 통해 데이터에 의존하는 사전 분포를 학습할 경우, 가우시안 사전 분포 대비 이미지 설명 생성에서 다양성과 정확성이 어떻게 향상되는가?
- RQ3공유 및 도메인 특화 잠재공간을 가진 준지도 학습 프레임워크가 추가 감독 없이 다대다 매핑을 얼마나 잘 수행할 수 있는가?
- RQ4제안된 방법은 다양성과 충실도 측면에서 최신 기준 모델을 모두 능가하는가?
주요 결과
- COCO 데이터셋에서 LNFMM는 이미지 설명 생성에서 최신 기준 성능을 달성하였으며, CIDEr 점수는 128.7, Bleu-4 점수는 86.3을 기록하여 이전 방법들을 능가했다.
- 텍스트에서 이미지 생성에서 IvOM 점수는 0.430으로 향상되었고, LPIPS는 0.481로 상승하여 AttnGAN보다 더 높은 다양성과 진짜 이미지에 가까운 시각적 유사도를 보였다.
- LNFMM는 추가 감독 없이도 Inception Score 12.10 ± 0.18을 기록하여 HD-GAN(11.86)을 초월했다.
- 정성적 결과에서는 다양한 의미와 문법적 구조를 가진 다양한 설명과, 촬영 각도나 근접 촬영 등 다양한 객체 방향을 포함한 의미적으로 정확한 다양한 이미지가 생성되었다.
- 스타일이나 개체 수준의 클러스터링을 위한 유도 감독 없이도 고품질이고 다양한 샘플을 생성할 수 있었다.
- 정규화 흐름의 사용은 복잡한 다중모달 사전 분포를 효과적으로 모델링할 수 있게 하여 후행 분포 붕괴를 방지하고 고해상도, 다양한 생성을 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.