[논문 리뷰] Semi-parametric Makeup Transfer via Semantic-aware Correspondence
이 논문은 비모수적 의미 인식 대응(SaC)과 모수적 디코더를 조합하여 참조 이미지에서 비미용 소스 이미지로 메이크업 스타일을 전이하는 준모수적 메이크업 전이 방법 SpMT를 제안한다. SaC 모듈은 소스 이미지와 참조 이미지 간의 의미 인식 특징 대응을 수립하여, 자세, 표정, 가림 현상의 변동에도 불구하고 신원과 구조를 유지하면서도 강건하고 유연하며 고화질의 메이크업 전이를 가능하게 한다.
The large discrepancy between the source non-makeup image and the reference makeup image is one of the key challenges in makeup transfer. Conventional approaches for makeup transfer either learn disentangled representation or perform pixel-wise correspondence in a parametric way between two images. We argue that non-parametric techniques have a high potential for addressing the pose, expression, and occlusion discrepancies. To this end, this paper proposes a extbf{S}emi- extbf{p}arametric extbf{M}akeup extbf{T}ransfer (SpMT) method, which combines the reciprocal strengths of non-parametric and parametric mechanisms. The non-parametric component is a novel extbf{S}emantic- extbf{a}ware extbf{C}orrespondence (SaC) module that explicitly reconstructs content representation with makeup representation under the strong constraint of component semantics. The reconstructed representation is desired to preserve the spatial and identity information of the source image while "wearing" the makeup of the reference image. The output image is synthesized via a parametric decoder that draws on the reconstructed representation. Extensive experiments demonstrate the superiority of our method in terms of visual quality, robustness, and flexibility. Code and pre-trained model are available at \url{https://github.com/AnonymScholar/SpMT.
연구 동기 및 목표
- 완전히 모수적인 메이크업 전이 모델이 흉터를 처리하지 못하고 재료 적용에서 현실감이 떨어지는 한계를 해결한다.
- 실세계 메이크업 전이 시나리오에서 자세, 표정, 가림 현상의 불일치로 인한 과제를 극복한다.
- 참조 이미지에서 직접 재사용 가능한 재료를 활용하는 비모수적 방법의 강점을 살리면서도 모수적 디코딩의 효율성을 유지한다.
- 하이브리드 모수-비모수 프레임워크를 통해 제어 가능하고 강건한 메이크업 전이를 가능하게 한다.
- 대응 학습 중 구성 요소 수준의 의미를 명시적으로 모델링하여 시각적 품질 향상과 신원 유지 성능을 향상시킨다.
제안 방법
- 다중 수준의 특징 피라미드에서 소스 및 참조 이미지 간의 특징 대응을 수립하는 새로운 의미 인식 대응(SaC) 모듈을 제안한다.
- SaC 모듈을 사용해 참조 이미지에서 비모수적으로 메이크업 재료(예: 립스틱 색상, 파운데이션)를 추출하고 의미 구성 요소 정렬 기반으로 소스 이미지로 전이한다.
- SaC 모듈 내에서 코사인 유사도 기반 매칭 전략을 적용하여 대응이 공간적 근접성 외에도 의미적 의미에 의해 유도되도록 보장한다.
- 학습 중 소스와 재구성된 표현 간의 의미 일致성을 강제하기 위해 미용 퍼셉추얼 손실을 도입한다.
- 재구성된 메이크업 보강된 콘텐츠 표현을 모수적 디코더에 입력하여 최종 메이크업 이미지를 생성한다.
- 실제성과 정확성 보장을 위해 adversarial loss, cycle-consistency loss, 그리고 제안된 미용 퍼셉추얼 손실을 사용해 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1완전히 모수적인 모델에 비해 비모수적 메커니즘이 자세, 표정, 가림 현상의 변동에 대해 더 강건한가?
- RQ2의미 인식 대응은 픽셀 수준 또는 비의미 기반 대응에 비해 메이크업 재료 전이의 현실감과 정확도를 어떻게 향상시키는가?
- RQ3하이브리드 준모수적 설계는 재학습 없이도 제어 가능한 메이크업 전이(예: 보간, 부분별 전이)를 어느 정도 가능하게 하는가?
- RQ4제안된 방법은 최신 기술 수준의 모수적 접근보다 소스 이미지의 신원과 구조적 세부 정보를 더 잘 유지하는가?
- RQ5환경적 변동이 있는 실제 세계의 제약 없는 이미지에서 뛰어난 시각적 품질과 일반화 성능을 달성할 수 있는가?
주요 결과
- SpMT는 서양식(141.3), vFG(156.4), vHX(119.2) 메이크업 스타일 모두에서 가장 낮은 Fréchet Inception Distance(FID) 점수를 기록하여 參照 메이크업 이미지와의 분포 유사도가 뛰어나다는 것을 보여준다.
- SSIM 점수는 0.89로 BeautyGAN(0.87), PSGAN(0.80), SCGAN(0.81)보다 유의미하게 높아 콘텐츠 및 신원 유지 성능이 뛰어나다는 것을 입증한다.
- 사용자 연구에서 SpMT는 자세, 표정, 가림 현상의 변동이 있는 어려운 이미지와 잘 정렬된 이미지 모두에서 최고의 득표 비율(40% 이상)을 기록했다.
- 이전 방법들인 BeautyGAN과 PSGAN에서 흔히 발생하는 입술이 입안 안에 나타나는 아티팩트를 효과적으로 방지했다.
- 정성 있는 결과를 통해 보여지듯이, SpMT는 보간 및 재구성된 표현의 부분별 선택을 통한 민감하고도 탄력적인 메이크업 전이가 가능하다.
- 단일 NVIDIA 3090 GPU에서 이미지당 약 1초의 계산 비용에도 불구하고 높은 시각적 품질과 강건성을 유지하며, 코드와 사전 학습된 모델을 공개적으로 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.