Skip to main content
QUICK REVIEW

[논문 리뷰] RMGN: A Regional Mask Guided Network for Parser-free Virtual Try-on

Lin Chao, Zhao Li|arXiv (Cornell University)|2022. 04. 24.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 참조 인물과 대상 옷에서 특징을 명시적으로 융합하기 위해 적응형 지역 마스크를 사용하는 파서 기반 가상 시착 네트워크 RMGN을 제안한다. 이로 인해 기존 옷의 잔류 잡음이 제거된다. 다수준 특징 추출기와 자세 인식 손실을 통합함으로써 RMGN은 고해상도, 복잡한 자세 설정에서 최신 기술 수준의 성능을 달성하며, 파서 기반 및 파서 비기반 방법을 모두 능가하는 정밀도와 현실감을 구현한다.

ABSTRACT

Virtual try-on(VTON) aims at fitting target clothes to reference person images, which is widely adopted in e-commerce.Existing VTON approaches can be narrowly categorized into Parser-Based(PB) and Parser-Free(PF) by whether relying on the parser information to mask the persons' clothes and synthesize try-on images. Although abandoning parser information has improved the applicability of PF methods, the ability of detail synthesizing has also been sacrificed. As a result, the distraction from original cloth may persistin synthesized images, especially in complicated postures and high resolution applications. To address the aforementioned issue, we propose a novel PF method named Regional Mask Guided Network(RMGN). More specifically, a regional mask is proposed to explicitly fuse the features of target clothes and reference persons so that the persisted distraction can be eliminated. A posture awareness loss and a multi-level feature extractor are further proposed to handle the complicated postures and synthesize high resolution images. Extensive experiments demonstrate that our proposed RMGN outperforms both state-of-the-art PB and PF methods.Ablation studies further verify the effectiveness ofmodules in RMGN.

연구 동기 및 목표

  • 파서 기반 가상 시착 방법에서 발생하는 참조 옷의 잔류 잡음 문제를 해결하기 위해.
  • 인간의 파싱에 의존하지 않고 고해상도 이미지 합성을 향상시키기 위해.
  • 가상 시착 생성에서 복잡한 인간 자세에 대한 강건성을 향상시키기 위해.
  • 사람과 옷의 관련 특징을 명시적으로 융합하면서 간섭 요소를 억제하는 생성자 설계를 위해.
  • 파싱 애너테이션을 필요로 하지 않으면서도 파서 기반 방법과 동등하거나 그 이상의 성능을 달성하기 위해.

제안 방법

  • 다중 수준 특징 추출기를 사용하여 참조 인물과 대상 옷에서 고해상도 특징을 별도로 추출한다.
  • 양쪽 입력의 특징에서 적응형으로 지역 마스크를 생성하여 특징 융합를 안내하며, 파싱이 필요 없도록 한다.
  • 지역 마스크는 대상 옷 영역을 강조하고 원래 옷의 특징을 억제함으로써 선택적 융합을 가능하게 한다.
  • 자세 인식 손실을 도입하여 모델이 구조적 일致성과 신체 가장자리에 집중하도록 하여 다양한 자세에서의 일반화 능력을 향상시킨다.
  • 생성자는 지역 마스크를 사용하여 대상 옷의 무늬와 색상을 유지하는 방식으로 특징을 융합한다.
  • 사이클릭 일致성과 가짜 이미지 샘플링을 활용하여 적대적 손실과 인지적 손실을 종합적으로 사용해 엔드 투 엔드로 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1파서 기반 가상 시착 방법에 의존하지 않고도 고정밀도 결과를 달성할 수 있는가?
  • RQ2파서 비기반 VTON에서 특징 융합를 어떻게 향상시켜 참조 인물의 옷에서 발생하는 잔류 잡음을 제거할 수 있는가?
  • RQ3학습 가능한 지역 마스크가 특징 융합를 안내하기 위해 세그멘테이션 맵을 효과적으로 대체할 수 있는가?
  • RQ4자세 인식 손실이 복잡한 자세에서의 일반화 능력을 얼마나 향상시킬 수 있는가?
  • RQ5고해상도 설정에서 파서 비기반 방법이 파서 기반 방법과 동등하거나 그 이상의 성능을 달성할 수 있는가?

주요 결과

  • RMGN은 VITON 데이터셋(512×384)에서 프레셰 인셉션 거리(FID) 9.93을 기록하여 최신 기술 수준의 방법들을 능가한다.
  • 절단 실험 결과, 지역 마스크를 제거할 경우 기존 옷의 명확한 검은 잔류 영역이 나타나며, 이는 마스크가 잡음 억제에 기여한다는 것을 확인한다.
  • 자세 인식 손실은 특히 복잡한 자세에서 구조적 일관성을 크게 향상시키며, 정성적 비교를 통해 이를 입증한다.
  • 자세 인식 손실에 사용되는 가짜 이미지의 수를 늘릴수록 이미지 품질이 향상되어 그 효과를 입증한다.
  • 사용자 연구 결과, A/B 테스트에서 RMGN이 생성한 이미지가 베이스라인 대비 더 현실적으로 인식된다.
  • 지역 마스크의 시각화 결과, 다양한 소매 길이와 자세 조건에서도 대상 옷 영역에 적절히 집중하고 기존 옷의 특징을 억제하는 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.