Skip to main content
QUICK REVIEW

[논문 리뷰] Cross Attention Based Style Distribution for Controllable Person Image Synthesis

Xinyue Zhou, Mingyu Yin|arXiv (Cornell University)|2022. 08. 01.
Face recognition and analysis인용 수 5
한 줄 요약

이 논문은 단일 단계, 제어 가능한 인체 이미지 합성에 적합한 크로스 어텐션 기반 스타일 분포(CASD) 모듈을 제안한다. 이 모듈은 어텐션 메커니즘을 통해 소스의 의미 스타일을 타겟 포즈에 동적으로 정렬함으로써 자세 이송과 가상 피팅을 가능하게 한다. 이 방법은 정량적 지표와 사용자 연구에서 최신 기술 수준의 성능을 달성하였으며, 별도의 훈련 없이도 정확한 파싱 맵을 동시에 생성한다.

ABSTRACT

Controllable person image synthesis task enables a wide range of applications through explicit control over body pose and appearance. In this paper, we propose a cross attention based style distribution module that computes between the source semantic styles and target pose for pose transfer. The module intentionally selects the style represented by each semantic and distributes them according to the target pose. The attention matrix in cross attention expresses the dynamic similarities between the target pose and the source styles for all semantics. Therefore, it can be utilized to route the color and texture from the source image, and is further constrained by the target parsing map to achieve a clearer objective. At the same time, to encode the source appearance accurately, the self attention among different semantic styles is also added. The effectiveness of our model is validated quantitatively and qualitatively on pose transfer and virtual try-on tasks.

연구 동기 및 목표

  • 유량 추정이 신뢰성 없이 다단계 파ip라인을 피하는 단일 훈련 단계에서 고해상도의 제어 가능한 인체 이미지 합성을 가능하게 하기 위해.
  • 기존 방법들이 큰 변형이 발생할 경우 소스 스타일을 타겟 포즈에 정렬하는 데에 한계를 보이는 문제를 해결하기 위해.
  • 별도의 파싱 모델이 필요 없이 실제적인 타겟 이미지와 파싱 맵을 동시에 생성하기 위해.
  • 가상 피팅 및 헤드 스왑과 같은 고급 이미지 조작 작업을 의미 영역 스타일의 명시적 제어를 통해 지원하기 위해.

제안 방법

  • CASD 모듈은 타겟 포즈 특징(쿼리)와 소스 의미 스타일 특징(키 및 밸류) 간의 동적 유사도를 크로스 어텐션을 통해 계산하여, 색상과 텍스처를 타겟 포즈에 소프트 라우팅할 수 있도록 한다.
  • 다양한 의미 스타일 간의 상호의존성을 모델링하고 스타일 표현의 정밀도를 향상시키기 위해 자기 어텐션을 적용한다.
  • 타겟 포즈에서 직접 투영 헤드를 통해 어텐션 행렬을 예측함으로써 엔드 투 엔드 훈련과 명시적 감독을 가능하게 한다.
  • 어 attention 행렬은 지표 타겟 파싱 맵을 사용하여 새로운 AMCE 손실로 제약을 받음으로써 정렬 정확도와 훈련 안정성이 향상된다.
  • 소스 이미지와 참조 이미지 간의 특정 의미 영역 스타일 특징을 교환함으로써 재학습 없이도 가상 피팅 및 헤드 스왑을 지원한다.
  • 전체 파이프라인은 단일 단계에서 훈련되며, 이미지 합성과 파싱 맵 예측을 동시에 최적화한다.

실험 결과

연구 질문

  • RQ1단일 단계 모델이 별도의 파싱 훈련 없이 실제적인 인체 이미지와 정확한 파싱 맵을 동시에 생성할 수 있는가?
  • RQ2크로스 어텐션 메커니즘이 복잡하고 변형된 타겟 포즈에 소스 의미 스타일을 얼마나 효과적으로 정렬할 수 있는가?
  • RQ3의미 스타일 간의 자기 어텐션을 통합함으로써 합성 품질과 스타일 일관성이 향상되는가?
  • RQ4특정 신체 부위의 스타일 특징 교환만으로도 모델이 가상 피팅 및 헤드 스왑에 효과적으로 적용될 수 있는가?
  • RQ5파싱 맵을 사용해 어텐션 행렬을 제약하는 AMCE 손실이 어텐션 정렬과 모델 성능을 어떻게 향상시키는가?

주요 결과

  • 전체 CASD 모델은 DeepFashion 데이터셋에서 타겟 파싱 맵 예측에 평균 IoU 66.34를 기록하여 SPGNet의 61.89를 초월한다.
  • 모든 의미 카테고리에서 클래스별 IoU 가 향상되었으며, 상의(76.72 vs. 67.87)와 배경(90.28 vs. 84.65)에서 두드러진 개선이 있었다.
  • 사용자 연구에서 자세 이송에 45.67%의 Jab 점수를, 가상 피팅에 동일한 45.67%를 기록하여 강력한 현실감 인식을 보였다.
  • 절단 실험 결과, 자기 어텐션, 포즈 기반 어텐션 행렬 예측, 또는 AMCE 손실을 제거할 경우 성능 저하가 발생하는 것으로 확인되었다.
  • 모델은 별도의 파싱 또는 유량 추정 네트워크 없이도 한 단계에서 실제적인 이미지와 파싱 맵을 성공적으로 생성하였다.
  • 특정 신체 부위의 스타일 특징 교환만으로도 재학습 없이 제로샷 가상 피팅 및 헤드 스왑을 구현하였으며, ADGAN 및 PISE에 비해 뛰어난 시각적 정밀도를 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.