Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging Off-the-shelf Diffusion Model for Multi-attribute Fashion Image Manipulation

Chaerin Kong, DongHyeon Jeon|arXiv (Cornell University)|2022. 10. 12.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

이 논문은 주어진 분류기의 어텐션 풀링을 활용하여 사전 학습된 확산 모델을 지도로 사용하는, 마스크가 필요 없는 일반적인 패션 속성 편집 프레임워크를 제안한다. 영역 인식 편집을 위해 공간 어텐션 맵을 활용하는 분류기 지도 확산을 통해, 아이템 카테고리, 소재, 네크라인 등 다양한 패션 속성에 대해 별도의 모델을 훈련시키지 않고도 고품질의 다중 속성 조작을 달성한다.

ABSTRACT

Fashion attribute editing is a task that aims to convert the semantic attributes of a given fashion image while preserving the irrelevant regions. Previous works typically employ conditional GANs where the generator explicitly learns the target attributes and directly execute the conversion. These approaches, however, are neither scalable nor generic as they operate only with few limited attributes and a separate generator is required for each dataset or attribute set. Inspired by the recent advancement of diffusion models, we explore the classifier-guided diffusion that leverages the off-the-shelf diffusion model pretrained on general visual semantics such as Imagenet. In order to achieve a generic editing pipeline, we pose this as multi-attribute image manipulation task, where the attribute ranges from item category, fabric, pattern to collar and neckline. We empirically show that conventional methods fail in our challenging setting, and study efficient adaptation scheme that involves recently introduced attention-pooling technique to obtain a multi-attribute classifier guidance. Based on this, we present a mask-free fashion attribute editing framework that leverages the classifier logits and the cross-attention map for manipulation. We empirically demonstrate that our framework achieves convincing sample quality and attribute alignments.

연구 동기 및 목표

  • 각 속성 세트마다 별도의 모델이 필요한 기존 GAN 기반 패션 속성 편집 방법의 스케일링 및 일반성 한계를 해결한다.
  • 일반 도메인 데이터(예: ImageNet)에 사전 학습된 확산 모델을 활용하여 패션 이미지 생성에서의 데이터 부족 및 도메인 이탈 문제를 극복한다.
  • 통합 프레임워크 내에서 다수의 복잡한 패션 속성(예: 아이템 유형, 소재, 칼라 스타일)을 동시에 편집할 수 있도록 한다.
  • 다양한 속성에 대해 제한된 애너테이션 데이터로도 처리할 수 있도록, 다중 속성 분류기에서 유도된 어텐션 맵을 활용해 수동 세그멘테이션 마스크가 필요 없도록 한다.
  • 제한된 애너테이션 데이터로도 다양한 속성을 효과적으로 다룰 수 있도록 어텐션 풀링을 활용한 효율적인 파인튜닝 전략을 개발한다.

제안 방법

  • 재학습이 아닌 사전 학습된 오프더샘이 확산 모델(예: Imagen)을 사용하여 이미지 생성을 수행한다.
  • 한정된 데이터에서 다양한 패션 속성을 분류하기 위해 비전 트랜스포머(ViT) 기반 백본과 파인튜닝된 어텐션 풀링 레이어를 갖춘 다중 속성 분류기를 훈련시킨다.
  • 분류기의 로짓의 기울기를 활용하여 확산 모델의 노이즈 제거 과정을 지도하는 분류기 지도 확산을 적용한다.
  • 분류기의 최종 레이어에서 유도된 어텐션 맵을 사용하여 편집이 필요한 공간 영역을 암묵적으로 식별함으로써, 명시적인 세그멘테이션 마스크를 대체한다.
  • 편집 과정에서 관련이 없는 이미지 영역을 유지하기 위해 배경 보존 손실을 통합하여 마스크 감독 없이도 품질을 유지한다.
  • 가이드 스케일(λ)을 최적화하여 속성 일치도와 샘플 품질 간 균형을 이끌어내며, λ=100에서 최적의 성능을 달성한다.

실험 결과

연구 질문

  • RQ1사전 학습된 오프더샘이 확산 모델을 생성 컴ponent를 파인튜닝 없이 패션 속성 편집에 효과적으로 적용할 수 있는가?
  • RQ2어텐션 풀링을 활용한 단일 다중 속성 분류기는 다양한 패션 속성에 걸쳐 복잡한 다중 속성 편집을 얼마나 효과적으로 지도할 수 있는가?
  • RQ3분류기에서 유도된 어텐션 맵은 수동 세그멘테이션 마스크를 대체하여 국소적이고 고해상도의 이미지 편집을 가능하게 할 수 있는가?
  • RQ4분류기 정확도와 가이드 스케일이 생성된 편집의 품질과 일치도에 미치는 영향은 어떠한가?
  • RQ5기존 GAN 기반 접근 방식과 달리, 대량의 속성을 동시에 편집할 때 제안된 프레임워크는 성능과 안정성을 유지하는가?

주요 결과

  • 제안된 프레임워크는 단일 오프더샘이 확산 모델과 파인튜닝된 다중 속성 분류기를 사용하여, 아이템 카테고리나 소재와 같은 복잡한 속성까지도 고품질의 다양한 패션 속성 편집을 달성한다.
  • 분류기 지도 확산과 어텐션 풀링을 통해 마스크가 없는 편집이 가능하며, 공간 어텐션 맵을 통해 수정이 필요한 영역을 암묵적으로 식별함으로써 사용자가 제공한 마스크가 필요 없다.
  • 프레임워크는 조화로운 속성 조합을 갖춘 다중 속성 편집을 성공적으로 수행하여 현실적이고 시각적으로 일관된 결과를 생성한다.
  • 절단 실험 결과 배경 보존 손실이 품질 유지에 매우 중요하며, 이 손실이 없을 경우 조건은 일치하지만 비현실적인 샘플이 생성됨을 확인했다.
  • 최적의 가이드 스케일(λ=100)은 속성 일치도와 이미지 품질 간 균형을 잘 이룹니다. 이하 또는 이하의 값은 품질 저하 또는 일치도 오류를 초래한다.
  • 스케일링 측면에서 GAN 기반 베이스라인을 능가하며, GAN은 넓은 속성 세트에서 훈련 시 학습 붕괴 문제가 발생하지만, 확산 기반 접근 방식은 안정성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.