Skip to main content
QUICK REVIEW

[논문 리뷰] CustomNet: Zero-shot Object Customization with Variable-Viewpoints in Text-to-Image Diffusion Models

Ziyang Yuan, Mingdeng Cao|arXiv (Cornell University)|2023. 10. 30.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

CustomNet는 텍스트-이미지 확산 모델을 위한 제로샷 객체 커스터마이제이션 방법을 도입하며, 3D 신규 시점 합성 기술을 활용하여 객체의 시점, 위치, 배경에 대한 명시적 제어를 가능하게 한다. 이로 인해 테스트 시 최적화 없이도 다양한 결과를 생성하면서도 강한 신원 유지 성능을 달성한다. 이 방법은 시점 조건화 생성, 텍스처 유지를 위한 입력 병합, 분리된 전경-배경 제어를 위한 이중 크로스 어텐션을 결합한다.

ABSTRACT

Incorporating a customized object into image generation presents an attractive feature in text-to-image generation. However, existing optimization-based and encoder-based methods are hindered by drawbacks such as time-consuming optimization, insufficient identity preservation, and a prevalent copy-pasting effect. To overcome these limitations, we introduce CustomNet, a novel object customization approach that explicitly incorporates 3D novel view synthesis capabilities into the object customization process. This integration facilitates the adjustment of spatial position relationships and viewpoints, yielding diverse outputs while effectively preserving object identity. Moreover, we introduce delicate designs to enable location control and flexible background control through textual descriptions or specific user-defined images, overcoming the limitations of existing 3D novel view synthesis methods. We further leverage a dataset construction pipeline that can better handle real-world objects and complex backgrounds. Equipped with these designs, our method facilitates zero-shot object customization without test-time optimization, offering simultaneous control over the viewpoints, location, and background. As a result, our CustomNet ensures enhanced identity preservation and generates diverse, harmonious outputs.

연구 동기 및 목표

  • 기존 최적화 기반 및 인코더 기반 커스터마이제이션 방법의 한계를 해결하기 위해, 느린 추론, 낮은 신원 유지 성능, 복사-붙여넣기 아티팩트를 해결한다.
  • 현재 3D 신규 시점 합성 방법을 객체 커스터마이제이션에 적용할 때의 시점 다양성 부족 및 공간적 제어 부족 문제를 해결한다.
  • 텍스트 또는 이미지 기반 조건을 통해 객체의 시점, 공간적 위치, 배경을 동시에 제어할 수 있도록 한다.
  • 실세계 객체와 복잡한 배경을 훈련 과정에 효과적으로 통합하는 데이터 구축 파이프라인을 개발한다.
  • 사전 훈련된 3D 시점 합성 능력을 활용하여 테스트 시 최적화 없이도 제로샷 커스터마이제이션을 달성한다.

제안 방법

  • Zero-1-to-3를 영감으로 삼아, 시점 조건화 확산 모델링을 활용해 3D 신규 시점 합성을 객체 커스터마이제이션 파이프라인에 통합한다.
  • 카메라 포즈 파rameter $[R, T]$를 통해 명시적 시점 제어를 가능하게 하여 단일 기준 이미지에서 다양한 객체 시점의 결과를 생성한다.
  • 변환된 기준 객체 이미지를 직접 UNet 입력에 병합하여 공간적 위치 제어를 수행한다.
  • 전경과 배경 제어를 분리하는 이중 크로스 어텐션 모듈을 도입하여, 텍스트 프롬프트 또는 사용자 제공 배경 이미지에 대해 독립적으로 조건화할 수 있도록 한다.
  • 실제 다중시점 데이터(Objaverse)와 자연 이미지(OpenImages)를 조합한 맞춤형 데이터 구축 파이프라인을 구현하여 현실감과 일반화 능력을 향상시킨다.
  • 사전 훈련된 Zero-1-to-3 가중치로 CustomNet을 초기화하여, 시작 단계부터 시점 일致성과 신원 유지 성능을 보존한다.

실험 결과

연구 질문

  • RQ13D 인식 확산 모델에서 명시적 시점 제어는 제로샷 객체 커스터마이제이션의 다양성과 신원 유지 성능을 향상시키는가?
  • RQ2기준 객체 이미지의 입력 병합은 생성된 이미지에서 텍스처와 신원 유지에 어떤 영향을 미치는가?
  • RQ3이중 크로스 어텐션은 시점 일치성을 유지하면서 전경과 배경에 대해 얼마나 효과적으로 분리된 제어를 가능하게 하는가?
  • RQ4제안된 데이터 구축 파이프라인은 단순한 데이터 조합 대비 실제 객체와 복잡한 배경을 다루는 데 얼마나 효과적인가?
  • RQ5이 방법은 테스트 시 최적화나 파인튜닝 없이도 고품질의 조화로운 출력을 달성할 수 있는가?

주요 결과

  • CustomNet는 강력한 신원 유지 성능을 바탕으로 다양한 시점 변형 결과를 생성하며, 이전 인코더 기반 방법에서 흔히 발생하는 복사-붙여넣기 효과를 피한다.
  • 명시적 시점 제어와 기준 이미지 병합의 조합은 이러한 구성 요소가 없는 모델 대비 텍스처와 형태의 정확도를 크게 향상시킨다.
  • 이중 크로스 어텐션은 분리된 제어를 가능하게 하며, 동일한 객체 시점이 다양한 텍스트 기반 배경 기술에 대해 유지되며, 사용자 제공 배경이 원활하게 통합된다.
  • 데이터 구축 파이프라인은 다중시점 객체 데이터와 다양한 자연 배경을 조합함으로써 '부유하는' 아티팩트를 효과적으로 줄이고 현실감을 향상시킨다.
  • CustomNet는 특히 사전 훈련된 3D 시점 합성 모델인 Zero-1-to-3에서 초기화된 경우, 시점 일致성과 신원 유지 성능에서 베이스라인 모델을 능가한다.
  • 명시적 시점 제어가 없을 경우, 다중시점 데이터로 훈련된 상태에서도 모델은 여전히 복사-붙여넣기 행동으로 회귀함을 확인하여, 자세 조건화의 필수성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.