Skip to main content
QUICK REVIEW

[논문 리뷰] Lasagna: Layered Score Distillation for Disentangled Object Relighting

Dina Bashkirova, Arijit Ray|arXiv (Cornell University)|2023. 11. 30.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 이미지 콘텐츠를 유지하면서 직관적인 조명 제어를 가능하게 하는 텍스트 유도형, 계층적 스코어 디스틸레이션 방법인 Lasagna를 제안한다. R-eLiT라는 합성 재조명 데이터셋에 기반한 확산 모델의 사전 지식을 디스틸레이션함으로써, 실제 이미지와 예술적 이미지에서 최신 기술 수준의 성능을 달성하며, 인간 선호 평가의 91%에서 베이스라인을 능가한다.

ABSTRACT

Professional artists, photographers, and other visual content creators use object relighting to establish their photo's desired effect. Unfortunately, manual tools that allow relighting have a steep learning curve and are difficult to master. Although generative editing methods now enable some forms of image editing, relighting is still beyond today's capabilities; existing methods struggle to keep other aspects of the image -- colors, shapes, and textures -- consistent after the edit. We propose Lasagna, a method that enables intuitive text-guided relighting control. Lasagna learns a lighting prior by using score distillation sampling to distill the prior of a diffusion model, which has been finetuned on synthetic relighting data. To train Lasagna, we curate a new synthetic dataset ReLiT, which contains 3D object assets re-lit from multiple light source locations. Despite training on synthetic images, quantitative results show that Lasagna relights real-world images while preserving other aspects of the input image, outperforming state-of-the-art text-guided image editing methods. Lasagna enables realistic and controlled results on natural images and digital art pieces and is preferred by humans over other methods in over 91% of cases. Finally, we demonstrate the versatility of our learning objective by extending it to allow colorization, another form of image editing.

연구 동기 및 목표

  • 텍스트 유도형 이미지 편집 방법에서 기하학적 인식이 가능한 제어 가능한 재조명의 부재를 해결하기 위해.
  • 재조명에서의 시뮬레이션에서 실제 세계로의 도메인 갭을 줄이기 위해 조명 편집을 다른 이미지 요소에서 분리하기 위해.
  • 수동적 프롬프트 튜닝이나 광범위한 초모수 조정 없이도 직관적인 언어 기반 재조명을 가능하게 하기 위해.
  • 합성 재조명 사전 지식이 실제 세계 및 추상적 디지털 예술 이미지로 일반화됨을 입증하기 위해.
  • 재조명을 넘어서 스케치 색채화와 같은 다른 편집 작업으로 메서드의 유용성을 확장하기 위해.

제안 방법

  • 합성 재조명 데이터에 맞춰 미세조정된 확산 모델에서 기하학적 인식이 가능한 조명 사전 지식을 스코어 디스틸레이션 샘플링(SDS)을 통해 추출한다.
  • 재조명을 픽셀 공간에서의 빛의 밝기 조정으로 표현함으로써, 색상, 질감, 형태를 유지하는 분리된 편집을 가능하게 한다.
  • 조명을 별도의 편집 레이어로 적용하는 계층적 편집 프레임워크를 도입하며, 원본 이미지와 가중 혼합을 통해 조합한다.
  • 14,000개 이상의 3D 렌더링 객체를 포함한 새로운 합성 데이터셋 R-eLiT를 사용해 훈련한다. 이 데이터셋에는 다양한 조명 소스 구성과 방향이 포함되어 있다.
  • 모든 재조명 지시어에 동일한 프롬프트 템플릿을 사용하여 프롬프트 튜닝의 필요성을 최소화한다.
  • 색채화를 위해 색상 레이어와 투명도 레이어를 도입하고, CLIP 기반의 구조 정규화 기법을 사용해 요소별 혼합을 통해 조합한다.

실험 결과

연구 질문

  • RQ1합성 재조명 데이터에 맞춰 미세조정된 확산 모델이 비조명 속성에 영향을 주지 않고 실제 세계 이미지로 일반화될 수 있는가?
  • RQ2스코어 디스틸레이션 샘플링이 조정 가능한 편집을 위해 확산 모델에서 기하학적 인식이 가능한 조명 사전 지식을 효과적으로 추출할 수 있는가?
  • RQ3광택 조정 기반의 계층적 편집 접근 방식이 종단 간 확산 기반 편집보다 이미지 콘텐츠 보존을 더 잘 유지하는가?
  • RQ4하나의 통합 사전 지식이 합성 데이터셋에서 학습된 후 자연 이미지와 디지털 아트 이미지 등 다양한 도메인에서 고품질의 재조명을 지원할 수 있는가?
  • RQ5유사한 학습 목표가 스케치 색채화와 같은 다른 편집 작업으로 확장 가능하며, 아키텍처 변경을 최소화할 수 있는가?

주요 결과

  • Lasagna는 여러 데이터셋에서 인간 선호 평가의 91% 이상에서 InstructPix2Pix와 P2P를 포함한 최신 기술 수준의 텍스트 유도형 편집 방법을 능가한다.
  • DreamBooth 데이터셋에서 Lasagna는 ControlNet보다 91%의 경우에서 선호되며, 시뮬레이션에서 실제 세계로의 갭을 줄이는 사전 지식 디스틸레이션의 효과를 입증한다.
  • R-eLiT 테스트 세트에서 Lasagna는 Text2Live와 DDS보다 92%의 선호도를 기록하여, 계층적이고 디스틸레이션 기반 설계의 중요성을 확인한다.
  • 이 방법은 디지털 아트와 자연 이미지로 잘 일반화되며, 일관된 색상, 질감, 형태를 유지하면서 정확한 조명 방향 제어를 가능하게 한다.
  • 실패 사례로는 배경에서 과도한 조명 노출 아티팩트와 매우 추상적인 입력에서의 도전 과제가 있으며, 이는 전경 마스킹을 통한 향상 가능성을 시사한다.
  • 이 방법은 스케치 색채화로도 성공적으로 확장되었으며, 수정된 레이어 조합과 변동성 스코어 디스틸레이션을 사용해 타당한 결과를 도출했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.