[논문 리뷰] The Stable Artist: Steering Semantics in Diffusion Latent Space
스테블 아티스트는 마스크나 미세조정 없이도 다중 의미적 방향을 따라 잠재공간 궤적을 정교하게 제어할 수 있는 의미 지도(SEGA)를 도입한다. 이는 텍스트에서 이미지로의 확산 모델에 대해 반복적이고 세밀한 제어를 가능하게 하며, 기존의 P2P 및 컴포지션 가능 확산과 비교해 다중 개념 편집 및 추상적 개념의 의미 탐색에서 뛰어난 성능을 발휘한다.
Large, text-conditioned generative diffusion models have recently gained a lot of attention for their impressive performance in generating high-fidelity images from text alone. However, achieving high-quality results is almost unfeasible in a one-shot fashion. On the contrary, text-guided image generation involves the user making many slight changes to inputs in order to iteratively carve out the envisioned image. However, slight changes to the input prompt often lead to entirely different images being generated, and thus the control of the artist is limited in its granularity. To provide flexibility, we present the Stable Artist, an image editing approach enabling fine-grained control of the image generation process. The main component is semantic guidance (SEGA) which steers the diffusion process along variable numbers of semantic directions. This allows for subtle edits to images, changes in composition and style, as well as optimization of the overall artistic conception. Furthermore, SEGA enables probing of latent spaces to gain insights into the representation of concepts learned by the model, even complex ones such as 'carbon emission'. We demonstrate the Stable Artist on several tasks, showcasing high-quality image editing and composition.
연구 동기 및 목표
- 텍스트에서 이미지로의 확산 모델에서 세밀하고 상호작용 가능한 제어의 부족 문제를 해결하기 위해, 소량의 프롬프트 변경에도 예측 불가능한 이미지 변형이 발생하지 않도록 한다.
- 아티스트가 이미지 생성을 여러 의미적 방향으로 반복적으로 이동시킬 수 있도록 하되, 이미지 마스크나 주의 기반 소프트 마스크에 의존하지 않는다.
- 스타일 전이, 구성 변경, 텍스처 조작과 같은 복잡한 편집 작업을 하나의 통합 프레임워크에서 지원한다.
- 모델의 의미를 이해하기 위해 잠재공간 표현을 추상적 개념들(예: '탄소 배출')에 대해 탐색할 수 있도록 한다.
- 텍스트 외에도 이미지 및 텍스트 역전환에서 유도된 임베딩과 같은 다양한 입력에 적용 가능한 일반적인 조건부 메커니즘을 제공한다.
제안 방법
- SEGA는 텍스트 프롬프트와 그 편집을 기반으로 잠재공간에서 노이즈를 예측하는 잠재확산모델을 사용하며, 예측된 노이즈 간의 차이를 통해 잠재공간 내 방향성 지도를 계산한다.
- 학습된 스케일링 인자 sₑⁱ와 원본 및 편집된 프롬프트의 노이즈 예측 간의 차이를 임계값 처리한 결과를 바탕으로 지도 벡터 μₜ를 계산한다.
- 원본 프롬프트의 노이즈 예측값이 편집된 프롬프트의 것보다 큰지 여부에 따라 양의 또는 음의 지도를 적용하며, 이는 학습 가능한 임계값 λ를 사용한다.
- 최종 지도 γₜ는 개별 개념 지도 벡터들의 가중합이며, 필요에 따라 νₜ를 통한 잔여 노이즈 주입이 가능하다.
- 모멘타ム 기반 노이즈 보정을 통해 반복적으로 잠재코드를 업데이트하며, βₘ는 과거 지도의 기억 정도를 제어한다.
- 이 방법은 모델의 미세조정 없이도 잠재공간에서 완전히 작동하며, 명시적 마스크가 필요 없어 다양한 입력에 대한 민첩한 조건부 적용이 가능하다.
실험 결과
연구 질문
- RQ1잠재공간 내 의미 지도가 이미지 마스크나 주의 기반 소프트 마스크에 의존하지 않고도 세밀하고 반복적인 이미지 편집을 가능하게 할 수 있는가?
- RQ2이미지 생성 과정에서 여러 의미적 개념을 동시에 조건부로 적용하면서도 각 개념의 영향력 강도를 제어할 수 있는가?
- RQ3잠재공간을 탐색하여 '탄소 배출'과 같은 추상적 복잡한 개념이 확산 모델 내에서 어떻게 표현되는지 이해할 수 있는가?
- RQ4SEGA는 자연어 임베딩에서 관찰된 바와 유사한 개념 산술 연산을 얼마나 잘 지원할 수 있는가?
- RQ5편집 품질과 구성 충실도 측면에서 기존 방법들인 P2P 및 컴포지션 가능 확산과 비교해 어떻게 성능을 발휘하는가?
주요 결과
- SEGA는 다중 개념 이미지 편집을 고해상도로 수행할 수 있으며, 각 의미 편집의 강도와 방향을 완전히 제어할 수 있다. 이는 구성과 스타일 융합 측면에서 P2P 및 컴포지션 가능 확산을 능가한다.
- 이 방법은 충실도 높은 스타일 전이를 성공적으로 수행하며, 성격이 다른 예술 스타일(예: 바르트의 스타일)로 변환하면서도 원본 구성은 유지한다.
- SEGA는 동시에 여러 개념을 편집할 수 있으며, P2P가 단일 프롬프트에 다중 편집을 적용할 경우 발생하는 임의의 객체 중복 등의 아티팩트를 방지한다.
- 이 방법은 추상적 개념의 잠재공간 표현을 탐색할 수 있도록 하여, '탄소 배출'과 같은 비시각적 개념조차도 의미적으로 지도할 수 있음을 입증한다.
- SEGA는 이미지 생성 영역으로도 개념 산술을 가능하게 하여, 이전에는 자연어 임베딩에서만 관찰된 능력을 시각 영역으로 확장한다.
- 이 방법은 일반적인 목적의 것으로서, 모델의 미세조정 없이도 텍스트 임베딩, 이미지 프롬프트, 텍스트 역전환에서 유도된 임베딩 등 다양한 조건부 입력에 적용 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.