[논문 리뷰] GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models
GLIDE는 3.5B 매개변수의 텍스트-조건 확산 모델을 학습하고 classifier-free와 CLIP-guided 샘플링을 비교합니다. classifier-free 가이드는 더 포토리얼리스틱하고 캡션과의 정합성이 높은 이미지를 생성하는 것으로 나타났으며, 텍스트 기반 인페인팅 편집을 시연하고 남용 방지를 위한 필터링된 더 작은 모델을 공개합니다.
Diffusion models have recently been shown to generate high-quality synthetic images, especially when paired with a guidance technique to trade off diversity for fidelity. We explore diffusion models for the problem of text-conditional image synthesis and compare two different guidance strategies: CLIP guidance and classifier-free guidance. We find that the latter is preferred by human evaluators for both photorealism and caption similarity, and often produces photorealistic samples. Samples from a 3.5 billion parameter text-conditional diffusion model using classifier-free guidance are favored by human evaluators to those from DALL-E, even when the latter uses expensive CLIP reranking. Additionally, we find that our models can be fine-tuned to perform image inpainting, enabling powerful text-driven image editing. We train a smaller model on a filtered dataset and release the code and weights at https://github.com/openai/glide-text2im.
연구 동기 및 목표
- 확대된 규모의 확산 모델(3.5B 매개변수)을 사용한 텍스트-조건 이미지 합성의 진전과 충실도 및 캡션 정합성에 대한 가이드 전략 평가.
- 확대된 확산 모델을 사용한 텍스트 기반 이미지 편집 및 인페인팅 시연.
- 오용 가능성에 대한 안전 측면 평가 및 오용 완화용 필터링된 릴리스 버전 제공.
제안 방법
- 자연어 프롬프트에 조건화된 3.5B 매개변수 텍스트-조건 확산 모델을 학습합니다.
- 노이즈가 추가된 이미지에서 확산을 이끄는 데 있어 classifier-free 가이드와 CLIP 가이드를 비교합니다.
- 텍스트 기반 편집을 가능하게 하는 마스크 조건화로 이미지 인페인팅을 위한 미세조정합니다.
- 데이터를 정제한 작은 필터링된 GLIDE(필터링된) 모델을 학습하여 악용 위험을 줄입니다.
- 노이즈가 있는 입력에 대해 CLIP-가이드를 가능하게 하는 노이즈된 CLIP 모델을 학습합니다.
실험 결과
연구 질문
- RQ1classifier-free 가이드가 포토리얼리즘과 캡션 유사성 측면에서 텍스트-조건 확산에 대해 CLIP 가이드를 능가하는가?
- RQ2별도의 분류기가 필요 없이 확산 모델을 효과적으로 제어하여 고품질의 텍스트-조건 생성이 가능한가?
- RQ3자연어 프롬프트에 의해 구동되는 이미지 인페인팅/편집을 모델이 얼마나 잘 수행하는가?
- RQ4오용(허위정보나 딥페이크) 위험을 완화하기 위한 안전 조치(데이터 필터링, 소형 필터링 모델)는 얼마나 효과적인가?
- RQ5GLIDE가 인간 평가에서 이전의 텍스트-투-이미지 모델(DALL-E 등)과 어떤 차이를 보이는가?
주요 결과
- classifier-free 가이드는 CLIP 가이드보다 인간 평가에서 더 높은 품질의 포토리얼리스틱하고 캡션 정합성이 높은 이미지를 산출합니다.
- GLIDE의 classifier-free 가이드는 인간 연구에서 DALL-E보다 선호되며(일부 설정에서 87% 포토리얼리즘, 69% 캡션 유사성)
- GLIDE는 MS-COCO 특정 학습 없이도 MS-COCO FID 12.24로 경쟁력 있으며, 필터링된 평가에서도 강한 성능을 유지합니다(12.89).
- GLIDE는 주변 스타일과 조명(그림자 및 반사 포함)에 맞춘 텍스트 조건 인페인팅을 가능하게 합니다.
- 데이터 필터링으로 사람과 특정 폭력/증오 콘텐츠를 제거하고, 악용 위험을 줄인 소형 필터링 GLIDE 모델이 공개되었습니다; 레드팀 테스트는 필터링된 데이터로 인식 가능한 사람 이미지를 생성하는 능력이 제한적임을 시사합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.