[논문 리뷰] Visual Programming for Text-to-Image Generation and Evaluation
이 논문은 텍스트에서 이미지로의 생성(T2I) 과정을 해석 가능하고 단계별로 제어할 수 있도록 하는 시각적 프로그래밍 프레임워크인 VPGen을 소개한다. VPGen은 사전 훈련된 언어 모델을 미세조정하여 객체 수와 레이아웃을 생성한 후, 이를 레이아웃에서 이미지로의 확산 모델에 전달한다. 또한 작업별 시각 모듈과 다중모odal 설명을 사용하는 해석 가능한 평가 프레임워크인 VPEval를 제안한다. VPGen는 객체 수, 공간 관계, 척도에 대해 뛰어난 제어력을 보이며, VPEval는 단일 모델 기반 보다 높은 인간 관련도를 보인다.
As large language models have demonstrated impressive performance in many domains, recent works have adopted language models (LMs) as controllers of visual modules for vision-and-language tasks. While existing work focuses on equipping LMs with visual understanding, we propose two novel interpretable/explainable visual programming frameworks for text-to-image (T2I) generation and evaluation. First, we introduce VPGen, an interpretable step-by-step T2I generation framework that decomposes T2I generation into three steps: object/count generation, layout generation, and image generation. We employ an LM to handle the first two steps (object/count generation and layout generation), by finetuning it on text-layout pairs. Our step-by-step T2I generation framework provides stronger spatial control than end-to-end models, the dominant approach for this task. Furthermore, we leverage the world knowledge of pretrained LMs, overcoming the limitation of previous layout-guided T2I works that can only handle predefined object classes. We demonstrate that our VPGen has improved control in counts/spatial relations/scales of objects than state-of-the-art T2I generation models. Second, we introduce VPEval, an interpretable and explainable evaluation framework for T2I generation based on visual programming. Unlike previous T2I evaluations with a single scoring model that is accurate in some skills but unreliable in others, VPEval produces evaluation programs that invoke a set of visual modules that are experts in different skills, and also provides visual+textual explanations of the evaluation results. Our analysis shows that VPEval provides a more human-correlated evaluation for skill-specific and open-ended prompts than widely used single model-based evaluation. We hope that our work encourages future progress on interpretable/explainable generation and evaluation for T2I models.
연구 동기 및 목표
- 엔드 투 엔드 T2I 모델이 공간 관계, 객체 수, 그리고 알려지지 않은 객체 클래스를 다루는 데에 한계가 있음을 고려해, 작업을 모듈화되고 단계적인 시각적 프로그래밍 구성요소로 분해함으로써 해석 가능하고 제어 가능한 텍스트에서 이미지로의 생성을 해결하고자 한다.
- 엔드 투 엔드 T2I 모델이 공간 관계, 객체 수, 그리고 알려지지 않은 객체 클래스를 다루는 데에 한계가 있음을 고려해, 작업을 모듈화되고 단계적인 시각적 프로그래밍 구성요소로 분해함으로써 해석 가능하고 제어 가능한 텍스트에서 이미지로의 생성을 해결하고자 한다.
- 해석 가능하고 기술별 평가가 가능한 평가 프레임워크를 개발하여, 시각적 및 텍스트적 근거를 제공함으로써 인간 판단과의 일치도를 향상시키고자 한다.
- 대규모 언어 모델의 세계 지식을 활용하여 T2I 생성에서 더 강력한 공간적 및 의미적 제어를 가능하게 하고자 한다.
- 전문 시각 모듈을 사용하는 모듈화된 프로그래밍 기반 평가가 단일 모델 평가 기반보다 인간 관련도가 높다는 것을 입증하고자 한다.
제안 방법
- VPGen은 T2I 생성을 세 단계로 분해한다: 객체/수량 생성, 레이아웃 생성, 이미지 생성이며, 각 단계는 전용 구성요소로 실행된다.
- 미세조정된 Vicuna 언어 모델이 텍스트 프롬프트에서 객체 목록과 공간 레이아웃을 생성하며, 사전 훈련된 세계 지식을 활용하여 알려지지 않은 객체에 대해서도 처리한다.
- 레이아웃에서 이미지로의 확산 모델(Gligen 등)은 예측된 레이아웃을 기반으로 최종 이미지를 생성하여 고해상도 이미지 합성을 가능하게 한다.
- VPEval는 프롬프트 의미에 따라 동적으로 전문화된 시각 모듈(예: 객체 검출기, 깊이 추정기, VQA 모델 등)을 호출하는 평가 프로그램을 구성한다.
- 각 평가 모듈은 평가의 근거가 되는 시각적 및 텍스트적 설명을 제공하여, 생성된 이미지에 대한 해석 가능하고 다중 기술 평가를 가능하게 한다.
- 대규모 언어 모델(GPT-3.5-Turbo)은 애초에 애너테이션된 프로그램에 대한 미세조정 없이도 개방형 프롬프트에 대해 실시간으로 평가 프로그램을 생성한다.
실험 결과
연구 질문
- RQ1엔드 투 엔드 모델 대비 단계적 시각적 프로그래밍 프레임워크가 텍스트에서 이미지로의 생성에서 공간적 및 의미적 제어력을 향상시키는가?
- RQ2언어 모델의 세계 지식이 레이아웃 기반 T2I 생성에서 알려지지 않은 객체 클래스로의 일반화를 얼마나 향상시킬 수 있는가?
- RQ3전문 시각 모듈을 활용하는 모듈화된 평가 프레임워크가 단일 모델 평가 기반보다 인간 관련도가 더 높은가?
- RQ4시각적 및 텍스트적 설명의 조합이 T2I 평가의 해석 가능성과 신뢰성 향상에 얼마나 효과적인가?
- RQ5전문가 시각 모듈을 사용하는 평가를 위한 동적 프로그램 생성이 비용이 많이 드는 애너테이션에 대한 미세조정 없이도 높은 정확도와 커버리지를 유지할 수 있는가?
주요 결과
- VPGen은 객체 수, 공간 관계, 척도에 대해 정확도가 높은 생성을 보이며, 레이아웃 제어력이 뛰어나 강력한 베이스라인인 Stable Diffusion를 능가한다.
- 기술 기반 프롬프트에서 VPGen은 Count(63.7), Spatial(63.8), Scale(51.2) 기술에서 베이스라인을 초월했으며, VPEval †는 Scale에서 79.0의 점수를 기록했다.
- 기술 기반 프롬프트에서 VPEval는 인간 평가와의 상관계수 66.6을 기록했으며, CLIP(33.2), 캡션 메트릭(bleu-4: 18.3), VQA(55.9) 베이스라인보다 유의미하게 높았다.
- 개방형 프롬프트에서 VPEval는 인간 판단과 스피어만 상관계수 ρ 56.9를 기록했으며, 더 강력한 VQA 모듈을 사용한 VPEval †에서는 60.3으로 향상되었다.
- 인간 평가 결과는 거의 완벽한 평가자 간 일치도(κ = 0.85, α = 0.85)를 보였으며, VPEval 평가에 사용된 인간 판단의 신뢰성을 검증했다.
- 프로그램 충실도 분석 결과, 프롬프트 요소의 높은 커버리지와 높은 모듈별 정확도를 확인하여, 프로그램 생성 및 실행의 강건성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.