Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Text-to-Visual Generation with Image-to-Text Generation

Zhiqiu Lin, Deepak Pathak|arXiv (Cornell University)|2024. 04. 01.
Digital Humanities and ScholarshipArts and Humanities인용 수 3
한 줄 요약

이 논문은 텍스트-시각 생성을 평가하기 위한 새로운 메트릭인 VQAScore를 소개한다. 이 메트릭은 '이 그림이 {text}를 보여주나요?'라는 질문에 '예'라고 대답할 확률을 계산하기 위해 시각질문응답(VQA) 모델을 사용한다. 단순함에도 불구하고, 특히 커스텀 양방향 인코더(CLIP-FlanT5)로 구현했을 때, 여러 벤치마크에서 기존의 CLIPScore나 GPT-4V와 같은 전용 모델을 뛰어넘는 최신 기술 수준의 성능을 달성하며, 영상 및 3D 생성으로까지 일반화된다.

ABSTRACT

Despite significant progress in generative AI, comprehensive evaluation remains challenging because of the lack of effective metrics and standardized benchmarks. For instance, the widely-used CLIPScore measures the alignment between a (generated) image and text prompt, but it fails to produce reliable scores for complex prompts involving compositions of objects, attributes, and relations. One reason is that text encoders of CLIP can notoriously act as a "bag of words", conflating prompts such as "the horse is eating the grass" with "the grass is eating the horse". To address this, we introduce the VQAScore, which uses a visual-question-answering (VQA) model to produce an alignment score by computing the probability of a "Yes" answer to a simple "Does this figure show '{text}'?" question. Though simpler than prior art, VQAScore computed with off-the-shelf models produces state-of-the-art results across many (8) image-text alignment benchmarks. We also compute VQAScore with an in-house model that follows best practices in the literature. For example, we use a bidirectional image-question encoder that allows image embeddings to depend on the question being asked (and vice versa). Our in-house model, CLIP-FlanT5, outperforms even the strongest baselines that make use of the proprietary GPT-4V. Interestingly, although we train with only images, VQAScore can also align text with video and 3D models. VQAScore allows researchers to benchmark text-to-visual generation using complex texts that capture the compositional structure of real-world prompts. We introduce GenAI-Bench, a more challenging benchmark with 1,600 compositional text prompts that require parsing scenes, objects, attributes, relationships, and high-order reasoning like comparison and logic. GenAI-Bench also offers over 15,000 human ratings for leading image and video generation models such as Stable Diffusion, DALL-E 3, and Gen2.

연구 동기 및 목표

  • 복합적이고 구성적인 프롬프트에 대해 신뢰할 수 있고 강력한 평가 메트릭이 부족한 문제를 해결하기 위해.
  • 기존 메트릭인 CLIPScore와 같이 '단어의 집합' 방식으로 작동해 구성적 구조를 포착하지 못하는 한계를 극복하기 위해.
  • 복합적인 시각적 추론 작업에서 인간의 판단과 더 잘 일치하는 스케일러블하고 참조 기반 평가 방법을 개발하기 위해.
  • 1,600개의 구성적 프롬프트와 15,000개의 인간 평가를 포함하는 최신 이미지 및 영상 모델을 평가하기 위한 새로운 벤치마크인 GenAI-Bench를 개발하고 공개하기 위해.
  • 적절히 설계되고 적용될 경우, 오프더쇼프 VQA 모델조차도 더 복잡한 전용 기반 모델을 능가할 수 있음을 입증하기 위해.

제안 방법

  • 텍스트-이미지 생성 평가를 위한 參考 없는 메트릭으로 VQAScore를 제안하며, '이 그림이 {text}를 보여주나요? 예 또는 아니요로 대답하십시오.'라는 질문에 '예'에 대한 확률을 계산한다.
  • 이미지와 질문 토큰을 모두 인코딩하기 위해 시각질문응답(VQA) 모델을 사용하며, 이미지와 텍스트 간 상호 주의를 가능하게 하는 양방향 인코더를 활용한다.
  • 오프더쇼프 모델(예: InstructBLIP, LLaVA-1.5)과 커스텀 모델인 CLIP-FlanT5를 사용해 VQAScore를 구현하며, CLIP 이미지 특징와 FlanT5를 조합해 더 나은 교차 주의를 확보한다.
  • 다중 프레임 또는 시야에 대한 평균 스코어를 계산해 텍스트-이미지, 텍스트-영상, 텍스트-3D 생성을 평가하는 데 적용한다.
  • 객체, 속성, 관계, 논리적 추론을 해석해야 하는 1,600개의 구성적 프롬프트를 포함한 벤치마크인 GenAI-Bench를 설계하고 공개한다.
  • 영상의 경우 프레임 샘플링, 3D의 경우 시야 샘플링에 대한 분석을 통해 최소한의 샘플링으로도 거의 최적의 성능을 달성할 수 있음을 입증한다.

실험 결과

연구 질문

  • RQ1간단한 VQA 기반 메트릭이 복합적 텍스트-시각 생성을 평가하는 데 있어 기존의 CLIPScore와 같은 메트릭을 능가할 수 있는가?
  • RQ2적절히 아키텍처를 설계한 오프더쇼프 VQA 모델이 GPT-4V와 같은 전용 모델의 성능을 따라잡거나 뛰어넘을 수 있는가?
  • RQ3VQAScore는 영상 및 3D 생성을 포함한 다양한 모odal로 일반화되는가?
  • RQ4양방향 이미지-질문 인코더가 자동회귀형 인코더에 비해 정렬 스코어링 성능을 크게 향상시키는가?
  • RQ5복합적이고 구성적인 프롬프트에서 단순한 객체 인식을 넘어서 추론이 필요한 복잡한 상황에서 VQAScore는 인간 평가와 높은 일치도를 달성할 수 있는가?

주요 결과

  • CLIP-FlanT5 모델을 사용해 계산한 VQAScore는 텍스트-이미지 벤치마크에서 새로운 최고 성능인 83.1의 쌍별 정확도를 기록하며, GPT-4V 기반 방법을 뛰어넘었다.
  • 3D 자산의 단일 3x3 그리드 시야만으로도 VQAScore는 StanfordT23D에서 68.4의 쌍별 정확도를 달성했으며, 120개의 시야에서 얻은 68.6 점과 거의 동일한 성능을 보였다.
  • 3초 영상에서 단지 네 개의 프레임을 샘플링하기만 해도 CLIP-FlanT5로 66.5의 쌍별 정확도를 기록했으며, 전체 36개 프레임에서 얻은 66.5 점과 매우 유사한 성능을 보였다.
  • 오프더쇼프 LLaVA-1.5를 사용한 VQAScore는 텍스트-이미지 벤치마크에서 82.4의 쌍별 정확도를 기록했으며, CLIPScore(77.8)와 다른 참조 기반 메트릭을 모두 능가했다.
  • 커스텀 CLIP-FlanT5 모델은 텍스트-영상 벤치마크인 EvalCrafter에서 65.4의 쌍별 정확도를 기록했으며, InstructBLIP(65.4)와 LLaVA-1.5(63.2)를 모두 뛰어넘었다.
  • GenAI-Bench에서의 인간 평가 결과와 VQAScore 간의 상관계수가 높게 나타나, 복잡한 구성적 프롬프트에서 인간 판단과의 일치도를 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.