Skip to main content
QUICK REVIEW

[논문 리뷰] Human Evaluation of Text-to-Image Models on a Multi-Task Benchmark

Vitali Petsiuk, Alexander E. Siemenn|arXiv (Cornell University)|2022. 11. 22.
Multimodal Machine Learning Applications인용 수 13
한 줄 요약

이 논문은 계산, 공간적 추론, 속성 일치 등 다양한 능력을 포함하는 32개의 과제를 포함하는 텍스트-이미지 모델 평가를 위한 새로운 다중 과제 벤치마크를 소개한다. 3,600건의 인간 평가 평가 결과, DALL-E 2는 계산(65.7% 대 54.4%)과 얼굴 생성(81.7% 대 70.2%)에서 Stable Diffusion를 앞서며 성능을 냈고, 형태 생성 과제에서는 Stable Diffusion가 약간 우위(57.6% 대 56.8%)를 보였다.

ABSTRACT

We provide a new multi-task benchmark for evaluating text-to-image models. We perform a human evaluation comparing the most common open-source (Stable Diffusion) and commercial (DALL-E 2) models. Twenty computer science AI graduate students evaluated the two models, on three tasks, at three difficulty levels, across ten prompts each, providing 3,600 ratings. Text-to-image generation has seen rapid progress to the point that many recent models have demonstrated their ability to create realistic high-resolution images for various prompts. However, current text-to-image methods and the broader body of research in vision-language understanding still struggle with intricate text prompts that contain many objects with multiple attributes and relationships. We introduce a new text-to-image benchmark that contains a suite of thirty-two tasks over multiple applications that capture a model's ability to handle different features of a text prompt. For example, asking a model to generate a varying number of the same object to measure its ability to count or providing a text prompt with several objects that each have a different attribute to identify its ability to match objects and attributes correctly. Rather than subjectively evaluating text-to-image results on a set of prompts, our new multi-task benchmark consists of challenge tasks at three difficulty levels (easy, medium, and hard) and human ratings for each generated image.

연구 동기 및 목표

  • 복합적인 프롬프트 이해 능력을 반영하는 종합적이고 철저한 텍스트-이미지 모델 평가 프로토콜의 부족을 해결하기 위해.
  • 단순한 이미지 품질을 넘어서 구성적 추론, 속성 일치, 일반 지식 등을 포함한 다양한 모델 능력을 테스트할 수 있는 벤치마크를 개발하기 위해.
  • DALL-E 2와 Stable Diffusion와 같은 주요 모델 간에 성능의 다차원적 비교를 공정하게 가능하게 하기 위해.
  • 미래의 모델을 평가하고 특정 강점과 한계를 파악하는 데 사용할 수 있는 확장 가능하고 체계적인 평가 프레임워크를 제공하기 위해.

제안 방법

  • 계산, 공간 배치, 속성 매칭 등 텍스트-이미지 모델의 특정 능력을 향한 32개의 별도 과제를 포함하는 다중 과제 벤치마크를 설계하기 위해.
  • 각 과제를 쉬움, 보통, 어려움의 세 가지 난이도 수준으로 나누고, 각 수준에 대해 10개의 고유한 프롬프트를 사용하여 과제당 총 30개의 프롬프트를 구성하기 위해.
  • 이미지 품질과 일치도를 평가하기 위해 20명의 컴퓨터 과학 대학원생으로부터 1~5점 척도(1 = 최악, 5 = 최고)로 인간 평가를 수집하기 위해.
  • 동일한 기본 설정을 사용해 DALL-E 2(상용)와 Stable Diffusion(오픈소스) 두 주요 모델을 모두의 프롬프트에 대해 평가하기 위해.
  • 성능을 과제 및 난이도 수준별로 정규화하고 백분율 점수로 보고하여 직접 비교가 가능하도록 하기 위해.
  • 일반 지식, 편향, 희귀 동시 발생 등 주관적인 판단이 필요한 과제는 인간 평가를 사용하며, 일부 과제(예: OCR, 공간적 추론)는 신경망 도구를 통해 자동화할 수 있음을 고려하기 위해.

실험 결과

연구 질문

  • RQ1주요 텍스트-이미지 모델들은 기본적인 이미지 생성을 넘어서 다양한 구성적 추론 과제에서 어떻게 성능을 내는가?
  • RQ2계산, 공간적 관계, 속성 일치를 포함한 복잡한 프롬프트를 처리할 때 DALL-E 2와 Stable Diffusion의 상대적 강점과 약점은 무엇인가?
  • RQ3과제 난이도가 증가함에 따라 성능이 어떻게 떨어지는가? 그리고 어떤 과제에서는 한 모델이 항상 另 하나를 앞서는가?
  • RQ4표준화된 다중 과제 인간 평가 프레임워크가 향후 텍스트-이미지 모델 평가의 신뢰할 수 있는 황금 표준이 될 수 있는가?
  • RQ5어떤 상황에서는 인간 평가가 필수적이고, 언제는 자동화된 메트릭스나 신경망 도구로 대체할 수 있는가?

주요 결과

  • DALL-E 2는 계산 과제에서 65.7%의 정규화된 평가 점수를 기록하며, Stable Diffusion의 54.4%보다 유의미하게 높은 성능을 보였다.
  • 얼굴 과제에서 DALL-E 2는 81.7%를 기록했고, Stable Diffusion는 70.2%를 기록하여 현실적이며 잘 일치된 얼굴 이미지를 생성하는 데서 뛰어난 성능을 보였다.
  • 형태 과제에서는 Stable Diffusion가 57.6%로 DALL-E 2의 56.8%보다 약간 높은 성능을 보여, 기하학적 형태 생성에서 더 우수한 일반화 능력을 지녔음을 시사했다.
  • 난이도가 증가함에 따라 성능이 떨어지지만, DALL-E 2는 중급 수준 대비 어려운 형태 과제에서 약간의 성능 향상을 보였다.
  • 9개의 하위 과제(3개 과제 × 3개 난이도 수준)에서 DALL-E 2는 6개 과제에서 Stable Diffusion를 앞서며, 복잡한 구성적 생성 능력에서의 일관된 우월성을 보였다.
  • 벤치마크는 모델 행동의 미묘한 차이를 효과적으로 포착했으며, 이는 모델 선택이 일반적인 이미지 품질이 아닌 특정 응용 요구사항에 따라 이뤄져야 한다는 점을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.