Skip to main content
QUICK REVIEW

[논문 리뷰] ImagenHub: Standardizing the evaluation of conditional image generation models

Max Ku, Tianle Li|arXiv (Cornell University)|2023. 10. 02.
Virtual Reality Applications and ImpactsComputer Science인용 수 3
한 줄 요약

ImagenHub는 조건부 이미지 생성 모델을 위한 표준화된 벤치마크를 제안하며, 정교하게 선별된 데이터셋, 통합된 추론 라이브러리, 그리고 의미 일관성과 인지적 품질 점수를 포함한 인간 평가를 통해 평가를 통합한다. 이는 74%의 모델이 총점 0.5 이하로 평가되었으며, 주제 중심 생성을 제외한 모든 자동 평가 지표는 인간 평가와 잘 관련되지 않음을 드러낸다.

ABSTRACT

Recently, a myriad of conditional image generation and editing models have been developed to serve different downstream tasks, including text-to-image generation, text-guided image editing, subject-driven image generation, control-guided image generation, etc. However, we observe huge inconsistencies in experimental conditions: datasets, inference, and evaluation metrics - render fair comparisons difficult. This paper proposes ImagenHub, which is a one-stop library to standardize the inference and evaluation of all the conditional image generation models. Firstly, we define seven prominent tasks and curate high-quality evaluation datasets for them. Secondly, we built a unified inference pipeline to ensure fair comparison. Thirdly, we design two human evaluation scores, i.e. Semantic Consistency and Perceptual Quality, along with comprehensive guidelines to evaluate generated images. We train expert raters to evaluate the model outputs based on the proposed metrics. Our human evaluation achieves a high inter-worker agreement of Krippendorff's alpha on 76% models with a value higher than 0.4. We comprehensively evaluated a total of around 30 models and observed three key takeaways: (1) the existing models' performance is generally unsatisfying except for Text-guided Image Generation and Subject-driven Image Generation, with 74% models achieving an overall score lower than 0.5. (2) we examined the claims from published papers and found 83% of them hold with a few exceptions. (3) None of the existing automatic metrics has a Spearman's correlation higher than 0.2 except subject-driven image generation. Moving forward, we will continue our efforts to evaluate newly published models and update our leaderboard to keep track of the progress in conditional image generation.

연구 동기 및 목표

  • 일관되지 않은 데이터셋, 추론 프로토콜, 인간 평가 방법으로 인해 조건부 이미지 생성 분야에서 공정하고 일관된 평가가 부족한 문제를 해결한다.
  • 모델 간 공정한 비교를 가능하게 하기 위해 중앙집중식이고 재현 가능한 벤치마크를 구축한다.
  • 높은 평가자 간 일치도를 확보하기 위해 확장 가능한 인간 평가 프레임워크를 개발하여 신뢰할 수 있는 모델 평가를 보장한다.
  • 분야 내 진전을 추적하기 위해 지속적으로 업데이트되는 랭킹을 구축한다.
  • 표준화된 재평가를 통해 발표된 연구에서의 오해의 소지가 있는 주장들을 식별하고 수정한다.

제안 방법

  • 모델 간 입력 조건을 통일하기 위해 고품질의 작업별 특화 평가 데이터셋 7종(각각 100~200개의 인스턴스)을 선별했다.
  • 모델 추론의 공정성과 재현 가능성을 보장하기 위해 하이퍼파라미터와 프롬프트 형식을 고정한 통합된 추론 라이브러리를 구축했다.
  • 명확한 체크리스트 기반 지침을 사용해, 의미 일관성과 인지적 품질이라는 두 가지 3단계 평가 지표를 설계했다.
  • 제안된 지표를 사용해 전문 평가자들이 모델 출력을 평가하도록 훈련시켜, 76%의 모델에서 Krippendorff’s alpha > 0.4의 높은 평가자 간 일치도를 달성했다.
  • 의미 일관성과 인지적 품질의 기하 평균을 사용해 성능이 균형 잡히지 않은 모델를 보다 엄격하게 평가하기 위해 총점 수치를 계산했다.
  • 메트릭의 세분성 최적화를 위해 분석 실험을 수행하여, 신뢰성과 실용성의 균형을 고려해 두 메트릭 모두 [0, 0.5, 1] 척도를 최종 결정했다.

실험 결과

연구 질문

  • RQ1기존의 조건부 이미지 생성 모델들이 표준화된 평가 조건에서 일관되게 성능을 내는가?
  • RQ2명확한 지침과 평가자 간 일치도를 확보했을 때 인간 평가의 신뢰성은 어느 정도인가?
  • RQ3다양한 조건부 이미지 생성 작업에서 인간 평가 점수와 가장 잘 관련된 자동 평가 지표는 무엇인가?
  • RQ4출판된 연구에서의 모델 성능에 대한 주장들이 표준화된 재평가를 통해 얼마나 자주 검증되는가?
  • RQ5통합된, 지속적으로 업데이트되는 벤치마크는 조건부 이미지 생성 분야에서 재현 가능성 향상과 진전 추적에 기여하는가?

주요 결과

  • 평가된 30개 모델 중 74%가 전체 인간 평가 지표에서 0.5 이하로 평가되어 대부분의 작업에서 만족스럽지 못한 성능을 보였다.
  • 전체 점수 0.7를 초과한 모델는 총 5개(30개 중 17%)에 불과하여 향후 성능 향상 여지가 크다는 점을 시사한다.
  • 출판된 연구에서의 성능에 대한 주장 중 83%가 ImagenHub의 표준화된 프로토콜을 사용한 재평가를 통해 확인되었다.
  • 대부분의 작업에서 인간 평가와의 스피어만 상관계수 0.2를 초과하는 자동 평가 지표는 존재하지 않았으며, 주제 중심 생성을 제외한 모든 작업에서 그러한 지표는 존재하지 않았다.
  • 의미 일관성과 인지적 품질의 기하 평균은 성능이 균형 잡히지 않은 모델가 성능을 과도하게 높이는 것을 방지하는 데 더 우수한 성능을 보였다.
  • 인간 평가의 [0, 0.5, 1] 척도가 평가자 간 일치도와 실용성의 최적의 균형을 이룩하여, [0,1] 및 [0,0.5,1,2] 척도보다 높은 신뢰성을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.