[논문 리뷰] Holistic Evaluation of Text-To-Image Models
논문은 HEIM을 소개합니다, 62개 시나리오와 인간+자동 지표를 사용하여 26개 텍스트-이미지 모델을 12가지 측면으로 평가하는 포괄적 벤치마크이며, 다양한 모델의 강점이 분포하고 인간과 자동 측정 간의 상관관계가 일반적으로 약하다는 것을 보여줍니다.
The stunning qualitative improvement of recent text-to-image models has led to their widespread attention and adoption. However, we lack a comprehensive quantitative understanding of their capabilities and risks. To fill this gap, we introduce a new benchmark, Holistic Evaluation of Text-to-Image Models (HEIM). Whereas previous evaluations focus mostly on text-image alignment and image quality, we identify 12 aspects, including text-image alignment, image quality, aesthetics, originality, reasoning, knowledge, bias, toxicity, fairness, robustness, multilinguality, and efficiency. We curate 62 scenarios encompassing these aspects and evaluate 26 state-of-the-art text-to-image models on this benchmark. Our results reveal that no single model excels in all aspects, with different models demonstrating different strengths. We release the generated images and human evaluation results for full transparency at https://crfm.stanford.edu/heim/v1.1.0 and the code at https://github.com/stanford-crfm/helm, which is integrated with the HELM codebase.
연구 동기 및 목표
- 이미지 품질과 정합성 Beyond으로 텍스트-이미지 모델을 평가하는 포괄적 벤치마크를 수립한다.
- 바이어스, 독성, 공정성, 다국어성, 효율성 등을 포함한 12개 차원을 평가하여 실제 적용 가능성을 확보한다.
- 다양한 모델과 시나리오에 걸친 표준화되고 투명한 평가를 제공한다.
- 다양하고 현실적인 프롬프트 작업에서 서로 다른 모델의 성능 차이에 대한 통찰을 제공한다.
제안 방법
- 12개의 평가 측면과 62개의 프롬프트 시나리오(프롬프트와 참조)를 정의하여 광범위한 능력과 위험을 다룬다.
- 각 측면을 평가하기 위해 인간 판단(크라우드소스)과 자동 측정치를 결합한 25개의 지표를 사용한다.
- 제로샷 프롬핑과 일반적 적응 전략 하에서 26개의 최신 텍스트-이미지 모델에 대한 평가를 표준화한다.
- 원본성, 미학, 편향, 공정성, 다국어성, 강건성, 효율성과 같은 아직 탐구가 부족한 측면을 위한 새로운 시나리오와 지표를 큐레이션한다.
- 투명성과 재현성을 위해 생성된 이미지, 인간 결과물, 평가 코드를 공개한다.

실험 결과
연구 질문
- RQ1최첨단 텍스트-이미지 모델은 전통적인 정합성과 품질을 넘어 광범위한 포괄적 측면에서 어떻게 성능을 나타내는가?
- RQ2이 모델들을 평가할 때 인간 판단과 자동 측정치 간의 관계는 어떠한가?
- RQ3다양한 측면에서 강점과 약점을 보이는 모델은 어떤 것이며, 현재 능력에서 어떤 윤리적/사회적 위험이 나타나는가?
- RQ4다국어성, 강건성, 효율성과 같은 요인이 텍스트-이미지 모델의 실제 배치에 어떤 영향을 미치는가?
주요 결과
- 어떤 단일 모델도 모든 측면에서 뛰어나지 않다; 서로 다른 모델은 각기 다른 강점을 보인다(예: 정합성은 DALL-E 2, 미학은 Openjourney, 편향/독성 완화는 minDALL-E와 Safe Stable Diffusion).
- 인간 지표와 자동 지표 간의 상관관계는 일반적으로 약하며, 특히 사진현실성(포토리얼리즘)과 미학에서 약해 인간 평가의 가치가 강조된다.
- 여러 측면은 더 많은 주의가 필요하다: 추론과 다국어성은 다른 측면에 비해 뒤처지는 반면, 독창성, 독성, 편향은 윤리적/법적 문제를 제기한다.
- 프롬프트 엔지니어링은 시각적 매력을 향상시키고, Promptist+Stable Diffusion은 정합성을 유지하면서 미학에서 우수한 성과를 보인다.
- 아트-미세조정된 모델은 미학이나 현실감에서 뛰어나지만 정합성이나 편향 완화와 같은 다른 측면과의 trade-off를 보일 수 있다.
- DALL-E 2는 인간 정합성 면에서 종종 선두를 차지하지만 사회적 또는 다국어적 측면의 모든 영역을 지배하는 모델은 없다; 서로 다른 모델들이 상보적인 강점을 제공한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.