Skip to main content
QUICK REVIEW

[论文解读] AGIQA-3K: An Open Database for AI-Generated Image Quality Assessment

Chunyi Li, Zicheng Zhang|arXiv (Cornell University)|Jun 7, 2023
Image Retrieval and Classification Techniques被引用 4
一句话总结

本文提出了 AGIQA-3K,这是目前最大的开放性 AI 生成图像(AGI)质量评估数据库,包含来自六种不同文本到图像模型的 2,982 幅图像。该研究为感知质量与文本到图像对齐度建立了细粒度的主观评分,并提出了一种新型度量方法 StairReward,其在对齐度评估性能上显著优于现有方法,在最具挑战性的子集上实现了 0.8713 的 PLCC 值。

ABSTRACT

With the rapid advancements of the text-to-image generative model, AI-generated images (AGIs) have been widely applied to entertainment, education, social media, etc. However, considering the large quality variance among different AGIs, there is an urgent need for quality models that are consistent with human subjective ratings. To address this issue, we extensively consider various popular AGI models, generated AGI through different prompts and model parameters, and collected subjective scores at the perceptual quality and text-to-image alignment, thus building the most comprehensive AGI subjective quality database AGIQA-3K so far. Furthermore, we conduct a benchmark experiment on this database to evaluate the consistency between the current Image Quality Assessment (IQA) model and human perception, while proposing StairReward that significantly improves the assessment performance of subjective text-to-image alignment. We believe that the fine-grained subjective scores in AGIQA-3K will inspire subsequent AGI quality models to fit human subjective perception mechanisms at both perception and alignment levels and to optimize the generation result of future AGI models. The database is released on https://github.com/lcysyzxdxc/AGIQA-3k-Database.

研究动机与目标

  • 为解决在多种模型和提示下,AI 生成图像(AGI)缺乏全面且细粒度的主观质量数据库的问题。
  • 建立一个标准化的、大规模的主观评估框架,用于 AGI 的感知质量与文本到图像对齐度评估。
  • 将现有图像质量评估(IQA)模型与人类感知进行基准对比,识别性能差距。
  • 提出并验证 StairReward,一种新型度量方法,可提升 AGI 中文本到图像对齐度的客观评估性能。
  • 为未来更符合人类感知机制的 AGI 质量模型提供基础。

提出的方法

  • 作者使用六种不同的文本到图像模型(包括基于 GAN、自回归和扩散模型的架构)收集了 2,982 幅 AGI 图像,覆盖多种提示和模型参数。
  • 通过标准化的实验室主观实验,收集了感知质量与文本到图像对齐度的平均意见得分(MOS)。
  • 该数据库包含多维度的细粒度标注,涵盖多样化的风格与提示复杂度,以确保广泛的代表性。
  • 提出 StairReward 作为新型对齐度度量方法,通过提示词分割与图像块级特征分析,更好地捕捉语义对齐。
  • 在 AGIQA-3K 上开展基准实验,评估客观度量与人类主观评分之间的相关性(SRoCC、KRoCC、PLCC)。
  • 进行消融实验以验证 StairReward 中各组件的贡献,确认词级别分割与图像块处理均至关重要。

实验结果

研究问题

  • RQ1现有 IQA 模型在评估 AGI 的感知质量与文本到图像对齐度方面,相较于人类主观评分表现如何?
  • RQ2当前度量方法在区分质量相近的 AGI 图像(尤其是同一生成模型内)方面的能力如何,特别是在不同提示长度下?
  • RQ3能否设计一种新度量方法,显著提升 AGI 中文本到图像对齐度的客观评估性能?
  • RQ4哪些组件对提升对齐度评估性能最为关键?它们各自贡献如何?
  • RQ5不同提示风格与图像内容类型下,对齐度度量方法的性能表现有何差异?

主要发现

  • StairReward 在 'No Style' 子集上实现了 0.8713 的 PLCC,显著优于现有度量方法如 ImageReward(PLCC:0.7743)和 CLIP(PLCC:0.6867)。
  • 在所有四个提示长度子集中,StairReward 均优于所有基线度量方法,尤其在 'Abstract & Sci-fi Style' 子集上达到最高的 SRoCC(0.7682)与 PLCC(0.8468)。
  • 现有基于感知的 IQA 模型与人类感知具有较强相关性(PLCC > 0.7),但对齐度模型表现显著落后,表明亟需改进。
  • 消融实验确认,提示词分割与图像块级处理均为必要组件,任一缺失均导致所有度量指标性能下降。
  • 数据库显示,即使在相同模型下,图像质量也因提示与参数不同而存在显著差异,凸显了对鲁棒、细粒度评估工具的迫切需求。
  • AGIQA-3K 是迄今为止最全面的多模型、多维 AGI 质量数据库,涵盖 GAN、自回归与扩散模型,并提供细粒度主观评分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。