[论文解读] Approximating Human Judgment of Generated Image Quality
本文提出了一种新颖的自动化方法,通过将 Inception-V3 网络的深层特征嵌入回归到人工标注的质量评分,以预测人类对图像真实感的判断。该方法在保留的测试集上达到 66.4% 的准确率——与人类评分者间的一致性相当,表明其在多种生成模型中与感知质量具有高度一致性。
Generative models have made immense progress in recent years, particularly in their ability to generate high quality images. However, that quality has been difficult to evaluate rigorously, with evaluation dominated by heuristic approaches that do not correlate well with human judgment, such as the Inception Score and Fréchet Inception Distance. Real human labels have also been used in evaluation, but are inefficient and expensive to collect for each image. Here, we present a novel method to automatically evaluate images based on their quality as perceived by humans. By not only generating image embeddings from Inception network activations and comparing them to the activations for real images, of which other methods perform a variant, but also regressing the activation statistics to match gold standard human labels, we demonstrate 66% accuracy in predicting human scores of image realism, matching the human inter-rater agreement rate. Our approach also generalizes across generative models, suggesting the potential for capturing a model-agnostic measure of image quality. We open source our dataset of human labels for the advancement of research and techniques in this area.
研究动机与目标
- 解决当前缺乏能与生成模型中人类感知图像真实感相关联的高效、样本级度量的问题。
- 克服现有自动化度量(如 Inception Score 和 FID)在样本级别与人类判断相关性不佳的局限性。
- 开发一种与模型无关的评估方法,可泛化应用于不同生成模型和数据集。
- 通过在深层特征嵌入和人工标注的真实感评分上进行训练,弥合自动化度量与人类感知之间的差距。
- 实现在无需为每张图像都进行昂贵人工标注的前提下,实现可扩展、可靠的图像质量评估。
提出的方法
- 使用 HYPE 框架收集人工真实感判断,该框架通过二元真实/虚假分类任务呈现图像,以估计感知真实感。
- 从在 ImageNet 上预训练的 Inception-V3 网络中提取七层(如 Mixed_5d、Mixed_6e、FC)的多层特征嵌入。
- 对于每张测试图像,计算其激活图与训练集中真实图像激活图之间的空间局部最近邻距离。
- 将这些距离在空间位置上聚合,形成每层的单一实值嵌入,从而为每张图像构建多维表示。
- 训练回归模型,将这些多层嵌入映射到人工标注的真实感评分,同时利用特征相似性和人类判断作为监督信号。
- 使用最终模型预测反映人类感知的样本级真实感评分,并通过与人工标签对比的分类准确率评估性能。
实验结果
研究问题
- RQ1在同时使用深层特征嵌入和人工标注的真实感评分进行训练的深度学习模型,能否准确预测人类对图像质量的判断?
- RQ2该方法在不同生成模型(如 ProGAN 与 StyleGAN)以及未见数据分布上的泛化能力如何?
- RQ3该模型的性能在多大程度上与人类评分者间对图像真实感的一致性相关?
- RQ4该方法能否实现与人类感知高度相关的样本级评估,而不同于仅评估大规模分布的 FID 或 IS 等总体度量?
- RQ5结合基于特征的相似性与人工标注评分,是否能提升自动化图像质量度量的预测能力?
主要发现
- 所提方法在来自同一生成模型(StyleGAN)的保留测试集上,对人工标注图像真实感的预测准确率达到 66.4%,与人类评分者间一致性的上限(65.5%)相当。
- 在来自不同生成模型(ProGAN)的分布外样本上,模型准确率达到 58.8%,与人类评分者间一致性的 58.9% 密切吻合。
- 该模型在不同生成模型间具有良好泛化能力,表明其具备作为与模型无关的真实感度量的潜力。
- 通过结合多层特征嵌入与人工标注评分,性能显著提升,优于仅依赖特征统计量的方法。
- 该方法提供样本级真实感评分,而 FID 或 IS 仅评估大规模分布的模型级性能。
- 作者发布了其人工标注的数据集,以支持未来在人类对齐的图像质量评估方面的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。