Skip to main content
QUICK REVIEW

[论文解读] Imagen 3

Imagen-Team-Google, :|arXiv (Cornell University)|Aug 13, 2024
Radiomics and Machine Learning in Medical ImagingMedicine被引用 3
一句话总结

Imagen 3 是一种先进的潜在扩散模型,能够生成高分辨率(1024×1024)的文本到图像输出,具有极高的逼真度和对提示的准确遵循。该模型在经过筛选的多样化数据集上进行训练,数据集包含由 Gemini 模型生成的合成字幕,其在人类评估中优于 SOTA 模型(如 DALL·E 3 和 Stable Diffusion 3),在整体偏好、视觉质量以及提示-图像对齐方面均取得最高的 Elo 得分。

ABSTRACT

We introduce Imagen 3, a latent diffusion model that generates high quality images from text prompts. We describe our quality and responsibility evaluations. Imagen 3 is preferred over other state-of-the-art (SOTA) models at the time of evaluation. In addition, we discuss issues around safety and representation, as well as methods we used to minimize the potential harm of our models.

研究动机与目标

  • 开发一种文本到图像扩散模型,能够从复杂的自然语言提示生成高保真、细节丰富的图像。
  • 提升长篇幅、复杂提示与生成图像内容之间的一致性,特别是在构图和风格细节方面。
  • 通过过滤有害数据并减少训练过程中的偏差与过拟合,确保生成的安全性与责任性。
  • 通过与 SOTA 模型进行严格的人工与自动评估,建立文本到图像生成的新基准。
  • 通过多阶段数据过滤、去重以及负责任的数据来源实践,最大限度减少潜在危害。

提出的方法

  • 在大规模、多阶段筛选的数据集上训练潜在扩散模型,数据集包含真实图像、原始字幕以及由 Gemini 模型生成的合成字幕。
  • 应用多阶段数据过滤管道,以去除不安全、低质量及 AI 生成的图像,并通过去重和降权处理减少数据冗余。
  • 使用多个 Gemini 模型生成合成字幕,通过多样化指令提升语言多样性与质量。
  • 采用并列的人工评估与 Elo 评分方法,对比模型在五个质量维度上的输出表现:整体偏好、提示-图像对齐、视觉吸引力、细节一致性以及数值推理能力。
  • 使用外部基准测试(如 GenAI-Bench、DOCCI-Test-Pivots 和 GeckoNum)评估模型的泛化能力与推理能力。
  • 通过公开 API 对外部模型进行评估,并使用已发布的 DALL·E 3 图像以确保评估的一致性与公平性。

实验结果

研究问题

  • RQ1Imagen 3 是否能在多个人工评估质量维度上,整体优于其他 SOTA 模型?
  • RQ2Imagen 3 在处理复杂、长篇幅描述时,其提示-图像对齐能力有多强?
  • RQ3Imagen 3 在数值推理任务中的表现如何,例如能否准确呈现图像中指定数量的物体?
  • RQ4多阶段数据过滤与合成字幕生成对减少偏差和提升模型泛化能力有何影响?
  • RQ5安全与责任措施在减少有害或强化有害内容的输出方面有多有效?

主要发现

  • 在 GenAI-Bench 基准测试中,Imagen 3 在整体偏好方面取得最高 Elo 得分(1,115),显著优于 DALL·E 3(1,078)和 Stable Diffusion 3.5 Large(1,059)。
  • 在视觉质量评估中,Imagen 3-002 取得 1,135 的 Elo 得分,超越所有其他模型,包括 DALL·E 3(1,112)和 Stable Diffusion 3.5 Large(1,104)。
  • 在提示-图像对齐方面,Imagen 3-002 在 GenAI-Bench 数据集上得分为 1,106,超过 DALL·E 3(1,066)和 Midjourney v6(1,063)。
  • 在 GeckoNum 基准测试中,Imagen 3 展现出强大的数值推理能力,能以高精度准确呈现复杂场景中的物体数量。
  • 在 DOCCI-Test-Pivots 的细节对齐任务中,模型表现优异,能够准确保留提示中的复杂构图元素。
  • 人类评估者在所有评估数据集中一致偏好 Imagen 3,共收集超过 366,000 份评分,来自 3,225 名独立评估者,确保了结果的可靠性并降低了偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。