Skip to main content
QUICK REVIEW

[论文解读] ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation

Jiazheng Xu, Xiao Liu|arXiv (Cornell University)|Apr 12, 2023
Multimodal Machine Learning Applications被引用 99
一句话总结

ImageReward 是一个面向文本到图像生成的通用型人类偏好奖励模型,配合 Reward Feedback Learning (ReFL) 以直接使用人类偏好反馈对扩散模型进行调优。

ABSTRACT

We present a comprehensive solution to learn and improve text-to-image models from human preference feedback. To begin with, we build ImageReward -- the first general-purpose text-to-image human preference reward model -- to effectively encode human preferences. Its training is based on our systematic annotation pipeline including rating and ranking, which collects 137k expert comparisons to date. In human evaluation, ImageReward outperforms existing scoring models and metrics, making it a promising automatic metric for evaluating text-to-image synthesis. On top of it, we propose Reward Feedback Learning (ReFL), a direct tuning algorithm to optimize diffusion models against a scorer. Both automatic and human evaluation support ReFL's advantages over compared methods. All code and datasets are provided at \url{https://github.com/THUDM/ImageReward}.

研究动机与目标

  • 解决文本到图像生成与人类偏好之间的不一致。
  • 为文本到图像任务创建一个通用的人类偏好奖励模型。
  • 提供一个可扩展的、与人类判断对齐的评估指标。
  • 提出一种直接优化方法(ReFL),利用奖励评分器对扩散模型进行调优。
  • 展示相较于现有评分指标和调优方法的改进。

提出的方法

  • 开发一个系统化的人类偏好标注流程(提示选择、文本-图像评分、图像排序),并构建一个137k对比数据集。
  • 使用带有基于排序的损失的 BLIP 主干训练奖励模型(ImageReward),覆盖提示-图像对。
  • 将 ImageReward 与 CLIP、Aesthetic 和 BLIP 作为评分基线进行对比评估,并证明其与人类偏好的一致性更优。
  • 提出 Reward Feedback Learning (ReFL):在后期去噪步骤中将 ImageReward 的奖励反向传播,直接对扩散模型进行微调。
  • 在训练中使用一个随机的晚期去噪步骤作为反馈以稳定训练,并将奖励损失与预训练损失结合以实现正则化。
  • 在 Stable Diffusion v1.4 上实验证明 ReFL,并与其他调优方法进行比较。

实验结果

研究问题

  • RQ1通用型奖励模型是否能可靠地捕捉文本到图像输出的人类偏好?
  • RQ2ImageReward 的对齐是否比现有评分指标(CLIP、Aesthetic、BLIP)更接近人类判断?
  • RQ3在不依赖数据增强或仅靠损失重加权的情况下,ReFL 能否直接利用奖励信号改进扩散模型?
  • RQ4标注流程如何影响人类偏好数据的质量和一致性?
  • RQ5ImageReward 是否能作为单图像或模型范围比较的自动评估指标?

主要发现

  • ImageReward 在理解文本到图像合成的人类偏好方面,分别比 CLIP、Aesthetic 和 BLIP 提高了 38.6%、39.6% 和 31.6%。
  • ImageReward 与人类排名保持一致,并在模型和样本之间的可区分性方面优于 CLIP 和 FID 基线。
  • ImageReward 作为基于真实用户提示的、具有良好零-shot 表现的自动评估指标,用于评估和排名文本到图像模型。
  • ReFL 直接使用 ImageReward 的反馈对扩散模型进行微调,在与若干基线和替代调优方法的人工评估中获得最佳表现。
  • ReFL 通过直接从奖励模型提供梯度反馈,显示出相较于数据增强和损失重加权方法的优势。
  • 在去噪步骤上观察 ImageReward 分数显示,可靠的人类偏好信号出现在后期步骤(大约 30 步以上去噪步骤),从而实现有效的后期步骤调优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。