[论文解读] HIVE: Harnessing Human Feedback for Instructional Visual Editing
HIVE 提出了一套框架,通过奖励建模和微调流程整合人类反馈,以增强指令式视觉编辑。该方法引入了可扩展且计算高效的微调方法,利用人类偏好对扩散模型进行优化,在使用 100 万条训练数据、3,600 个奖励标注和 1,000 个评估数据的情况下,实现了最先进的性能,显著优于先前方法在定性和定量基准上的表现。
Incorporating human feedback has been shown to be crucial to align text generated by large language models to human preferences. We hypothesize that state-of-the-art instructional image editing models, where outputs are generated based on an input image and an editing instruction, could similarly benefit from human feedback, as their outputs may not adhere to the correct instructions and preferences of users. In this paper, we present a novel framework to harness human feedback for instructional visual editing (HIVE). Specifically, we collect human feedback on the edited images and learn a reward function to capture the underlying user preferences. We then introduce scalable diffusion model fine-tuning methods that can incorporate human preferences based on the estimated reward. Besides, to mitigate the bias brought by the limitation of data, we contribute a new 1M training dataset, a 3.6K reward dataset for rewards learning, and a 1K evaluation dataset to boost the performance of instructional image editing. We conduct extensive empirical experiments quantitatively and qualitatively, showing that HIVE is favored over previous state-of-the-art instructional image editing approaches by a large margin.
研究动机与目标
- 为解决现有指令式图像编辑模型在与人类偏好和意图对齐方面存在的不足,特别是在将编辑操作精准定位到特定视觉组件方面的问题。
- 开发一种可扩展且高效的将人类反馈整合到扩散模型微调中的方法,克服扩散模型中强化学习带来的高昂计算成本。
- 通过收集大规模、多样化的数据集,缓解指令式编辑中的数据偏差,包含 100 万条训练样本、3,600 个奖励标注和 1,000 个评估样本。
- 通过学习人类对不同输出变体的偏好,提升模型泛化能力,减少过度或错误的编辑行为。
- 证明人类反馈能显著提升编辑指令与生成结果之间的对齐程度,尤其在保留未编辑图像区域方面表现更优。
提出的方法
- 收集一个规模达 100 万的指令式图像编辑数据集,结合新数据与 InstructPix2Pix 数据,用于预训练基线 HIVE 模型。
- 通过让标注者对每组图像-指令对生成的多个输出进行排序,收集人类反馈,构建一个包含 3,600 个样本的奖励学习数据集。
- 训练一个奖励模型(RM),基于排序后的输出预测人类偏好,捕捉用户意图与质量偏好。
- 提出两种可扩展的微调目标——加权奖励损失与条件奖励损失,将估计的奖励以极低计算开销整合进扩散模型训练中。
- 在微调过程中使用估计奖励优化扩散模型中的 U-Net,提升与编辑指令的对齐度,而无需依赖昂贵的在线策略强化学习。
- 采用最新的 Stable Diffusion v2.1 主干网络与 OpenCLIP 文本编码器,以提升性能与泛化能力。
实验结果
研究问题
- RQ1人类反馈能否显著提升指令式图像编辑模型与用户意图及偏好的对齐程度?
- RQ2如何在不产生过高计算成本的前提下,高效地将人类反馈整合到扩散模型微调中?
- RQ3大规模、人工标注的奖励数据集在多大程度上提升了指令式编辑模型的鲁棒性与泛化能力?
- RQ4整合人类反馈是否能减少过度或错误的图像修改,例如改变未编辑区域?
- RQ5在人类偏好与模型性能方面,不同奖励微调目标(加权损失 vs. 条件奖励损失)的表现如何比较?
主要发现
- 在用户偏好研究中,加入人类反馈的 HIVE 显著优于 InstructPix2Pix 和未使用人类反馈的 HIVE,在成对比较中获得最高票数。
- 人类反馈使编辑定位更加准确,减少了修改非目标对象或改变未编辑背景区域等错误。
- 加入人类反馈的模型能更好地保留指令外原始图像内容,最大限度减少不必要的过度编辑。
- 条件奖励损失与加权奖励损失两种变体在人类偏好排名上几乎完全一致,表明其在不同优化策略下均具有鲁棒性。
- 从 Stable Diffusion v1.5 升级到 v2.1 后性能略有但一致地提升,使用 v2.1 的 HIVE 在人类偏好评分上高于其 v1.5 对应版本。
- 失败案例包括对空间或缩放指令的误解、计数错误以及错误地替换物体颜色,凸显了现有训练数据覆盖范围的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。