[论文解读] Is the Elephant Flying? Resolving Ambiguities in Text-to-Image Generative Models
本文提出一种通过语言模型生成澄清问题或替代视觉设定来解决文本到图像生成模型中歧义的框架,结合人类反馈进行澄清。该方法通过在新基准数据集和多种评估指标上验证,显著提升了图像忠实度——在人类评估中最高达到90%的忠实度,从而通过消歧实现生成图像与用户意图的对齐。
Natural language often contains ambiguities that can lead to misinterpretation and miscommunication. While humans can handle ambiguities effectively by asking clarifying questions and/or relying on contextual cues and common-sense knowledge, resolving ambiguities can be notoriously hard for machines. In this work, we study ambiguities that arise in text-to-image generative models. We curate a benchmark dataset covering different types of ambiguities that occur in these systems. We then propose a framework to mitigate ambiguities in the prompts given to the systems by soliciting clarifications from the user. Through automatic and human evaluations, we show the effectiveness of our framework in generating more faithful images aligned with human intention in the presence of ambiguities.
研究动机与目标
- 解决文本到图像生成中的歧义问题,因为模糊提示会导致图像输出错位或产生偏见。
- 开发一种通过语言模型生成澄清问题或视觉设定,并结合人机交互来解决歧义的框架。
- 创建一个新的基准数据集(文本到图像歧义基准,TAB),涵盖与图像生成相关的句法、语义和指代不明确的歧义类型。
- 提出并验证用于衡量在歧义条件下图像生成忠实度的自动评估与人工评估流程。
- 展示消歧在提升用户意图与生成图像之间对齐性方面的有效性,适用于多种文本到图像模型。
提出的方法
- 在文本到图像模型之前应用基于语言模型的消歧过滤器,以从TAB基准数据集检测模糊提示。
- 该过滤器要么生成一个或多个用于人类反馈的澄清问题,要么生成多个候选视觉设定供人类选择。
- 人类参与者回答问题或选择正确的视觉设定,这些反馈随后用于在图像生成前优化提示。
- 采用基于视觉问答(VQA)的自动评估方法,通过询问生成图像的相关问题,并将答案与人工提供的真实答案进行比较,以衡量忠实度。
- 该框架在DALL-E Mega和OpenAI的DALL-E上进行了评估,结合了自动评估(VQA)和人工评估(通过Amazon Mechanical Turk)。
- 该基准数据集包含150个具有多重解释的模糊提示,共由1200项人类判断对400张图像进行标注。
实验结果
研究问题
- RQ1不同类型的歧义——句法、语义和指代不明确——如何影响文本到图像生成的忠实度?
- RQ2基于语言模型的消歧过滤器是否能通过人类反馈解决模糊提示,从而提升图像忠实度?
- RQ3与人工评估相比,自动评估指标(如基于VQA的忠实度)在衡量与人类意图对齐性方面的有效性如何?
- RQ4与生成单个澄清问题相比,为人类选择生成多个视觉设定是否能更有效地提升图像忠实度?
- RQ5消歧在多大程度上减少了图像生成中的偏见,例如在“医生与护士交谈”等场景中出现的性别或角色刻板印象?
主要发现
- 当使用多个视觉设定并由人类选择时,该框架在人工评估中实现了高达90%的忠实度,显著优于基线模糊提示。
- 基于VQA的自动评估在不同设定下表现出一致的忠实度分数,当语言模型生成多个视觉设定供人类选择时,性能最高(85–90%)。
- 基于VQA的自动评估与人工判断具有强相关性,验证了其作为忠实度评估可扩展代理的有效性。
- 即使使用GPT-neo生成的问题而非基准中的真实问题,DALL-E Mega仍保持了超过80%的高忠实度,表明该消歧流水线具有鲁棒性。
- 图15的定性结果表明,经消歧的提示生成的图像与预期视觉解释的对齐性显著优于模糊提示生成的图像。
- 研究发现,提示中的指代不明确(如性别、角色)会导致图像生成偏见,而该消歧框架能有效缓解此类问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。