Skip to main content
QUICK REVIEW

[论文解读] Visual Conceptual Blending with Large-scale Language and Vision Models

Songwei Ge, Devi Parikh|arXiv (Cornell University)|Jun 27, 2021
Multimodal Machine Learning Applications参考文献 32被引用 4
一句话总结

本文提出了一种框架,利用大规模语言模型和视觉模型,通过首先使用提示工程的语言模型推理相关物体及融合属性,再通过文本到图像的扩散模型生成图像,从而生成富有创意的视觉概念融合。结果表明,大规模语言模型在概念关联方面优于知识库,基于扩散的图像生成器在视觉质量和融合保真度方面显著超越生成对抗网络(GANs)。

ABSTRACT

We ask the question: to what extent can recent large-scale language and image generation models blend visual concepts? Given an arbitrary object, we identify a relevant object and generate a single-sentence description of the blend of the two using a language model. We then generate a visual depiction of the blend using a text-based image generation model. Quantitative and qualitative evaluations demonstrate the superiority of language models over classical methods for conceptual blending, and of recent large-scale image generation models over prior models for the visual depiction.

研究动机与目标

  • 探究大规模语言和视觉模型是否能有效执行视觉概念融合——将两个不同物体融合为一种新颖且连贯的概念融合体。
  • 评估现代大规模语言模型相较于经典知识库在识别融合相关概念属性方面的优越性。
  • 比较基于最新文本到图像扩散模型与旧式生成对抗网络(GAN)方法在视觉质量和概念保真度方面的表现。
  • 开发一个整合语言模型用于推理、扩散模型用于生成的流水线,以生成高质量且富有创意的视觉融合。

提出的方法

  • 该框架将视觉概念融合分解为两个阶段:推理与生成。
  • 在推理阶段,使用提示工程的语言模型(如 BERT、GPT)预测给定输入物体(如 'moon')的相关物体和融合属性(如 'sliced')。
  • 提示格式为掩码语言建模任务,例如 'a low budget film is [MASK]',以激发相关属性的输出。
  • 在生成阶段,将生成的文本描述(如 'the moon sliced like an orange')作为输入,输入至文本到图像的扩散模型(如 BigSleep、DeepDaze、DF-GAN)以生成视觉图像。
  • 通过 Amazon Mechanical Turk 的人工评估,比较不同模型在图像质量、输入物体识别度以及概念融合保真度方面的表现。
  • 构建了一个包含 66,442 个属性-物体对的比喻数据集,并用于定量评估语言模型性能与 ConceptNet 的对比。

实验结果

研究问题

  • RQ1大规模语言模型是否能在识别两个物体融合的相关概念属性方面优于传统知识库?
  • RQ2近期的文本到图像扩散模型在生成更连贯且更具美感的视觉融合方面,相较于旧式 GAN 模型的优越程度如何?
  • RQ3生成的图像在整合融合概念的同时,对原始输入物体身份的保留程度如何?
  • RQ4大规模语言模型与扩散模型的结合能否生成在视觉和语义上均具意义的概念融合,且与人类对创造力的认知相一致?
  • RQ5提示工程与模型规模在提升概念融合质量方面分别起到何种作用?

主要发现

  • 大规模语言模型如 GPT 在预测融合相关属性方面的 P@1000 精度达到 66.38%,显著优于 ConceptNet 的 5.90%。
  • 在语言模型中,GPT 表现最佳,其次为 BERT-base 和 BERT-large,表明模型规模有助于提升概念推理能力。
  • 基于 CLIP 的扩散模型(BigSleep 和 DeepDaze)在所有人工评估指标中均显著优于 DF-GAN,包括物体识别度、融合质量与美学吸引力。
  • BigSleep 优于 DeepDaze,表明 BigGAN 学习到的先验知识在生成概念融合图像方面优于基于 SIREN 的模型。
  • 人工评估结果显示,扩散模型在全部六个问题上均表现出统计显著偏好(p < 0.05),证实其在视觉概念融合方面的优越性。
  • 该框架成功生成了新颖、连贯且富有创意的视觉融合,如 '由蓝色和红色血管构成的树' 和 '像橘子一样被切开的月亮',展示了实际的创造性潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。