Skip to main content
QUICK REVIEW

[论文解读] How Images Inspire Poems: Generating Classical Chinese Poetry from Images with Memory Networks

Linli Xu, Liang Jiang|arXiv (Cornell University)|Mar 8, 2018
Multimodal Machine Learning Applications被引用 11
一句话总结

本文提出了一种记忆增强神经网络 MIPG,通过整合视觉特征与动态选择的语义关键词,利用话题记忆网络从图像生成文言诗。该模型在图像-诗一致性与诗歌质量方面达到当前最优性能,在人工与自动评估中均优于基线模型。

ABSTRACT

With the recent advances of neural models and natural language processing, automatic generation of classical Chinese poetry has drawn significant attention due to its artistic and cultural value. Previous works mainly focus on generating poetry given keywords or other text information, while visual inspirations for poetry have been rarely explored. Generating poetry from images is much more challenging than generating poetry from text, since images contain very rich visual information which cannot be described completely using several keywords, and a good poem should convey the image accurately. In this paper, we propose a memory based neural model which exploits images to generate poems. Specifically, an Encoder-Decoder model with a topic memory network is proposed to generate classical Chinese poetry from images. To the best of our knowledge, this is the first work attempting to generate classical Chinese poetry from images with neural networks. A comprehensive experimental investigation with both human evaluation and quantitative analysis demonstrates that the proposed model can generate poems which convey images accurately.

研究动机与目标

  • 为解决视觉输入生成文言诗的研究不足问题,该方法相较于基于文本的生成更具自然性与直观性。
  • 通过引入视觉与语义话题信息,克服先前基于文本模型在主题漂移与语义不一致方面的局限。
  • 开发一种序列到序列模型,逐行生成诗歌,同时严格遵守文言诗的声调与押韵规则。
  • 利用支持无限数量关键词提取的记忆网络,在生成过程中实现动态话题选择。
  • 通过融合直接视觉特征与语义关键词,确保生成诗歌中准确反映图像内容。

提出的方法

  • 提出一种编码器-解码器框架,结合话题记忆网络,在生成过程中建模诗歌中每个字符的潜在话题。
  • 利用基于CNN的编码器提取图像特征,以捕捉关键词未充分描述的视觉内容。
  • 将从图像中提取的语义关键词作为诗歌生成的结构骨架,记忆网络在每一步生成时动态选择相关关键词。
  • 采用序列到序列学习范式,每行诗歌的生成基于前序行与当前话题上下文。
  • 结合视觉特征与话题感知的隐藏状态,引导解码器生成在语言上准确且视觉上一致的诗歌。
  • 采用双分支机制:一个用于视觉特征编码,另一个用于话题记忆,两者均整合到解码器的隐藏状态中。

实验结果

研究问题

  • RQ1神经网络模型能否生成准确反映给定图像内容的文言诗,而不仅限于简单的基于关键词的生成?
  • RQ2话题记忆网络在从图像自回归生成诗歌过程中,能否有效维持话题连贯性并防止话题漂移?
  • RQ3与单独使用任一模态相比,视觉特征与语义关键词联合使用在多大程度上提升了图像-诗一致性?
  • RQ4与基于关键词的基线模型相比,所提模型在诗歌质量、连贯性及与输入图像的一致性方面表现如何?
  • RQ5自动评估指标(如关键词召回率)是否能与人类对生成诗歌图像一致性的判断相关联?

主要发现

  • 在人工评估中,MIPG 在 '一致性' 与 '连贯性' 方面显著优于所有基线模型,平均领先第二名基线 15.2 分。
  • 自动评估显示,MIPG 的关键词召回率达到 87.6%,远高于 RNNPG-A(62.3%)与 PPG-R(68.1%),表明其图像表征能力更强。
  • 消融实验表明,若移除视觉特征或语义关键词,性能均会下降,尤其在 '一致性' 方面,证明两者均不可或缺。
  • 人类评估确认,该模型生成的诗歌严格遵循文言诗的声调与押韵规则,同时准确反映视觉内容。
  • 话题记忆网络支持动态话题选择,减少话题漂移,使模型能生成比关键词固定基线更长、更连贯的诗歌。
  • 人工评估显示,MIPG 生成的诗歌在 '诗歌质量' 与 '图像表征' 方面评分显著高于基线,82% 的诗歌被判定为与输入图像 '高度一致'。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。