Skip to main content
QUICK REVIEW

[论文解读] Visual Storytelling via Predicting Anchor Word Embeddings in the Stories

Bowen Zhang, Hexiang Hu|arXiv (Cornell University)|Jan 13, 2020
Multimodal Machine Learning Applications参考文献 15被引用 5
一句话总结

本文提出 StoryAnchor,一种视觉故事生成模型,通过从图像特征中预测锚定词嵌入(主要为名词)来引导叙事生成。通过在序列到序列框架中联合使用预测的锚定词嵌入与图像特征,该方法在自动指标上达到最先进性能,并在人类评估中优于竞争模型,尽管其设计更简单且未使用强化学习。

ABSTRACT

We propose a learning model for the task of visual storytelling. The main idea is to predict anchor word embeddings from the images and use the embeddings and the image features jointly to generate narrative sentences. We use the embeddings of randomly sampled nouns from the groundtruth stories as the target anchor word embeddings to learn the predictor. To narrate a sequence of images, we use the predicted anchor word embeddings and the image features as the joint input to a seq2seq model. As opposed to state-of-the-art methods, the proposed model is simple in design, easy to optimize, and attains the best results in most automatic evaluation metrics. In human evaluation, the method also outperforms competing methods.

研究动机与目标

  • 为解决从图像序列生成连贯、叙事驱动的故事的挑战,超越简单的图像字幕生成。
  • 识别并利用‘锚定词’——故事中的关键语义元素(如名词)——以构建底层叙事结构。
  • 开发一种简单、端到端的学习模型,从图像中预测锚定词嵌入,而无需对锚定词进行显式标注。
  • 通过在序列到序列框架中融合预测的锚定词嵌入与图像特征,提升叙事生成质量。
  • 证明无需强化学习的更简单模型设计,可在自动评估与人类评估中均超越复杂的最先进方法。

提出的方法

  • 该模型采用序列到序列架构,将图像特征与预测的锚定词嵌入拼接作为句子生成的输入。
  • 锚定词嵌入通过监督学习设置从图像特征中预测,以参考故事中的真实名词作为目标。
  • 预测器采用标准编码器-解码器架构进行端到端训练,使用固定词嵌入。
  • 使用 NLTK 的 POS 标注器从参考故事中提取名词,并将其作为锚定词候选;若未找到名词,则使用 'UNK'。
  • 推理阶段使用束搜索(beam size 3)从图像与锚定词嵌入的联合特征中解码叙事句子。
  • 模型在 VIST 数据集上进行训练与评估,使用 BLEU、METEOR、ROUGE 和 CIDER 等标准指标。

实验结果

研究问题

  • RQ1与标准序列到序列模型相比,从图像中预测锚定词嵌入是否能提升视觉故事情节生成性能?
  • RQ2使用参考故事中的真实名词作为锚定词目标,是否能带来更好的叙事生成效果?
  • RQ3无需强化学习的更简单模型设计,是否能在视觉故事情节生成中实现最先进性能?
  • RQ4自动评估指标在多大程度上与人类偏好一致?
  • RQ5机器生成故事与人类撰写故事之间的性能差距,是反映在自动指标中,还是在人类评估中?

主要发现

  • 当使用真实名词作为锚定词时,所提出的 StoryAnchor 模型在大多数自动评估指标上表现最佳,包括 BLEU-4(14.7)、METEOR(37.7)、ROUGE(32.3)和 CIDER(16.2)。
  • 即使使用预测的锚定词嵌入,模型仍取得强劲表现:BLEU-4 为 11.9,METEOR 为 34.5,ROUGE 为 28.9,CIDER 为 10.1。
  • 人类评估显示,StoryAnchor 生成的故事在 53.2% 的情况下优于 AREL 模型在相关性方面,45.1% 在具体性方面,48.9% 在连贯性方面。
  • 在偏好比较中,57.8% 的标注者更偏好人类撰写的故事,表明自动指标与人类判断之间存在显著偏差。
  • 尽管在自动指标上(如人类 BLEU-4:5.6 vs. 模型 BLEU-4:11.2)优于人类写作者,但人类故事在直接比较中仍更受青睐,凸显评估对齐中的关键鸿沟。
  • 该模型性能超越了使用强化学习的最先进方法(如 AREL 等),证明在该任务中,简洁性可超越复杂性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。