Skip to main content
QUICK REVIEW

[论文解读] Using Inter-Sentence Diverse Beam Search to Reduce Redundancy in Visual Storytelling

Chao-Chun Hsu, Szu-Min Chen|arXiv (Cornell University)|May 30, 2018
Multimodal Machine Learning Applications参考文献 8被引用 19
一句话总结

本文提出了一种跨句多样性的束搜索方法,通过惩罚跨生成句子中重复使用的词语,减少视觉故事生成中的冗余。通过结合先前生成句子的多样性惩罚,该模型提升了故事的表达力,并将 VIST 数据集上的最大 METEOR 分数从 29.3% 提升至 31.7%。

ABSTRACT

Visual storytelling includes two important parts: coherence between the story and images as well as the story structure. For image to text neural network models, similar images in the sequence would provide close information for story generator to obtain almost identical sentence. However, repeatedly narrating same objects or events will undermine a good story structure. In this paper, we proposed an inter-sentence diverse beam search to generate a more expressive story. Comparing to some recent models of visual storytelling task, which generate story without considering the generated sentence of the previous picture, our proposed method can avoid generating identical sentence even given a sequence of similar pictures.

研究动机与目标

  • 解决当序列中包含相似图像时,视觉故事情节生成中重复句子的问题。
  • 在解码过程中考虑先前生成的句子,以提升故事的多样性与表达力。
  • 在基线束搜索之外,提升神经图像到文本生成的一致性与创造性。
  • 减少对重复表达的依赖,即使输入图像视觉相似,也能避免叙事质量下降。
  • 开发一种解码策略,在无需特定任务微调的情况下,平衡流畅性与多样性。

提出的方法

  • 通过修改评分函数,将跨句多样性纳入束搜索,以惩罚在先前句子中频繁出现的词语。
  • 使用先前生成句子的词袋表示来计算多样性惩罚。
  • 应用基于汉明距离的多样性函数 Δ,根据词语在早期句子中的频率对标记进行惩罚。
  • 引入多样性强度超参数 λ,实验中设为 2,以平衡流畅性与多样性。
  • 在基于 ResNet-152 的图像编码和双向 GRU 的上下文感知图像序列建模的基线编码器-解码器模型上集成该方法。
  • 使用拼接的图像和词嵌入作为解码器 GRU 的输入,从而提升训练稳定性和性能。

实验结果

研究问题

  • RQ1在解码过程中引入跨句多样性是否能在不牺牲流畅性的前提下减少视觉故事生成中的重复?
  • RQ2与标准束搜索和句内多样性束搜索相比,跨句多样性的束搜索在减少冗余方面表现如何?
  • RQ3所提出的方法在多大程度上提升了视觉故事情节生成的自动评估指标(如 METEOR)?
  • RQ4与基线模型相比,该方法是否能生成更具表现力和类人叙事风格的故事?
  • RQ5在故事生成中,多样性和似然性的最佳平衡点是什么?如何实现该平衡的自动化?

主要发现

  • 所提出的跨句多样性的束搜索方法在 VIST 数据集上将最大 METEOR 分数从 29.3% 提升至 31.7%,表明其与人类参考故事的对齐程度更高。
  • 该方法有效减少了重复表达(如反复使用 'we had a great time')——这是基线模型在处理相似图像时的常见问题。
  • 使用该方法生成的故事在词汇多样性和叙事多样性方面表现更优,如表 2 的定性对比所示。
  • 采用 λ = 2 的汉明多样性惩罚获得了最佳结果,实现了多样性与流畅性的良好平衡。
  • 该方法无需对基础模型进行架构修改,即可成功解决冗余问题,是一种即插即用的解码增强方法。
  • 该方法优于标准束搜索和先前的多样性束搜索变体,因其聚焦于跨句多样性,而非句内变化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。