Skip to main content
QUICK REVIEW

[论文解读] Storytelling of Photo Stream with Bidirectional Multi-thread Recurrent Neural Network

Yu Liu, Jianlong Fu|arXiv (Cornell University)|Jun 2, 2016
Multimodal Machine Learning Applications参考文献 22被引用 7
一句话总结

本文提出了一种具有新型跳过门控循环单元(sGRU)的双向多线程循环神经网络(BMRNN),以解决视觉叙事中因跨跳结构导致的长距离依赖问题,其中图像序列包含多线程故事情节。该模型通过在场景转换间保留跳跃信息,提升了叙事连贯性,在NYC、迪士尼乐园和SIND数据集上分别实现了22.8%、15.6%和15.7%更高的recall@1,达到当前最优性能。

ABSTRACT

Visual storytelling aims to generate human-level narrative language (i.e., a natural paragraph with multiple sentences) from a photo streams. A typical photo story consists of a global timeline with multi-thread local storylines, where each storyline occurs in one different scene. Such complex structure leads to large content gaps at scene transitions between consecutive photos. Most existing image/video captioning methods can only achieve limited performance, because the units in traditional recurrent neural networks (RNN) tend to "forget" the previous state when the visual sequence is inconsistent. In this paper, we propose a novel visual storytelling approach with Bidirectional Multi-thread Recurrent Neural Network (BMRNN). First, based on the mined local storylines, a skip gated recurrent unit (sGRU) with delay control is proposed to maintain longer range visual information. Second, by using sGRU as basic units, the BMRNN is trained to align the local storylines into the global sequential timeline. Third, a new training scheme with a storyline-constrained objective function is proposed by jointly considering both global and local matches. Experiments on three standard storytelling datasets show that the BMRNN model outperforms the state-of-the-art methods.

研究动机与目标

  • 为解决由图像流中跨跳结构引起的长距离依赖和内容间隙问题,提升视觉叙事质量。
  • 开发一种循环神经网络架构,以在不一致的场景转换间保留长距离视觉信息。
  • 通过一种新型训练目标,联合优化全局时间线连贯性与局部故事情节对齐。
  • 生成在语境连贯性和语义准确性方面均达到人类水平的叙事描述。

提出的方法

  • 引入具有延迟控制和保留机制的跳过门控循环单元(sGRU),以在跳过帧之间保持长距离视觉信息。
  • 设计一种双向多线程RNN(BMRNN),使用sGRU作为核心单元,同时建模全局时间线和多条局部故事情节。
  • 实现一种故事情节约束的目标函数,联合优化全局序列对齐与局部故事情节一致性。
  • 使用VGGNet fc7特征作为输入图像的视觉表征,以确保鲁棒且可迁移的特征提取。
  • 通过交叉熵损失与基于检索的目标函数相结合的方式,端到端训练BMRNN模型,以提升叙事质量。
  • 在推理阶段应用K近邻搜索,以优化候选句子生成并提升检索指标。

实验结果

研究问题

  • RQ1如何使循环神经网络有效建模具有跨跳结构且帧间存在长距离依赖的视觉故事?
  • RQ2为在图像流的场景转换间保留长距离视觉上下文,需要哪些架构上的改进?
  • RQ3联合优化全局时间线与局部故事情节是否能提升视觉叙事中的叙事连贯性与生成质量?
  • RQ4所提出的sGRU单元在捕捉跳跃结构依赖关系方面,与标准GRU和LSTM单元相比表现如何?
  • RQ5BMRNN模型在自动评估与人类偏好测试中,相较于现有SOTA方法在多大程度上表现更优?

主要发现

  • 与SOTA方法相比,BMRNN在NYC数据集上的recall@1提升了22.8%。
  • 在迪士尼乐园数据集上,该模型相比最佳基线方法,recall@1提升了15.6%。
  • 在SIND数据集上,BMRNN模型的recall@1提升了15.7%,表明在多个基准上均保持一致的性能增益。
  • 在用户研究中,BMRNN生成的故事在68.0%的案例中优于CRCN生成的故事,主观评分均值为5.19,而CRCN为3.77。
  • 该模型将SIND数据集的中位排名(Medr)降低至8,迪士尼乐园数据集降低至5,表明检索性能更优且生成句子质量更高。
  • 用户研究表明,BMRNN生成的故事在7.0%的情况下比CRCN更接近真实故事,而CRCN仅为2.0%,表明其叙事质量更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。