Skip to main content
QUICK REVIEW

[论文解读] Hierarchically-Attentive RNN for Album Summarization and Storytelling

Licheng Yu, Mohit Bansal|arXiv (Cornell University)|Aug 9, 2017
Multimodal Machine Learning Applications被引用 9
一句话总结

本文提出一种分层注意力RNN模型,用于端到端的视觉讲故事任务,能够联合选择完整相册中的代表性照片并生成连贯自然的语言故事。该模型使用三个堆叠的双向GRU来编码相册上下文、关注关键照片并生成流畅的叙述,其在照片选择、故事生成和相册检索任务上均达到当前最优性能,人工评估显示其结果显著优于基线模型。

ABSTRACT

We address the problem of end-to-end visual storytelling. Given a photo album, our model first selects the most representative (summary) photos, and then composes a natural language story for the album. For this task, we make use of the Visual Storytelling dataset and a model composed of three hierarchically-attentive Recurrent Neural Nets (RNNs) to: encode the album photos, select representative (summary) photos, and compose the story. Automatic and human evaluations show our model achieves better performance on selection, generation, and retrieval than baselines.

研究动机与目标

  • 为解决从完整相册中进行端到端视觉讲故事的挑战,即必须联合学习照片选择与故事生成。
  • 改进现有依赖预选摘要照片或弱监督的方法,通过在训练过程中隐式学习代表性照片选择。
  • 开发一个统一模型,通过多阶段RNN中的分层注意力机制,同时完成相册摘要与故事生成。
  • 不仅评估故事生成性能,还引入一项新颖的相册检索任务,即使用故事来检索其原始相册。
  • 证明所学习的照片选择机制即使在无显式选择监督的情况下,也能与人类偏好保持合理一致。

提出的方法

  • 模型使用双向GRU-RNN编码相册中所有照片的视觉特征,捕捉局部与全局上下文信息。
  • 第二个RNN计算相册照片上的注意力权重,以识别最具代表性的(摘要)照片,作为可微分的照片选择器。
  • 第三个RNN通过自回归生成方式,将所选照片的加权表示解码为连贯的多句故事。
  • 整个模型通过联合损失函数进行端到端训练,损失函数结合了用于故事生成的交叉熵损失与用于改善照片选择的排序正则化损失。
  • 排序正则化项鼓励模型为更接近人类选定摘要的照片分配更高的注意力权重。
  • 推理阶段使用束搜索(beam size=3)生成多样且高质量的故事。

实验结果

研究问题

  • RQ1单一神经网络能否在不依赖预选摘要照片的前提下,联合学习从完整相册中选择代表性照片并生成连贯故事?
  • RQ2该模型所学习的照片选择机制与人工标注的摘要照片有多吻合?
  • RQ3与标准seq2seq或注意力基线相比,所提出的分层注意力机制是否能显著提升故事生成质量?
  • RQ4该模型能否有效用于相册检索任务,即通过故事检索其原始相册?
  • RQ5在损失函数中引入排序正则化是否能显著提升照片选择质量及下游任务表现?

主要发现

  • h-attn-rank模型在相册摘要任务上达到45.51% R@10与28.77% Meteor得分,显著优于基线enc-dec模型(10.70% R@10,18.30% Meteor)。
  • 人工评估显示,在强制选择比较中,h-attn-rank模型相较于enc-dec与enc-attn-dec基线具有统计上显著的偏好(p=0.01)。
  • 该模型所学习的照片选择机制中位数排名为7.0,表明与人类选定的摘要高度一致,且在精确率与召回率上优于基于DPP的基线模型。
  • 在相册检索任务中,h-attn-rank模型达到57.60% Recall@10,显著优于enc-dec基线模型(41.40% R@10),展现出强大的检索能力。
  • 即使使用人工选定的5张照片集合作为“最优”参考(oracle),其性能提升仍较微小,表明该模型已学习到接近最优的选择策略。
  • 排序正则化项在摘要与检索任务中均提升了性能,尽管其对检索任务的影响较弱,提示仍有进一步优化空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。