Skip to main content
QUICK REVIEW

[论文解读] Hierarchically Structured Reinforcement Learning for Topically Coherent Visual Story Generation

Qiuyuan Huang, Zhe Gan|arXiv (Cornell University)|May 21, 2018
Multimodal Machine Learning Applications参考文献 47被引用 21
一句话总结

本文提出一种分层结构强化学习(HSRL)模型用于视觉叙事,通过使用两级解码器——高层的'Manager'负责为每张图像规划主题,低层的'Worker'基于这些主题生成句子——来提升叙事的主题连贯性。该模型在VIST数据集上的自动评估与人工评估中均显著优于平坦强化学习基线模型,实现了叙事质量与连贯性的显著提升。

ABSTRACT

We propose a hierarchically structured reinforcement learning approach to address the challenges of planning for generating coherent multi-sentence stories for the visual storytelling task. Within our framework, the task of generating a story given a sequence of images is divided across a two-level hierarchical decoder. The high-level decoder constructs a plan by generating a semantic concept (i.e., topic) for each image in sequence. The low-level decoder generates a sentence for each image using a semantic compositional network, which effectively grounds the sentence generation conditioned on the topic. The two decoders are jointly trained end-to-end using reinforcement learning. We evaluate our model on the visual storytelling (VIST) dataset. Empirical results from both automatic and human evaluations demonstrate that the proposed hierarchically structured reinforced training achieves significantly better performance compared to a strong flat deep reinforcement learning baseline.

研究动机与目标

  • 为解决从图像序列生成主题连贯的长篇视觉叙事的挑战。
  • 克服标准序列到序列模型与MLE训练的局限性,后者存在暴露偏差且难以优化叙事连贯性。
  • 通过引入两级分层结构,在生成句子前先规划高层主题,从而提升叙事生成质量。
  • 采用混合MLE与自critical强化学习损失,联合训练高层与低层解码器,使其更好地对齐任务特定奖励信号。
  • 证明分层规划可提升叙事质量并减少重复,相较于平坦RL基线更具优势。

提出的方法

  • 模型采用两级分层解码器结构:基于LSTM的高层'Manager'为图像序列中的每张图像生成一系列语义主题(子目标)。
  • 低层'Worker'为语义组合网络(SCN),其生成句子时同时依赖图像特征与来自Manager的主题信息。
  • 两个解码器通过最大似然估计(MLE)与自critical强化学习(SCRL)的组合方式进行联合训练,全局奖励来自BLEU与CIDERr等指标。
  • 训练过程在MLE阶段使用教师强制,通过策略梯度与奖励塑造优化叙事连贯性。
  • 分层结构使模型能够通过将每句话锚定于预规划的主题,维持一致的叙事主线。
  • 该框架在VIST数据集上进行评估,结合自动评估与人工评估,以衡量连贯性、相关性与表现力。

实验结果

研究问题

  • RQ1与平坦序列到序列模型相比,两级分层强化学习框架是否能提升视觉叙事的主题连贯性?
  • RQ2联合训练主题规划的'Manager'与句子生成的'Worker'是否能带来优于迭代或独立训练的叙事质量提升?
  • RQ3分层规划在多大程度上减少了重复并提升了生成故事的多样性?
  • RQ4与MLE和平坦RL基线相比,该模型在人类评估指标(如相关性、表现力与具体性)上的表现如何?
  • RQ5模型是否能学习利用全局奖励信号,生成更详细且更具情感感染力的故事?

主要发现

  • 在人工评估中,HSRL模型在相关性、表现力与具体性三项指标上分别以63.93%、62.53%与62.47%的胜出率显著优于MLE与平坦RL基线。
  • 在与真实故事的接近度评估中,HSRL获得55.87%的投票,而RL仅获34.53%,MLE更低至9.60%,表明其与人工标注故事的对齐程度更优。
  • 模型生成的句子更具多样性且重复率更低,表现为更低的重复率与更丰富的词汇多样性。
  • HSRL生成的故事中,情感表达与描述性词汇显著更多——例如'happy'(1137次)、'excited'(678次)、'fun'(316次)的出现频次,远超RL基线的410、138与291次。
  • 模型成功捕捉到关键视觉细节,如'decorated with lights'与'cut the cake',而这些常被基线模型忽略。
  • 联合训练'Manager'与'Worker'优于迭代训练,因为联合设置使两个组件在优化过程中均可受益于真实标签监督与共享奖励信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。