[论文解读] What Makes A Good Story? Designing Composite Rewards for Visual Storytelling
本文提出 ReCo-RL,一种用于视觉故事生成的强化学习框架,通过组合奖励函数,优化相关性、连贯性和表现力——三种以人为中心的质量标准。该方法在自动指标和人工评估中均优于最先进基线模型,生成的故事在准确性、流畅性和多样性方面均优于仅基于 BLEU 或 CIDEr 训练的模型。
Previous storytelling approaches mostly focused on optimizing traditional metrics such as BLEU, ROUGE and CIDEr. In this paper, we re-examine this problem from a different angle, by looking deep into what defines a realistically-natural and topically-coherent story. To this end, we propose three assessment criteria: relevance, coherence and expressiveness, which we observe through empirical analysis could constitute a "high-quality" story to the human eye. Following this quality guideline, we propose a reinforcement learning framework, ReCo-RL, with reward functions designed to capture the essence of these quality criteria. Experiments on the Visual Storytelling Dataset (VIST) with both automatic and human evaluations demonstrate that our ReCo-RL model achieves better performance than state-of-the-art baselines on both traditional metrics and the proposed new criteria.
研究动机与目标
- 识别并形式化从人类视角定义高质量故事的三个关键质量维度——相关性、连贯性和表现力。
- 解决现有视觉故事情境模型仅优化 BLEU 或 CIDEr 等自动指标的局限性,这些指标往往无法捕捉人类感知的故事质量。
- 设计一种强化学习框架,通过组合奖励函数,明确鼓励生成语义相关、连贯且富有表现力的故事。
- 证明优化与人类对齐的质量标准可显著提升模型在自动评估和人工评估基准上的表现。
提出的方法
- ReCo-RL 框架采用两级架构:高层管理者负责生成总结视觉上下文和故事脉络的目标向量,低层工作者则根据管理者的目标逐句生成描述。
- 相关性通过奖励函数衡量,该函数为提及图像中细粒度视觉概念的生成句子赋予更高分值。
- 连贯性通过预训练语言模型对给定前一句句子的流畅性进行评分来评估,以鼓励逻辑和句法上的连贯性。
- 表现力通过连续句子之间的短语重叠惩罚机制来促进,以减少重复或冗余的表达。
- 组合奖励被聚合,并通过 REINFORCE 策略梯度算法用于模型训练。
- 模型在 Visual Storytelling Dataset (VIST) 上进行训练和评估,涵盖自动指标和人工评估。
实验结果
研究问题
- RQ1除了标准自动指标外,哪些质量维度——从人类视角来看——定义了一个高质量的故事?
- RQ2一种明确优化相关性、连贯性和表现力的强化学习框架,是否能优于仅基于 BLEU 或 CIDEr 等标准指标训练的模型?
- RQ3基于相关性、连贯性和表现力的组合奖励,在多大程度上优于强基线模型,从而提升故事生成质量?
- RQ4所提出的奖励组件在单独和共同作用下,如何促进生成更符合人类偏好的故事?
主要发现
- 在所有三个质量维度——相关性、连贯性和表现力上,ReCo-RL 的人类偏好得分显著高于 BLEU-RL、AREL 和 HSRL,配对 t 检验的 p 值均小于 0.05。
- 模型生成的故事在相关性方面得分为 37.10(BLEU-RL 为 2.47),表现力得分为 41.71(BLEU-RL 为 11.06),连贯性得分为 16.99(BLEU-RL 为 3.32),表明在各项质量标准上均有显著提升。
- 人工评估显示,ReCo-RL 生成了更多具体的视觉概念(如 'sign'、'flags'、'meal'、'drink'),并避免了基线模型常见的重复模式,如 'great time' 或 'we had a lot of people there'。
- 定性分析表明,ReCo-RL 在句子之间保持了主题一致性和语义连贯性,避免了基线模型中常见的突然主题转换或内容脱节现象。
- 模型的组合奖励设计使其与人类判断更加一致,表现为 Turkers 在成对比较中投票支持 ReCo-RL 的比例更高。
- 尽管 BLEU-RL 经过微调以匹配 BLEU 分数,ReCo-RL 在所有人工评估维度上仍表现更优,证明仅优化自动指标并不能保证生成高质量的人类偏好输出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。