Skip to main content
QUICK REVIEW

[论文解读] Visual Story Generation Based on Emotion and Keywords

Yuetian Chen, Ruohua Li|arXiv (Cornell University)|Jan 7, 2023
Digital Storytelling and Education被引用 4
一句话总结

本文提出了一种交互式视觉故事协同创作流程,通过用户指定的关键词和情感标签生成连贯且情感一致的故事。该方法结合微调后的 BERT 用于情感预测,T5 用于条件化故事生成,并通过扩散模型实现图像生成,同时利用 YOLOv5 和 Faster R-CNN 进行目标识别,以实现关键词的迭代扩展,相较于基线方法平均 BLEU 分数提升 62%。

ABSTRACT

Automated visual story generation aims to produce stories with corresponding illustrations that exhibit coherence, progression, and adherence to characters' emotional development. This work proposes a story generation pipeline to co-create visual stories with the users. The pipeline allows the user to control events and emotions on the generated content. The pipeline includes two parts: narrative and image generation. For narrative generation, the system generates the next sentence using user-specified keywords and emotion labels. For image generation, diffusion models are used to create a visually appealing image corresponding to each generated sentence. Further, object recognition is applied to the generated images to allow objects in these images to be mentioned in future story development.

研究动机与目标

  • 开发一种交互式视觉故事协同创作系统,使用户能够控制故事生成中的情感基调与关键元素。
  • 通过整合情感与关键词约束,提升自动化视觉叙事中的连贯性与逻辑推进。
  • 通过从生成图像中利用目标识别提取新关键词,实现故事的迭代式发展。
  • 利用多种自然语言处理指标,评估情感与关键词提示对故事生成质量的影响。
  • 构建一个完整的文本到图像流程,支持用户参与的迭代式故事与视觉内容优化。

提出的方法

  • 微调 BERT${}_{\textsc{Next Emo}}$ 以基于先前的叙事上下文预测下一句故事的情感标签。
  • 微调 T5${}_{\textsc{BASE Fine-tuned CommonGen}}$ 以根据用户提供的关键词和情感标签生成下一句。
  • 采用扩散模型(如 Disco Diffusion)生成与每句生成内容对应的图像。
  • 在生成的图像上应用 YOLOv5 和 Faster R-CNN 进行目标识别,以提取未来故事发展的新关键词。
  • 集成反馈循环,将提取到的对象作为后续故事步骤中的建议关键词。
  • 使用提示工程与固定模板引导 T5 模型,确保推理过程中输入格式的一致性。
Figure 1: Generation Pipeline.
Figure 1: Generation Pipeline.

实验结果

研究问题

  • RQ1用户指定的情感与关键词是否能显著提升生成故事的连贯性与逻辑一致性?
  • RQ2与仅依赖上下文的基线模型相比,情感与关键词提示的整合如何影响叙事生成质量?
  • RQ3从生成图像中进行目标识别在多大程度上能够支持迭代式、演进式的故事发展?
  • RQ4基于普拉奇克情绪轮(Plutchik’s Wheel of Emotions)的情感预测模型在故事生成场景中的表现如何?
  • RQ5多模态反馈(文本、情感、图像、目标识别)对整体视觉叙事质量有何影响?

主要发现

  • 所提出的流程相较于仅依赖故事上下文进行推理的基线模型,平均 BLEU 分数提升了 62%。
  • 该方法显著减少了零 BERT-score 样本的数量,表明与人工撰写叙事的对齐性更好。
  • 平均 BERT-score 提升了 6.7%,表明生成故事在语义质量与连贯性方面得到改善。
  • 系统表现出更小的分数波动,表明生成性能更加稳定可靠。
  • 从生成图像中进行目标识别成功提取了新关键词,支持了迭代式与演进式的故事发展。
  • 情感预测模型(BERT${}_{\textsc{Next Emo}}$)的宏 AUC-ROC 得分为 0.78,证实其在情感感知故事生成中的有效性。
Figure 2: Plutchik basic emotions
Figure 2: Plutchik basic emotions

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。