[论文解读] FairyTailor: A Multimodal Generative Framework for Storytelling
FairyTailor 提出了一种人机协同的多模态生成框架,通过在动态、交互式的网络界面中整合文本生成与图像检索,实现儿童童话的共同创作。该框架通过持续的用户反馈、自动补全和多模态条件生成,增强了叙事连贯性与创造力,表明集成图像使用可提升互动式叙事系统中的故事质量与用户参与度。
Storytelling is an open-ended task that entails creative thinking and requires a constant flow of ideas. Natural language generation (NLG) for storytelling is especially challenging because it requires the generated text to follow an overall theme while remaining creative and diverse to engage the reader. In this work, we introduce a system and a web-based demo, FairyTailor, for human-in-the-loop visual story co-creation. Users can create a cohesive children's fairytale by weaving generated texts and retrieved images with their input. FairyTailor adds another modality and modifies the text generation process to produce a coherent and creative sequence of text and images. To our knowledge, this is the first dynamic tool for multimodal story generation that allows interactive co-formation of both texts and images. It allows users to give feedback on co-created stories and share their results.
研究动机与目标
- 为解决在自然语言生成(NLG)中开放式、创造性且连贯的故事生成挑战,通过引入视觉模态。
- 设计一个交互式、基于网络的平台,允许用户实时与AI生成的文本和检索到的图像共同创作故事。
- 探索多模态生成(结合文本与图像)如何提升叙事连贯性、创造力和用户参与度。
- 评估图像集成与交互式反馈在人机协同环境下的用户体验和故事质量影响。
- 为研究人员提供公开可访问的演示和源代码,以测试和扩展多模态故事生成模型。
提出的方法
- FairyTailor 采用一种顺序的文本与视觉框架,通过结合先前的叙事上下文和检索到的图像特征来生成文本,以保持主题连贯性。
- 它使用基于检索的图像系统,从数据集(如 visualGenome)中根据与当前故事片段的语义相似性选择相关图像。
- 自动补全建议通过微调的语言模型动态生成,该模型同时基于故事的当前状态和视觉上下文进行条件控制,并通过重排序提升多样性与相关性。
- 系统支持实时用户交互,允许用户接受、拒绝或编辑AI生成的文本和图像建议,反馈用于指导未来的生成。
- 平台将用户输入作为主要叙事驱动力,AI通过富有创意且上下文感知的补全方式增强用户想法并维持创作节奏。
- 反馈回路捕获用户交互(如删除、选择)以优化未来建议,实现用户中心的生成过程自适应。
实验结果
研究问题
- RQ1多模态生成(文本与图像)在互动式故事共创中如何提升叙事连贯性与创造力?
- RQ2在人机协同的叙事系统中,用户反馈与图像检索的整合在多大程度上提升了用户参与度与故事质量?
- RQ3不同类型的AI生成补全(如仅文本 vs. 文本+图像)如何影响用户感知与故事发展?
- RQ4具有实时图像与文本建议的动态交互平台能否在不出现情节偏离的情况下维持长期的叙事推进?
- RQ5在儿童故事生成中,图像的相关性与风格在用户采纳度和感知故事质量方面起到何种作用?
主要发现
- 用户报告称,AI自动补全建议帮助他们克服了写作瓶颈,并保持了叙事节奏,尤其当建议富有创意且与上下文相关时。
- 包含检索图像的故事在感知质量上得分更高,用户指出图像增强了参与度与叙事清晰度。
- 约50–75%的用户拒绝了标准自动补全建议,原因包括重复或语气不符,但当提供更高质量、上下文感知的建议时,拒绝率降至0–25%。
- 用户反馈(包括删除与选择)表明,交互式反馈回路可引导模型更贴近用户特定意图,从而提升个性化程度。
- 平台的公开演示与开源代码支持新故事生成模型的快速部署与评估,为未来多模态NLG研究提供支持。
- 用户对未来的功能表现出强烈兴趣,如风格迁移、故事结尾自动补全以及用户自定义风格微调,表明对更高程度定制化的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。