[论文解读] Neural Storyboard Artist: Visualizing Stories with Coherent Image Sequences
本文提出了一种灵感激发与创作(inspire-and-create)框架,用于自动漫画分镜生成。该框架首先利用上下文感知的密集视觉-语义匹配模型检索相关电影画面,随后通过区域擦除、风格统一和角色替换等步骤对图像进行精细化处理,以确保视觉一致性和相关性。该方法在域内和域外数据集上均达到最先进性能,在自动评估和人工评测中均展现出优越的定量与定性结果。
A storyboard is a sequence of images to illustrate a story containing multiple sentences, which has been a key process to create different story products. In this paper, we tackle a new multimedia task of automatic storyboard creation to facilitate this process and inspire human artists. Inspired by the fact that our understanding of languages is based on our past experience, we propose a novel inspire-and-create framework with a story-to-image retriever that selects relevant cinematic images for inspiration and a storyboard creator that further refines and renders images to improve the relevancy and visual consistency. The proposed retriever dynamically employs contextual information in the story with hierarchical attentions and applies dense visual-semantic matching to accurately retrieve and ground images. The creator then employs three rendering steps to increase the flexibility of retrieved images, which include erasing irrelevant regions, unifying styles of images and substituting consistent characters. We carry out extensive experiments on both in-domain and out-of-domain visual story datasets. The proposed model achieves better quantitative performance than the state-of-the-art baselines for storyboard creation. Qualitative visualizations and user studies further verify that our approach can create high-quality storyboards even for stories in the wild.
研究动机与目标
- 为解决从多句故事生成连贯、电影感分镜的挑战,该挑战要求具备高视觉相关性与一致性。
- 克服现有基于检索的方法忽略上下文、缺乏灵活性,且导致风格或角色不一致的局限。
- 改进基于生成的方法在高质量、多样化且相关图像合成方面的不足。
- 开发一种系统,利用现有高质量图像作为灵感来源,同时实现灵活、一致且逼真的视觉呈现。
- 实现在域外或复杂故事(如中文成语)中自动创建高质量分镜的能力。
提出的方法
- 提出一种基于上下文感知密集匹配(CADM)模型的故事到图像检索器,通过在故事上下文中动态编码句子的层次注意力机制。
- 采用密集视觉-语义匹配技术,将单个词语与图像区域进行精准对齐,实现精确的图像检索与后续渲染。
- 采用贪婪解码策略在需要时为每句话检索多张互补图像,以提升对长句或复杂句子的覆盖度。
- 实现一个分镜创建器,包含三个渲染步骤:(1) 相关区域分割以擦除图像中无关部分,(2) 风格统一以协调图像间的视觉外观,(3) 半自动3D角色替换以实现角色表示的一致性。
- 将视觉检索与图像精细化处理相结合,以在最终分镜序列中平衡相关性、多样性与一致性。
- 利用预存在的电影图像集合,避免从零开始训练,从而提升真实感与视觉质量。
实验结果
研究问题
- RQ1与单句检索相比,采用上下文建模的基于检索的方法是否能显著提升分镜生成中图像的相关性与连贯性?
- RQ2密集视觉-语义匹配结合词级定位,能否有效提升故事可视化中图像检索的准确性?
- RQ3图像精细化技术(包括区域擦除、风格统一与角色替换)在多大程度上能提升自动生成分镜的视觉一致性?
- RQ4该灵感激发与创作框架能否在极少监督条件下泛化至域外故事(如抽象叙事或成语)?
- RQ5在定量指标与人工评估中,该方法与最先进生成与检索基线相比表现如何?
主要发现
- 所提出的CADM检索器在域内与域外设置下均显著优于基线检索模型,在中文成语故事的人工评估中,'良好'评分从38.4%提升至52.2%,绝对提升14.2个百分点。
- 灵感激发与创作框架在自动指标与人工评估中均达到最先进性能,展现出卓越的视觉一致性和相关性。
- 人工评估显示,77.6%的故事句子得到了合理(良好或尚可)的视觉呈现,表明该方法在多样化故事类型中均具备出色的定性表现。
- 多步渲染流程(包括区域擦除、风格统一与3D角色替换)显著提升了视觉连贯性,最终版本与专业分镜高度接近。
- 该框架在不同故事类型间泛化良好,即使在抽象或文化特定(如中文成语)故事中,仍能保持高视觉检索性能。
- 定性结果显示,上下文感知检索器相比非上下文基线,能更准确且一致地选择图像,尤其在复杂或模糊的句子中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。