[论文解读] LUCSS: Language-based User-customized Colourization of Scene Sketches
LUCSS 是一种基于语言的交互式系统,用于用户自定义场景素描的着色,利用深度神经网络实现实例级分割、生成包含空间关系的描述性字幕,并根据编辑后的文本指令生成着色图像。与基线模型相比,该系统在用户感知的忠实度和视觉质量方面表现更优,尤其在优化对象和背景着色的主干网络方面表现突出。
We introduce LUCSS, a language-based system for interactive col- orization of scene sketches, based on their semantic understanding. LUCSS is built upon deep neural networks trained via a large-scale repository of scene sketches and cartoon-style color images with text descriptions. It con- sists of three sequential modules. First, given a scene sketch, the segmenta- tion module automatically partitions an input sketch into individual object instances. Next, the captioning module generates the text description with spatial relationships based on the instance-level segmentation results. Fi- nally, the interactive colorization module allows users to edit the caption and produce colored images based on the altered caption. Our experiments show the effectiveness of our approach and the desirability of its compo- nents to alternative choices.
研究动机与目标
- 实现复杂场景素描的精确实例级语义分割,这些素描通常稀疏且缺乏丰富的视觉特征。
- 从分割后的素描对象生成描述性、具备空间感知能力的字幕,以弥合视觉与语言理解之间的鸿沟。
- 支持交互式、基于语言的着色,用户通过自然语言编辑而非手动绘画来定制颜色。
- 通过支持语音命令兼容性和草图应用中的多模态交互,提升用户体验。
- 建立一个统一框架,利用深度学习整合分割、字幕生成与着色,用于场景素描。
提出的方法
- 三模块流水线:(1) 使用带有素描特异性归纳偏置的改进 RMI 网络进行实例分割,(2) 使用基于 Transformer 的字幕头建模空间关系进行素描字幕生成,(3) 通过基于 GAN 的着色模块实现文本条件图像生成。
- 分割模块采用改进的 RMI(残差多尺度交互)模块,以增强低纹理、稀疏素描中的特征学习能力。
- 字幕模块利用分割实例的特征,生成包含对象身份和空间关系(如“一棵树在房子后面”)的描述性字幕。
- 着色模块使用带有文本嵌入的条件 GAN,根据编辑后的字幕生成卡通风格的着色图像。
- 系统在大规模场景素描数据集上进行训练,该数据集包含对应的卡通风格着色图像和文本描述。
- 通过允许用户编辑生成的字幕,系统实现用户交互,编辑后的字幕用于生成带有用户指定颜色加粗显示的新着色输出。
实验结果
研究问题
- RQ1深度神经网络能否在传统自然图像模型失效的稀疏、低对比度场景素描中实现准确的实例级分割?
- RQ2视觉-语言模型能否从分割后的素描对象生成语义丰富且空间一致的字幕,以支持下游交互任务?
- RQ3与固定或手动输入颜色相比,用户通过语言编辑字幕在多大程度上提升了素描着色的定制化程度和感知质量?
- RQ4不同主干网络架构(MRU、ResNet、Pix2Pix)在忠实度和视觉质量方面对分割与着色流水线性能有何影响?
- RQ5结合分割、字幕生成与条件图像生成的统一框架,能否产生比现有基线模型更忠实且更具视觉吸引力的结果?
主要发现
- 在用户评估中,MRU-RMI 模型在对象着色任务中显著优于 LBIE 基线模型,无论在忠实度还是有效性研究中均表现出更高的选择率。
- ResNet-RMI 模型在背景着色任务中表现更优,凸显了主干网络选择对不同素描组件的重要性。
- 用户评估表明,LUCSS 生成的结果在与文本描述的忠实度和视觉美感方面,均持续优于基线模型。
- 系统在实例分割任务中实现了接近 60% 的平均掩码精度(mAP),表明仍有提升空间,但已足以支持下游应用。
- 将语言编辑整合到着色流程中,实现了直观的多模态交互,为未来语音命令应用提供了支持。
- 即使面对复杂或不完整的文本指令,系统也能通过补全缺失细节(如遗漏的颜色)成功生成连贯的着色图像。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。