[论文解读] FASTER: A Font-Agnostic Scene Text Editing and Rendering Framework
本文提出FAST,一种与字体无关的场景文本编辑框架,通过基于生成对抗网络(GAN)的架构实现单词级编辑,同时生成掩码并进行风格迁移。通过过滤背景干扰并采用自适应注意力机制,FAST在不同字体样式、大小和单词长度下均实现了卓越的真实感与泛化能力,在基准数据集上的定性和定量评估中均优于先前方法。
Scene Text Editing (STE) is a challenging research problem, that primarily aims towards modifying existing texts in an image while preserving the background and the font style of the original text. Despite its utility in numerous real-world applications, existing style-transfer-based approaches have shown sub-par editing performance due to (1) complex image backgrounds, (2) diverse font attributes, and (3) varying word lengths within the text. To address such limitations, in this paper, we propose a novel font-agnostic scene text editing and rendering framework, named FASTER, for simultaneously generating text in arbitrary styles and locations while preserving a natural and realistic appearance and structure. A combined fusion of target mask generation and style transfer units, with a cascaded self-attention mechanism has been proposed to focus on multi-level text region edits to handle varying word lengths. Extensive evaluation on a real-world database with further subjective human evaluation study indicates the superiority of FASTER in both scene text editing and rendering tasks, in terms of model performance and efficiency. Our code will be released upon acceptance.
研究动机与目标
- 解决现有场景文本编辑(STE)方法在复杂背景、不同字体样式和不同单词长度下表现受限的问题。
- 开发一种以单词为单位进行编辑而非字符级编辑的方法,以减少失真并提高效率。
- 通过将风格迁移与特定字体依赖解耦,实现与字体无关的编辑,支持任意字体样式、大小和颜色。
- 通过在统一的生成对抗网络(GAN)框架中结合掩码生成与风格迁移,保持自然外观并实现无缝融合。
- 通过最小化边界伪影和视觉不一致,提升编辑后文本区域的真实感与一致性。
提出的方法
- 该框架采用具有多尺度跳跃连接的U-Net生成器和PatchGAN判别器,以确保高保真度的图像合成。
- 提出一种新型注意力机制,在低层使用Sigmoid注意力,高层使用自注意力,以增强特征表示和空间建模能力。
- 模型以二值源掩码 $I_A$ 和固定前景掩码 $m_F$ 作为输入,将二者通道拼接为 $m_\theta = (m_A, m_F)$ 以引导编辑过程。
- 采用两阶段训练策略:首先在MOSTEL数据集上进行预训练,然后在MOSTEL与SRNET的混合数据集上进行微调,以提升泛化能力。
- 风格迁移模块采用条件生成对抗网络(cGAN)进行图像到图像的翻译,生成与目标风格匹配的逼真文本图像,同时保留背景上下文。
- 采用数据混合策略,将MOSTEL与SRNET数据集结合,以增强多样性与鲁棒性,提升模型在未见文本布局和字体下的性能。
实验结果
研究问题
- RQ1场景文本编辑框架能否在任意字体、大小和颜色下实现高真实感与一致性?
- RQ2与字符级编辑相比,单词级编辑在失真和背景保留方面表现如何?
- RQ3掩码引导、风格无关的方法在复杂背景和不规则文本布局下的泛化能力有多强?
- RQ4注意力机制设计对场景文本编辑中生成图像质量的影响如何?
- RQ5从多个数据集混合数据在提升模型鲁棒性与泛化能力方面的效果如何?
主要发现
- 消融实验证明,将低层的Sigmoid注意力与高层的自注意力结合可取得最佳性能,MSE为0.0171,PSNR为19.04,SSIM为0.707。
- 使用MOSTEL与SRNET的混合数据集训练优于单一数据集训练,MSE降低至0.0162,PSNR提升至19.19,SSIM提升至0.718。
- 在输入中同时包含源图像 $I_A$ 和二值掩码 $m_A$ 显著提升性能,MSE降至0.0135,PSNR达20.20,优于仅使用掩码的模型。
- 该模型在Real数据集上达到最先进水平,相比先前方法展现出更优的视觉真实感与更少的边界伪影。
- 失败案例主要出现在重叠或扭曲文本的复杂布局中,此时准确的掩码生成仍具挑战。
- 该方法对不同单词长度具有鲁棒性,可生成与源文本字符数不同的目标文本,证实其在真实编辑任务中的灵活性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。