Skip to main content
QUICK REVIEW

[论文解读] DeepWriting: Making Digital Ink Editable via Deep Generative Modeling

Emre Aksan, Fabrizio Pece|arXiv (Cornell University)|Jan 25, 2018
Handwritten Text Recognition Techniques参考文献 10被引用 8
一句话总结

本文提出 DeepWriting,一种深度生成模型,通过条件变分循环神经网络(C-VRNN)将手写风格与内容解耦,实现通过风格迁移、逐字编辑和文本到手写生成实现可编辑的数字笔迹。主要贡献在于学习到的潜在表征可将风格与内容解耦,从而在保留个人书写特征的同时,实现对生成和编辑的完全控制。

ABSTRACT

Digital ink promises to combine the flexibility and aesthetics of handwriting and the ability to process, search and edit digital text. Character recognition converts handwritten text into a digital representation, albeit at the cost of losing personalized appearance due to the technical difficulties of separating the interwoven components of content and style. In this paper, we propose a novel generative neural network architecture that is capable of disentangling style from content and thus making digital ink editable. Our model can synthesize arbitrary text, while giving users control over the visual appearance (style). For example, allowing for style transfer without changing the content, editing of digital ink at the word level and other application scenarios such as spell-checking and correction of handwritten text. We furthermore contribute a new dataset of handwritten text with fine-grained annotations at the character level and report results from an initial user evaluation.

研究动机与目标

  • 解决在保留个性化手写风格的同时使数字笔迹可编辑的挑战。
  • 开发一种深度生成模型,能够对手写内容与风格进行解耦,以实现灵活的编辑与生成。
  • 支持在手写数字笔迹上实现拼写检查、自动更正和风格迁移等应用。
  • 收集并发布一个大规模、字符级标注的手写文本数据集,涵盖 294 位作者,以支持未来研究。
  • 提供模型的开源实现,以促进社区采纳与进一步扩展。

提出的方法

  • 该方法采用条件变分循环神经网络(C-VRNN),将内容与风格建模为具有独立分布的潜在变量。
  • 通过循环变分自编码器(RVAE)对内容进行建模,将字符序列编码到潜在空间。
  • 通过独立的潜在分布对风格进行建模,以捕捉用户特有的书写特征,如倾斜度、大小和压力。
  • 采用一种新型的训练与采样算法,实现通过独立控制内容与风格潜在变量的条件生成。
  • 该架构支持条件生成:从输入文本生成笔迹、在不同写作者之间迁移风格,以及对单个单词进行编辑。
  • 对原始触控笔数据应用了字符级分割流程,以生成用于训练与评估的细粒度标注。

实验结果

研究问题

  • RQ1深度生成模型能否有效解耦手写风格与内容,以实现可编辑的数字笔迹?
  • RQ2该模型在保持内容准确性的同时,能否在不同写作者之间实现良好的风格迁移?
  • RQ3用户在多大程度上能够通过所提出的框架对手写文本进行逐字编辑?
  • RQ4该模型在生成连笔与非连笔手写风格方面表现如何?
  • RQ5细粒度的字符级标注对模型性能及下游应用有何影响?

主要发现

  • 该模型成功实现内容与风格的解耦,能够根据用户定义的视觉外观,从输入文本条件生成数字笔迹。
  • 系统支持在不改变内容的前提下,在手写样本之间实现风格迁移,用户评估场景已验证该能力。
  • 数字笔迹的逐字编辑在初步评估中是可行的,且用户反馈积极。
  • 该模型在生成非连笔(非连笔)手写风格方面表现更高保真度,而连笔风格的生成仍存在当前局限。
  • 所提出的包含 294 位作者的字符级标注数据集,增强了 IAM-OnDB 数据集,支持对手写模型的稳健训练与评估。
  • 已公开发布模型与数据集的开源实现,以支持可复现性与进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。