Skip to main content
QUICK REVIEW

[论文解读] CoSE: Compositional Stroke Embeddings

Emre Aksan, Thomas Deselaers|arXiv (Cornell University)|Jun 17, 2020
Handwritten Text Recognition Techniques参考文献 38被引用 12
一句话总结

CoSE 提出了一种用于复杂笔画基绘图的组合生成模型,通过将绘图视为可变长度笔画的无序集合,并利用可学习的潜在空间将局部笔画外观与全局结构组合解耦。该模型在预测复杂图表和流程图方面优于先前的序列方法,在 DiDi、QuickDraw 和 IAM-OnDB 数据集上通过端到端可训练的自编码器和潜在空间中的关系预测器,实现了更优的重建和预测精度。

ABSTRACT

We present a generative model for complex free-form structures such as stroke-based drawing tasks. While previous approaches rely on sequence-based models for drawings of basic objects or handwritten text, we propose a model that treats drawings as a collection of strokes that can be composed into complex structures such as diagrams (e.g., flow-charts). At the core of the approach lies a novel autoencoder that projects variable-length strokes into a latent space of fixed dimension. This representation space allows a relational model, operating in latent space, to better capture the relationship between strokes and to predict subsequent strokes. We demonstrate qualitatively and quantitatively that our proposed approach is able to model the appearance of individual strokes, as well as the compositional structure of larger diagram drawings. Our approach is suitable for interactive use cases such as auto-completing diagrams. We make code and models publicly available at https://eth-ait.github.io/cose.

研究动机与目标

  • 为解决基于序列的模型在生成复杂、组合性绘图(如流程图和图表)方面的局限性。
  • 在笔画基数据中将局部笔画外观与全局结构组合解耦,以改善生成建模。
  • 通过在固定维数潜在空间中的关系模型,实现在稀疏初始笔画下的交互式自动补全。
  • 证明通过学习一种平衡且解耦的潜在表征,可在支持重建和组合推理的同时实现更优的预测性能。

提出的方法

  • 该模型将一幅绘图视为一组无序的笔画,其中每条笔画是一系列 2D 坐标,以消除对笔画顺序的依赖。
  • 一个深度自编码器将可变长度的笔画映射到固定维数的潜在空间,同时保留局部外观和结构上下文。
  • 关系模型在潜在空间中运行,基于当前笔画集合预测未来的笔画嵌入,使用基于高斯混合模型(GMM)的多模态分布进行不确定性建模。
  • 解码器从预测的潜在嵌入重建笔画,整个模型通过仅在编码器-解码器上使用重建损失进行端到端训练,且梯度不反向传播至关系模型。
  • 该架构在关系模型中使用包含 10 个分量的 GMM 作为随机性的主要来源,提升了预测的多样性与准确性。
  • 该模型在 DiDi(复杂图表)、QuickDraw(自由草图)和 IAM-OnDB(手写)数据集上进行评估,并对 GMM 分量数量和梯度流进行了消融研究。

实验结果

研究问题

  • RQ1一个将绘图视为笔画无序集合的生成模型,是否能在预测复杂图表结构方面优于基于序列的模型?
  • RQ2将局部笔画外观与全局组合结构解耦,是否能带来更好的重建和预测性能?
  • RQ3潜在空间表征的选择如何影响模型在多样化笔画基数据(如图表、草图和手写)上的泛化能力?
  • RQ4架构选择(如梯度流和 GMM 分量数量)对关系模型预测性能的影响如何?

主要发现

  • 在 DiDi 数据集上,所提出的 CoSE 模型实现了 0.0136 的重建误差(Recon. CD)和 0.0442 的预测误差(Pred. CD),优于基线模型。
  • 在关系模型中使用 10 个或更多 GMM 分量显著提升了预测性能,最终模型采用 10 个分量。
  • 将梯度反向传播至编码器会增加重建和预测误差(分别达到 0.0162 和 0.0470),表明隔离关系模型有助于保持更好的解耦性。
  • 定性结果表明,CoSE 即使在稀疏初始笔画下也能生成连贯且上下文合理的图表延续,而 SketchRNN 等基线模型在复杂结构上表现失败。
  • CoSE 中学习到的潜在空间实现了更好的泛化能力和组合推理能力,这在 DiDi、QuickDraw 和 IAM-OnDB 等多样化数据集上的性能提升中得到验证。
  • 该模型展现出强大的交互潜力,其概念验证演示展示了基于用户输入实时自动补全图表的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。