Skip to main content
QUICK REVIEW

[论文解读] Sequential Dual Deep Learning with Shape and Texture Features for Sketch Recognition

Qi Jia, Meiyu Yu|arXiv (Cornell University)|Aug 9, 2017
Advanced Image and Video Retrieval Techniques参考文献 19被引用 11
一句话总结

本文提出一种顺序双分支深度学习框架,通过门控循环单元(GRUs)联合建模形状与纹理特征,提升草图识别对笔画顺序变化的鲁棒性。通过编码形状上下文特征并利用 Sketch-A-Net 提取纹理特征,该方法通过双 GRU 与联合贝叶斯融合实现双模态融合,在 TU-Berlin 数据集上达到 92.2% 的准确率,优于当前最先进方法超过 7 个百分点。

ABSTRACT

Recognizing freehand sketches with high arbitrariness is greatly challenging. Most existing methods either ignore the geometric characteristics or treat sketches as handwritten characters with fixed structural ordering. Consequently, they can hardly yield high recognition performance even though sophisticated learning techniques are employed. In this paper, we propose a sequential deep learning strategy that combines both shape and texture features. A coded shape descriptor is exploited to characterize the geometry of sketch strokes with high flexibility, while the outputs of constitutional neural networks (CNN) are taken as the abstract texture feature. We develop dual deep networks with memorable gated recurrent units (GRUs), and sequentially feed these two types of features into the dual networks, respectively. These dual networks enable the feature fusion by another gated recurrent unit (GRU), and thus accurately recognize sketches invariant to stroke ordering. The experiments on the TU-Berlin data set show that our method outperforms the average of human and state-of-the-art algorithms even when significant shape and appearance variations occur.

研究动机与目标

  • 解决在笔画顺序与草图风格存在高类内差异情况下的草图识别挑战。
  • 克服现有方法仅依赖纹理或几何特征,或忽略笔画顺序的局限性。
  • 通过在顺序递归架构中联合建模形状与纹理特征,提升识别准确率。
  • 验证形状特征在区分纹理相似但几何结构不同的草图中的有效性。
  • 证明联合贝叶斯融合在时间步长上动态加权特征以提升分类性能的优越性。

提出的方法

  • 将每幅草图划分为五个顺序笔画组,以建模绘制过程的时间演化。
  • 提取编码后的形状上下文特征以表示几何结构,并使用预训练的 Sketch-A-Net 提取深层纹理特征。
  • 两个独立的门控循环网络(GRUs)分别处理纹理与形状特征,以保留模态特异性表示。
  • 在每个时间步长将两个 GRU 的输出拼接,并输入到第三个 GRU 中实现跨模态特征融合。
  • 应用联合贝叶斯融合,为时间步长上的特征分配动态权重,增强判别能力。
  • 对最终融合的特征应用求和池化(sumpooling)以实现草图分类。

实验结果

研究问题

  • RQ1通过双分支顺序学习框架结合形状与纹理特征,能否提升草图识别准确率?
  • RQ2编码后的形状上下文特征在区分纹理相似但几何结构不同的草图方面有多有效?
  • RQ3将笔画分组而非单个笔画进行建模,能在多大程度上降低对笔画顺序变化的敏感性?
  • RQ4联合贝叶斯融合是否通过自适应加权时间步长上的特征来提升分类性能?
  • RQ5所提方法能否在 TU-Berlin 基准测试中超越人类水平表现与当前最先进方法?

主要发现

  • 所提方法在 TU-Berlin 数据集上达到 92.2% 的识别准确率,显著优于当前最先进方法超过 7 个百分点。
  • 不使用形状特征的方法在所有查询草图上均失败,而使用形状特征的方法可正确分类所有查询,证明形状在区分相似纹理中的关键作用。
  • 联合贝叶斯融合将识别准确率从仅使用 softmax 的 88.2% 提升至 92.2%,证实其在时间步长上加权特征的有效性。
  • 该方法能正确区分细微差异,例如麻雀与鹦鹉的喙部,二者在纹理上视觉相似但形状迥异。
  • 即使不使用联合贝叶斯融合,仅引入形状特征即可实现正确分类,证明其具备独立的判别能力。
  • 该方法在 TU-Berlin 数据集上的性能超过人类平均识别率 73%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。