Skip to main content
QUICK REVIEW

[论文解读] Multi-Scale Attention with Dense Encoder for Handwritten Mathematical Expression Recognition

Jianshu Zhang, Jun Du|arXiv (Cornell University)|Jan 5, 2018
Handwritten Text Recognition Techniques参考文献 25被引用 20
一句话总结

本文提出了一种结合密集编码器的多尺度注意力机制,用于手写数学表达式识别,提升了特征提取能力并保留了池化操作中丢失的细粒度细节。通过引入DenseNet以增强梯度流动,并结合多尺度注意力机制关注高分辨率与低分辨率特征,该模型在仅使用官方训练数据的情况下,在CROHME 2014上实现了52.8%的最先进准确率,在CROHME 2016上实现了50.1%的最先进准确率。

ABSTRACT

Handwritten mathematical expression recognition is a challenging problem due to the complicated two-dimensional structures, ambiguous handwriting input and variant scales of handwritten math symbols. To settle this problem, we utilize the attention based encoder-decoder model that recognizes mathematical expression images from two-dimensional layouts to one-dimensional LaTeX strings. We improve the encoder by employing densely connected convolutional networks as they can strengthen feature extraction and facilitate gradient propagation especially on a small training set. We also present a novel multi-scale attention model which is employed to deal with the recognition of math symbols in different scales and save the fine-grained details that will be dropped by pooling operations. Validated on the CROHME competition task, the proposed method significantly outperforms the state-of-the-art methods with an expression recognition accuracy of 52.8% on CROHME 2014 and 50.1% on CROHME 2016, by only using the official training dataset.

研究动机与目标

  • 解决手写数学表达式识别中复杂二维结构、书写模糊性以及符号尺度变化带来的挑战。
  • 克服传统方法依赖预定义语法规则和复杂解析算法的局限性。
  • 改善特征表示,并保留基于CNN编码器的池化过程中丢失的细粒度细节。
  • 开发一种端到端可训练的数据驱动模型,消除对手动符号分割的依赖。

提出的方法

  • 采用密集连接卷积网络(DenseNet)作为编码器,以增强特征提取并改善梯度流动,尤其适用于小规模数据集。
  • 提出一种多尺度密集编码器,生成低分辨率(语义丰富)和高分辨率(细节保留)的特征图。
  • 设计一种多尺度注意力机制,使解码器在序列生成过程中能够同时关注高分辨率与低分辨率分支的特征。
  • 采用基于注意力的编码器-解码器框架,解码器以逐 token 的方式生成LaTeX字符串,并通过多尺度特征关注相关图像区域。
  • 在DenseNet中使用跳跃连接,将所有前序层的特征图进行拼接,以增强特征复用与表征学习。
  • 采用交叉熵损失在图像到LaTeX序列映射上进行端到端训练,并在推理时使用束搜索(beam search)。

实验结果

研究问题

  • RQ1与标准CNN相比,密集连接编码器是否能提升手写数学表达式识别中的特征表征能力和识别准确率?
  • RQ2引入多尺度注意力是否有助于恢复池化过程中丢失的细粒度视觉细节,特别是小符号(如小数点)?
  • RQ3在CROHME 2014和CROHME 2016等标准基准上,该方法在仅使用官方训练数据的情况下,与最先进方法相比表现如何?
  • RQ4多尺度注意力机制在多大程度上减少了对小符号或模糊符号的误解析错误?
  • RQ5该模型在不依赖外部或私有训练数据的情况下,能否在不同数据集上实现良好泛化?

主要发现

  • 所提模型在CROHME 2014测试集上实现了52.8%的表达式识别准确率,优于所有仅使用官方训练数据的其他系统。
  • 在CROHME 2016基准上,模型达到50.1%的准确率,超过第二名系统(Wiris,49.6%),展现出强大的泛化能力。
  • 多尺度注意力机制成功恢复了小符号(如小数点)和数字(如'7')等常被单尺度注意力模型忽略的细节。
  • 可视化结果证实,高分辨率注意力分支能够检测到低分辨率特征图中丢失的细粒度细节(如'3.14'中的小数点)。
  • 密集编码器通过增强特征学习与梯度流动提升了性能,尤其在训练数据有限时更具优势。
  • 在CROHME 2014上,模型在允许一个符号误差范围内的预测准确率达到72.7%,表明其具备强大鲁棒性,并具有进一步提升的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。