Skip to main content
QUICK REVIEW

[论文解读] Teaching Machines to Code: Neural Markup Generation with Visual Attention

Sumeet S. Singh|arXiv (Cornell University)|Feb 15, 2018
Multimodal Machine Learning Applications参考文献 33被引用 4
一句话总结

该论文提出了一种带有视觉注意力机制的神经转换器模型,能够从数学公式图像中生成语法正确的LaTeX标记代码,在Im2Latex基准测试中实现了89%的SOTA BLEU分数。该模型采用CNN编码器结合空间池化,以及注意力增强的LSTM解码器,将图像特征映射为LaTeX序列,同时通过注意力可视化实现了无需边界框监督的精确符号定位。

ABSTRACT

We present a neural transducer model with visual attention that learns to generate LaTeX markup of a real-world math formula given its image. Applying sequence modeling and transduction techniques that have been very successful across modalities such as natural language, image, handwriting, speech and audio; we construct an image-to-markup model that learns to produce syntactically and semantically correct LaTeX markup code over 150 words long and achieves a BLEU score of 89%; improving upon the previous state-of-art for the Im2Latex problem. We also demonstrate with heat-map visualization how attention helps in interpreting the model and can pinpoint (detect and localize) symbols on the image accurately despite having been trained without any bounding box data.

研究动机与目标

  • 开发一个端到端的图像到LaTeX标记模型,能够从数学公式图像中生成在语义和句法上均正确的LaTeX代码。
  • 在Im2Latex问题上超越先前的SOTA BLEU分数。
  • 证明模型中的视觉注意力机制能够在无需边界框标注的情况下,实现对图像中符号的可解释性定位。
  • 在序列到序列的标记生成背景下,分析架构变体和损失函数的影响。
  • 探索注意力机制在公式图像中零样本目标检测方面的潜力。

提出的方法

  • 采用带有视觉注意力的编码器-解码器架构,其中深层CNN将输入图像编码为视觉特征网格。
  • 应用空间池化以降低特征图分辨率,生成感受野较窄的局部区域编码。
  • 使用带有深层输出层和注意力机制的LSTM解码器,逐步生成LaTeX标记。
  • 采用束搜索解码与自定义损失函数,以优化序列生成。
  • 将注意力权重可视化为热力图,以解释模型行为并定位图像中的符号。
  • 在大规模渲染LaTeX公式的数据集上,使用监督学习端到端训练模型。

实验结果

研究问题

  • RQ1带有视觉注意力的神经序列到序列模型是否能够在无需显式边界框监督的情况下,从数学公式图像中生成高精度的LaTeX标记?
  • RQ2架构设计(尤其是池化和注意力机制)如何影响图像到标记模型的性能与可解释性?
  • RQ3注意力机制在未使用任何目标检测标注的情况下,能够在多大程度上实现对公式图像中单个符号的定位?
  • RQ4不同的损失函数和模型变体对最终BLEU分数与泛化性能有何影响?
  • RQ5基于注意力的注意力可视化能否作为公式图像中目标检测的代理,实现零样本定位?

主要发现

  • 该模型在I2L-140K数据集上实现了89.0%的BLEU分数,相较于先前SOTA提升了1.27%。
  • 注意力可视化成功实现了对公式图像中单个符号的高精度定位,尽管模型在训练过程中未使用任何边界框数据。
  • 模型正确渲染了99.94%的预测LaTeX序列,表明其具有极强的句法与语义正确性。
  • 使用感受野较窄的空间池化机制,使模型能够聚焦于图像的局部区域,从而支持基于注意力的精准定位。
  • 该模型在未见过的公式上泛化能力良好,在视觉相似性(图像匹配)评估中,70.37%的预测与真实结果一致。
  • 在某些情况下,模型的输出比原始公式更准确,表明其在自动公式纠错方面具有潜在应用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。