Skip to main content
QUICK REVIEW

[论文解读] End-to-End Attention-based Image Captioning

Carola Sundaramoorthy, Lin Ziwen Kelvin|arXiv (Cornell University)|Apr 30, 2021
Multimodal Machine Learning Applications参考文献 26被引用 7
一句话总结

该论文提出了一种基于视觉变换器(ViT)的端到端模型,用于分子图像字幕生成,用纯变换器架构替代传统的CNN+RNN编码器,以提升在噪声较大或特征较少的分子图像上的性能。该模型在InChI生成任务上的平均Levenshtein距离达到6.95,相较于ResNet+LSTM基线模型,编辑距离减少了15%。

ABSTRACT

In this paper, we address the problem of image captioning specifically for molecular translation where the result would be a predicted chemical notation in InChI format for a given molecular structure. Current approaches mainly follow rule-based or CNN+RNN based methodology. However, they seem to underperform on noisy images and images with small number of distinguishable features. To overcome this, we propose an end-to-end transformer model. When compared to attention-based techniques, our proposed model outperforms on molecular datasets.

研究动机与目标

  • 解决基于规则的方法和CNN+RNN模型在从噪声较大或特征较少的分子图像中生成准确InChI表示式时的局限性。
  • 通过利用变换器的自注意力机制,实现对长距离和局部特征的更好建模,从而提升分子翻译性能。
  • 开发一种简单、可端到端训练的模型,避免手工设计的特征提取,并减少对领域特定规则的依赖。
  • 评估视觉变换器在分子结构识别和InChI生成中的有效性,特别是在来自科学出版物的真实世界不完美图像上的表现。

提出的方法

  • 在标准图像字幕生成流程中,用视觉变换器(ViT)替代CNN编码器,以提取无卷积归纳偏置的基于图像块的表征。
  • 使用标准变换器解码器,通过自回归解码逐个token生成InChI字符串,条件依赖于图像特征。
  • 实现缓存机制,用于在解码步骤中存储并重用编码器输出和已解码的token嵌入,以减少冗余计算。
  • 通过分离编码器和解码器模块来优化推理速度,实现编码器输出的单次计算,并在自回归生成过程中重复使用。
  • 采用逐层缓存隐藏状态而非注意力矩阵,将每步解码的时间复杂度从O(N³)降低至O(MN + N²)。
  • 在结合Bristol-Myers Squibb、GDB-13和增强分子图像的数据集上,使用交叉熵损失进行端到端训练。

实验结果

研究问题

  • RQ1纯变换器编码器-解码器模型是否能在从分子结构图像生成InChI表示式方面超越CNN+RNN模型?
  • RQ2ViT编码器捕捉长距离依赖的能力如何提升在噪声较大或特征较少的分子图像上的性能?
  • RQ3输出缓存和模块分离等架构优化在不牺牲准确性的前提下,能在多大程度上减少推理时间?
  • RQ4提高输入分辨率(如384×384)和图像块大小(16×16)是否能提升模型性能,以及这如何影响序列长度约束?

主要发现

  • 基于ViT的模型在InChI生成任务上的平均Levenshtein距离为6.95,相较于最佳性能的ResNet+LSTM基线模型(7.49)提升了15%。
  • 将变换器层数从3层增加到24层显著提升了模型准确率,24层在测试集上取得了最佳性能。
  • 该模型优于所有CNN+RNN基线模型,包括参数更多、训练时间更长的ResNet50+LSTM模型(Levenshtein距离为7.49)。
  • 缓存和模块分离技术将推理时间复杂度从O(N³)降低至O(MN + N²),实现了更快的自回归解码,且几乎无需重新计算。
  • 在384×384图像上使用16×16图像块进行训练,性能优于224×224输入,表明更长的序列长度能更好地发挥自注意力机制的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。