Skip to main content
QUICK REVIEW

[论文解读] Transformer-based HTR for Historical Documents

Phillip Ströbel, Simon Clematide|arXiv (Cornell University)|Mar 21, 2022
Natural Language Processing Techniques被引用 5
一句话总结

本论文提出在早期现代拉丁文手稿上微调预训练的TrOCR模型——一种视觉-语言Transformer架构——以实现手写文本识别(HTR)。尽管在预训练阶段从未接触过拉丁文或历史手写体,TrOCR LARGE在鲁道夫·格瓦尔特的诗歌上实现了2.55%的CER,在海因里希·布吕宁格的书信上实现了16.53%的CER,相较于强大的HTR+基线模型,在多作者测试集上提升了4.6个百分点,证明其在未见过的手写风格和语言上具备出色的零样本迁移能力。

ABSTRACT

We apply the TrOCR framework to real-world, historical manuscripts and show that TrOCR per se is a strong model, ideal for transfer learning. TrOCR has been trained on English only, but it can adapt to other languages that use the Latin alphabet fairly easily and with little training material. We compare TrOCR against a SOTA HTR framework (Transkribus) and show that it can beat such systems. This finding is essential since Transkribus performs best when it has access to baseline information, which is not needed at all to fine-tune TrOCR.

研究动机与目标

  • 评估预训练的TrOCR模型(最初在英文印刷体和合成手写体上训练)是否能泛化至低资源、历史变化显著的拉丁文手稿。
  • 评估TrOCR在未接触过拉丁文或历史手写体风格的情况下,是否能在早期现代手稿上实现高水平的HTR性能。
  • 在单作者和多作者手稿集合上,对比TrOCR与强大HTR+基线模型的性能表现。
  • 探究TrOCR作为数字人文领域中多样化、异构手稿集合的稳健且可迁移HTR模型的潜力。

提出的方法

  • 在两个拉丁文手稿数据集上微调了TrOCR BASE和TrOCR LARGE模型:鲁道夫·格瓦尔特16世纪诗集的4,037行文本,以及海因里希·布吕宁格书信的16,584行文本。
  • 采用TrOCR中的预训练视觉编码器(BEiT)和基于RoBERTa的解码器,初始化时使用ImageNet-1K预训练权重,并在手稿图像和文本转写上进行微调。
  • 通过Transkribus应用数据增强和版面分析,从扫描手稿中提取逐行图像-文本对齐数据。
  • 在Gwalther数据集上最多训练50个周期,在Bullinger数据集上最多训练20个周期,采用早停策略并监控验证集表现。
  • 使用验证集和测试集上的字符错误率(CER)评估性能,并与HTR+基线进行比较。
  • 采用3,603/433的划分比例处理Gwalther数据,Bullinger数据则采用13,843/1,685/1,056的划分,以确保评估的稳健性。

实验结果

研究问题

  • RQ1尽管在预训练阶段未接触过拉丁文或历史手写体,TrOCR是否仍能泛化至拉丁文手稿?
  • RQ2TrOCR在低资源、多作者手稿集合上是否优于现有HTR模型(如HTR+)?
  • RQ3微调时长如何影响TrOCR在风格多样的历史手写体上的性能表现?
  • RQ4TrOCR是否能在无需基线信息的情况下实现优异性能,而无需像传统HTR模型那样依赖先验知识?
  • RQ5TrOCR LARGE架构是否在多样化手稿数据上始终优于TrOCR BASE?

主要发现

  • 在鲁道夫·格瓦尔特诗歌的验证集上,TrOCR LARGE实现了2.55%的CER,优于HTR+基线的2.74%,领先0.19个百分点。
  • 在多作者的布吕宁格书信数据集上,TrOCR LARGE在测试集上实现了16.53%的CER,优于HTR+基线的21.13%,领先4.60个百分点。
  • TrOCR LARGE在较长微调周期下持续提升性能,在15个周期时达到峰值,CER为2.55%,表现最佳。
  • TrOCR BASE在超过10个周期后性能开始下降,表明在该数据集上存在过拟合或学习动态欠佳的问题。
  • 尽管在预训练阶段未接触过拉丁文或早期现代手写体,TrOCR LARGE仍能有效泛化至单作者和多作者手稿集合。
  • 结果表明,TrOCR是一种高度可迁移的HTR模型,具备对新语言和手写风格实现零样本适应的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。