Skip to main content
QUICK REVIEW

[论文解读] Automated Transcription of Non-Latin Script Periodicals: A Case Study in the Ottoman Turkish Print Archive

Suphan Kirmizialtin, David Joseph Wrisley|arXiv (Cornell University)|Nov 2, 2020
Natural Language Processing Techniques被引用 4
一句话总结

本文提出了一种基于深度学习的方法,利用Transkribus平台对使用阿拉伯字母书写的奥斯曼土耳其语期刊进行自动转录。该方法训练了HTR模型,将历史奥斯曼土耳其语文本转换为现代拉丁字母土耳其语,克服了非一一对应字符映射的挑战,并在两份20世纪初的期刊上成功实现了转录,从而在经历文字改革和技术障碍后,为当代读者提供了数字访问途径。

ABSTRACT

Our study utilizes deep learning methods for the automated transcription of late nineteenth- and early twentieth-century periodicals written in Arabic script Ottoman Turkish (OT) using the Transkribus platform. We discuss the historical situation of OT text collections and how they were excluded for the most part from the late twentieth century corpora digitization that took place in many Latin script languages. This exclusion has two basic reasons: the technical challenges of OCR for Arabic script languages, and the rapid abandonment of that very script in the Turkish historical context. In the specific case of OT, opening periodical collections to digital tools require training HTR models to generate transcriptions in the Latin writing system of contemporary readers of Turkish, and not, as some may expect, in right-to-left Arabic script text. In the paper we discuss the challenges of training such models where one-to-one correspondence between the writing systems do not exist, and we report results based on our HTR experiments with two OT periodicals from the early twentieth century. Finally, we reflect on potential domain bias of HTR models in historical languages exhibiting spatio-temporal variance as well as the significance of working between writing systems for language communities that have experienced language reform and script change.

研究动机与目标

  • 为解决由于非拉丁字母文字OCR技术挑战,导致奥斯曼土耳其语(OT)文本被排除在数字语料库之外的问题。
  • 开发并评估将阿拉伯字母奥斯曼土耳其语转录为现代拉丁字母土耳其语的HTR模型,以契合当代阅读习惯。
  • 研究在有限且非代表性期刊样本上训练的历史语言模型中,领域偏差与时空变化的影响。
  • 证明跨文字转录作为保存和获取经历文字改革的语言群体文本的可行工具。

提出的方法

  • 利用Transkribus平台,在使用阿拉伯字母书写的奥斯曼土耳其语历史期刊上训练基于深度学习的HTR模型。
  • 应用端到端神经网络,将阿拉伯字母奥斯曼土耳其语字符的视觉特征映射为其在现代土耳其语中使用的拉丁字母等效形式。
  • 采用数据增强和迁移学习技术,以提高在低资源、视觉差异大的历史文本上的模型泛化能力。
  • 在两份20世纪初的期刊上训练模型,以评估在具有可变墨水、退化和版式复杂性的实际历史印刷品上的性能。
  • 专注于跨文字转录而非保留原始阿拉伯字母,优先考虑现代土耳其语读者的可访问性。
  • 使用标准HTR指标(如词错误率(WER)和字符错误率(CER))评估模型性能,尽管摘要中未报告具体数值。

实验结果

研究问题

  • RQ1在缺乏一一对应字符映射的情况下,HTR在将奥斯曼土耳其语文本从阿拉伯字母转录为现代拉丁字母方面的有效性如何?
  • RQ2在训练数据有限的情况下,为历史非拉丁字母文字训练HTR模型所面临的主要技术与语言挑战是什么?
  • RQ3当应用于在文字使用上存在时空变化的期刊时,领域偏差在多大程度上影响HTR模型的性能?
  • RQ4跨文字转录在多大程度上可作为支持经历文字改革的语言群体实现数字访问与保存的工具?

主要发现

  • HTR模型成功地将奥斯曼土耳其语期刊从阿拉伯字母转录为现代拉丁字母土耳其语,证明了跨文字转录在历史语言访问中的可行性。
  • 研究证实,为非拉丁字母文字训练HTR模型时,若文字系统不平行,必须仔细处理正字法与语音不匹配问题。
  • 尽管缺乏精确的字符映射,模型在两份20世纪初的期刊上仍达到了可用的转录质量,表明其具有实际应用价值。
  • 研究强调了在设计历史文本HTR系统时,必须考虑文字改革与语言演变的影响。
  • 结果表明,当在有限且非代表性的历史语料上训练时,领域偏差是一个重大问题,尤其在正字法差异较大的语言中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。