Skip to main content
QUICK REVIEW

[论文解读] ICDAR 2019 Competition on Image Retrieval for Historical Handwritten Documents

Vincent Christlein, Anguelos Nicolaou|arXiv (Cornell University)|Dec 8, 2019
Advanced Image and Video Retrieval Techniques参考文献 14被引用 35
一句话总结

对历史文献的作者检索进行大规模评估,使用来自1万名作者的20,000张图像,涵盖手稿、信件和特许状,表明非深度学习方法也能具备竞争力,且 SIFT+Pathlet 达到最佳性能。

ABSTRACT

This competition investigates the performance of large-scale retrieval of historical document images based on writing style. Based on large image data sets provided by cultural heritage institutions and digital libraries, providing a total of 20 000 document images representing about 10 000 writers, divided in three types: writers of (i) manuscript books, (ii) letters, (iii) charters and legal documents. We focus on the task of automatic image retrieval to simulate common scenarios of humanities research, such as writer retrieval. The most teams submitted traditional methods not using deep learning techniques. The competition results show that a combination of methods is outperforming single methods. Furthermore, letters are much more difficult to retrieve than manuscripts.

研究动机与目标

  • 在历史文献中激发作者检索并通过实用的检索基准推动大规模人文研究。
  • 提供一个公开的数据集,包含来自10,000位作者的20,000张文献图像,涵盖手稿、信件与特许状。
  • 评估多种非深度学习和有限机器学习方法在多样化、嘈杂的历史数据上的作者检索效果。

提出的方法

  • 使用一个公开的20,000图像测试集,其中7,500名单页作者和12,500页来自多页作者,用于模拟作者检索任务。
  • 在基于距离的检索框架下评估来自三支队伍的九个提交,以及先前方法的两个基线变体。
  • 用手工特征(LBP、基于SIFT的Fisher向量、Pathlet)和简单分类器或距离度量来表示图像;没有全深度学习模型主导基线结果。
  • 通过裁剪边框并将图像调整为统一尺寸的预处理,控制容易的哈希攻击和下载效率。
  • 通过在测试集上进行逐图留一交叉验证计算平均精度均值(mAP)和Top-1准确率。

实验结果

研究问题

  • RQ1在大规模历史数据集上,传统(非深度学习)作者检索方法的性能如何?
  • RQ2特征类型(基于纹理的LBP、基于SIFT的Fisher向量、Pathlet)及其组合在不同文档类型的作者检索中表现如何?
  • RQ3手稿与信件之间的检索难度是否不同,以及数据子集(MSS、Letters A/B、Charters)之间是否存在差异?

主要发现

  • SCUT 团队在完整测试集上使用 SIFT 与 Pathlet 特征组合实现了最高的 mAP(90.6%)。
  • 最佳总体结果为 SIFT+Pathlet 组合,在完整数据集上的 mAP 为 92.5%,Top-1 准确率为 97.4%。
  • 基线 SRS-LBP 的变体取得强劲结果(mAP 84.0–86.8%),有时可与更复杂的方法相抗衡。
  • 传统方法(如 Hinge、Co-Hinge、oBIFs)获得了有竞争力的 mAP(约75–85%),表明非神经网络方法仍然有效。
  • 信件的检索明显比手稿困难,Letters A 子集的性能显著较低(mAP 大约 45–47%)。
  • 总体而言,此次比赛中没有神经网络检索方法占主导;在一次提交中使用了基于CNN的预处理进行二值化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。