Skip to main content
QUICK REVIEW

[论文解读] ICFHR 2020 Competition on Image Retrieval for Historical Handwritten Fragments

Mathias Seuret, Anguelos Nicolaou|arXiv (Cornell University)|Oct 20, 2020
Handwritten Text Recognition Techniques参考文献 14被引用 4
一句话总结

本论文介绍了 ICFHR 2020 历史手写碎片图像检索竞赛,提出一个大规模数据集,包含来自 9,800 位作者的 20,000 份文献中的 120,000 多个碎片。该竞赛评估了基于深度学习和自监督模型的作者与页面碎片检索方法,优胜方案在自监督描述符学习下 mAP 低于 40%,凸显了在历史文献分析中处理小型、不规则碎片的挑战。

ABSTRACT

This competition succeeds upon a line of competitions for writer and style analysis of historical document images. In particular, we investigate the performance of large-scale retrieval of historical document fragments in terms of style and writer identification. The analysis of historic fragments is a difficult challenge commonly solved by trained humanists. In comparison to previous competitions, we make the results more meaningful by addressing the issue of sample granularity and moving from writer to page fragment retrieval. The two approaches, style and author identification, provide information on what kind of information each method makes better use of and indirectly contribute to the interpretability of the participating method. Therefore, we created a large dataset consisting of more than 120 000 fragments. Although the most teams submitted methods based on convolutional neural networks, the winning entry achieves an mAP below 40%.

研究动机与目标

  • 为解决在文化遗产应用中检索历史手写碎片的挑战,特别是抄本中的边缘注释与行间批注。
  • 通过扩大数据集规模并从作者识别转向碎片级检索,提升检索准确率,超越以往竞赛。
  • 评估基于作者与基于页面的检索任务在可解释性与性能上的差异。
  • 利用半自动碎片化技术,创建公开可用的大规模基准数据集,用于历史文献图像检索。
  • 比较深度学习模型、自监督学习与传统方法在小型、不规则碎片上的有效性。

提出的方法

  • 基于钻石-方形算法的半自动碎片化流程,从高分辨率文档图像中生成随机形状与矩形形状的碎片。
  • 通过使用边缘阈值对钻石-方形高度图进行二值化,生成随机形状碎片,以控制碎片分离程度。
  • 利用非线性、前向移动的多边形链沿水平与垂直轴生成矩形碎片,以模拟自然切割效果。
  • 数据集包含约 20,000 份文献中的超过 120,000 个碎片,涵盖 9,800 位不同作者,划分为训练集、验证集与测试集。
  • 四支团队提交了方法,包括双路径网络、自监督 ResNet20 与基于 SIFT 的基线检索方法,评估指标为 mAP、Pr@10 与 Pr@100。
  • 研究比较了不同碎片尺寸(有效像素数)、形状类型(随机 vs. 矩形)与任务类型(作者 vs. 页面检索)下的性能表现。

实验结果

研究问题

  • RQ1不同深度学习架构在小型、不规则历史手写碎片检索任务中的表现如何?
  • RQ2自监督与作者监督模型在跨碎片类型与尺寸的泛化能力上有多大差异?
  • RQ3碎片的形状与像素密度是否显著影响不同方法的检索性能?
  • RQ4自监督学习是否能在无作者标注的情况下取得具有竞争力的结果?与监督方法相比表现如何?
  • RQ5传统方法如基于 SIFT 的检索与现代深度学习模型在该碎片级检索任务中的表现有何差异?

主要发现

  • 优胜方法基于自监督描述符学习(ResNet20_ssl)在页面碎片检索任务中表现最佳,mAP 与 Top-1 准确率均最高。
  • 使用作者标签训练的 TwoPath 模型(TwoPath_writer)优于用于页面检索训练的 TwoPath 模型(TwoPath_page),表明作者监督有助于提升泛化能力。
  • 对于小碎片(10,000–100,000 个有效像素),TwoPath 模型表现更优;而对于较大、近似矩形的碎片,ResNet20_ssl 表现超越它们。
  • 依赖 SIFT 关键点的方法表现较差,可能因背景干扰所致;而基线方法表现强劲,接近顶尖方案。
  • 矩形碎片(像素密度 0.60 vs. 0.35)在所有方法中均取得显著更优结果,表明形状与内容密度是检索成功的重要预测因子。
  • 无单一方法在所有碎片尺寸上全面占优,提示模型融合可能进一步提升性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。