Skip to main content
QUICK REVIEW

[论文解读] Expolring Architectures for CNN-Based Word Spotting.

Eugen Rusakov, Sebastian Sudholt|arXiv (Cornell University)|Jun 28, 2018
Handwritten Text Recognition Techniques参考文献 23被引用 3
一句话总结

本文通过在IAM和乔治·华盛顿数据库上将TPP-HOCNet与ResNet、DenseNet和LeNet进行比较,评估了卷积神经网络(CNN)架构深度对单词定位任务的影响。结果表明,更深的模型在IAM等困难任务上表现更优,但在乔治·华盛顿等较简单的基准测试中则无明显优势,表明对于简单任务,性能随复杂度增加而趋于饱和。

ABSTRACT

The goal in word spotting is to retrieve parts of document images which are relevant with respect to a certain user-defined query. The recent past has seen attribute-based Convolutional Neural Networks take over this field of research. As is common for other fields of computer vision, the CNNs used for this task are already considerably deep. The question that arises, however, is: How complex does a CNN have to be for word spotting? Are increasingly deeper models giving increasingly bet- ter results or does performance behave asymptotically for these architectures? On the other hand, can similar results be obtained with a much smaller CNN? The goal of this paper is to give an answer to these questions. Therefore, the recently successful TPP- PHOCNet will be compared to a Residual Network, a Densely Connected Convolutional Network and a LeNet architecture empirically. As will be seen in the evaluation, a complex model can be beneficial for word spotting on harder tasks such as the IAM Offline Database but gives no advantage for easier benchmarks such as the George Washington Database.

研究动机与目标

  • 探究随着CNN架构深度不断增加,单词定位性能是否持续提升。
  • 确定更小、更浅层的CNN是否可达到与复杂模型相当的性能。
  • 评估在不同单词定位基准测试中,模型复杂度与性能之间的权衡。
  • 将最先进的架构(如ResNet、DenseNet和LeNet)与近期提出的TPP-HOCNet进行效果比较。
  • 确定在单词定位任务中,随着深度增加,性能提升是否趋于饱和。

提出的方法

  • 本研究采用四种CNN架构:TPP-HOCNet、ResNet、DenseNet和LeNet进行单词定位任务。
  • 每种模型均在两个基准数据集上进行训练和评估:IAM脱机手写数据库和乔治·华盛顿手写数据库。
  • 通过标准检索指标(如平均平均精度,mAP)衡量单词定位性能。
  • 比较重点在于架构深度和连接模式对检索准确率的影响。
  • 在不同难度级别的文档图像数据集上开展实证评估。
  • 分析包括类似消融实验的对比,以评估模型深度和结构的贡献。

实验结果

研究问题

  • RQ1在所有数据集上,增加CNN深度是否都能持续提升单词定位性能?
  • RQ2更小、更浅层的CNN是否可达到与深层架构相当的性能?
  • RQ3在单词定位任务中,是否存在深层模型性能趋于饱和的点?
  • RQ4不同架构设计(如残差连接、密集连接、普通网络)在单词定位基准上的表现如何比较?
  • RQ5在简单与困难的单词定位数据集中,模型复杂度是否均具有显著优势?

主要发现

  • 在IAM脱机手写数据库上,像TPP-HOCNet这样的复杂模型相较于更简单的架构具有性能优势。
  • 在乔治·华盛顿手写数据库上,如ResNet和DenseNet等更深的模型并未超越LeNet等更简单的模型。
  • 在较简单的基准测试中,模型深度增加带来的性能提升趋于饱和,表明存在渐近行为。
  • 研究发现,仅在具有高度可变性的挑战性单词定位任务中,架构复杂度才具有实际益处。
  • 在简单数据集上,LeNet等小型网络也能取得具有竞争力的结果,表明更深的模型并非总是必需。
  • 结果表明,模型选择应基于数据集难度而非单纯依赖深度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。