Skip to main content
QUICK REVIEW

[论文解读] AdaDNNs: Adaptive Ensemble of Deep Neural Networks for Scene Text Recognition

Chun Yang, Xu-Cheng Yin|arXiv (Cornell University)|Oct 10, 2017
Handwritten Text Recognition Techniques参考文献 33被引用 7
一句话总结

本文提出AdaDNNs,一种自适应集成方法,通过从不同训练迭代中选择并组合深度神经网络组件来提升场景文本识别性能。通过将集成过程形式化为贝叶斯框架以实现分类器加权,AdaDNNs在不增加额外训练成本的前提下实现了显著的性能提升——在ICDAR基准上相对提升超过10%,优于基线DNN和当前最先进方法。

ABSTRACT

Recognizing text in the wild is a really challenging task because of complex backgrounds, various illuminations and diverse distortions, even with deep neural networks (convolutional neural networks and recurrent neural networks). In the end-to-end training procedure for scene text recognition, the outputs of deep neural networks at different iterations are always demonstrated with diversity and complementarity for the target object (text). Here, a simple but effective deep learning method, an adaptive ensemble of deep neural networks (AdaDNNs), is proposed to simply select and adaptively combine classifier components at different iterations from the whole learning system. Furthermore, the ensemble is formulated as a Bayesian framework for classifier weighting and combination. A variety of experiments on several typical acknowledged benchmarks, i.e., ICDAR Robust Reading Competition (Challenge 1, 2 and 4) datasets, verify the surprised improvement from the baseline DNNs, and the effectiveness of AdaDNNs compared with the recent state-of-the-art methods.

研究动机与目标

  • 为解决在复杂背景、光照变化和形变条件下使用深度神经网络进行场景文本识别的挑战。
  • 利用SGD训练的DNN所展现的多样性与互补性,这些DNN通常收敛至不同的局部极小值,具有不同的错误模式。
  • 开发一种低成本、高效的集成方法,通过利用单次训练过程中的模型快照,在不增加训练成本的前提下提升性能。
  • 将集成过程形式化为贝叶斯框架,以实现最优分类器加权与组合。

提出的方法

  • 该方法收集单个DNN训练过程中每次训练迭代的全部DNN模型快照。
  • 将集成过程形式化为贝叶斯框架,基于各模型快照的预测置信度与多样性,学习其最优权重。
  • 通过加权平均所选模型快照的输出获得最终预测结果,其中权重通过贝叶斯推断学习得到。
  • 采用剪枝策略通过仅选择最有效的快照来降低推理成本,同时不损失准确性。
  • 该方法使用标准SGD进行训练,无需专用优化算法或额外训练过程。
  • 该方法在ICDAR鲁棒阅读竞赛数据集(挑战1、2和4)上进行评估,用于裁剪单词和生源文本识别。

实验结果

研究问题

  • RQ1能否有效结合单个DNN在不同训练迭代中获得的模型快照,以提升场景文本识别性能?
  • RQ2与简单平均或投票相比,基于贝叶斯框架对DNN快照进行加权与组合是否能带来更好的泛化性能?
  • RQ3这种自适应集成方法是否能在不增加训练或复杂网络结构设计的前提下达到最先进性能?
  • RQ4AdaDNNs在标准场景文本识别基准上的性能与近期SOTA方法相比如何?

主要发现

  • 在2013年ICDAR挑战2数据集上,AdaDNNs将C.R.W(上界)得分从基线DNN的78.63%提升至86.67%,相对提升超过10%。
  • 在ICDAR挑战1(生源图像)上,AdaDNNs将C.R.W(上界)从基线的84.50%提升至92.22%,优于近期提交的模型。
  • AdaDNNs的剪枝版本(AdaDNNs Pruning)在挑战2上达到88.13%的C.R.W(上界),超越了多项已发表的SOTA方法。
  • 即使在挑战4上进行训练,AdaDNNs在挑战2上仍表现出具有竞争力的性能,表明其在不同数据集间具有强大的泛化能力。
  • 与ICDAR RRC官网最新提交的模型(如Dahua_OCR_v1和Tencent Youtu)相比,该方法取得了最高性能。
  • 结果表明,通过自适应集成方法可有效利用SGD训练DNN的多样性,从而实现鲁棒且准确的场景文本识别。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。