Skip to main content
QUICK REVIEW

[论文解读] Deep Self-Taught Learning for Handwritten Character Recognition

Frédéric Bastien, Yoshua Bengio|arXiv (Cornell University)|Sep 18, 2010
Handwritten Text Recognition Techniques参考文献 24被引用 13
一句话总结

本文提出了一种使用随机数据增强的深度自教学习方法,以提升手写字符识别性能。通过在高度扰动或分布外的字符图像(包括噪声、形变和背景变化)上训练深度堆叠去噪自编码器(SDA),该方法在MNIST数字和62类NIST字符识别任务上均达到了人类水平的性能,优于浅层模型和先前的最先进结果。

ABSTRACT

Recent theoretical and empirical work in statistical machine learning has demonstrated the importance of learning algorithms for deep architectures, i.e., function classes obtained by composing multiple non-linear transformations. Self-taught learning (exploiting unlabeled examples or examples from other distributions) has already been applied to deep learners, but mostly to show the advantage of unlabeled examples. Here we explore the advantage brought by {\em out-of-distribution examples}. For this purpose we developed a powerful generator of stochastic variations and noise processes for character images, including not only affine transformations but also slant, local elastic deformations, changes in thickness, background images, grey level changes, contrast, occlusion, and various types of noise. The out-of-distribution examples are obtained from these highly distorted images or by including examples of object classes different from those in the target test set. We show that {\em deep learners benefit more from out-of-distribution examples than a corresponding shallow learner}, at least in the area of handwritten character recognition. In fact, we show that they beat previously published results and reach human-level performance on both handwritten digit classification and 62-class handwritten character recognition.

研究动机与目标

  • 探究深度模型在手写字符识别中是否比浅层模型更受益于分布外样本。
  • 评估大量数据增强(如噪声、形变和背景变化)对在干净真实测试数据上泛化能力的影响。
  • 评估在训练过程中使用相关但不同的字符类别进行多任务学习,是否能提升目标任务的性能。
  • 确定在标签数据充足的情况下,深度模型中的无监督预训练是否仍能实现比纯监督学习更好的泛化能力。
  • 证明使用自教学习的深度学习方法可在大规模手写字符识别基准上超越先前的最先进结果。

提出的方法

  • 作者开发了一套随机图像变换系统,用于生成高度扰动的字符图像,包括仿射变换、倾斜、弹性形变、粗细变化、背景图像、对比度变化、遮挡和噪声。
  • 采用堆叠去噪自编码器(SDA)作为深度架构,通过逐层去噪自编码训练,学习分层特征表示。
  • SDA通过在带标签数据上使用监督学习进行微调,训练数据通过随机变换流水线进行增强,以模拟分布外样本。
  • 对于多任务学习,模型在全部62个字符类别(数字、大写字母、小写字母)上进行训练,并在子集(如仅数字)上进行测试,与仅在单一任务上训练的模型进行性能比较。
  • 使用验证集选择超参数,并在NIST特殊数据库19的干净测试集上评估性能。
  • 将该方法与一个浅层多层感知机(MLP)进行比较,MLP在有无扰动数据的情况下均进行了训练,采用相同的数据增强和评估协议。

实验结果

研究问题

  • RQ1深度模型在手写字符识别中是否比浅层模型更受益于分布外样本(如高度扰动的图像)?
  • RQ2在增强的、分布外的数据上进行训练,能在多大程度上提升在干净原始测试数据上的性能?
  • RQ3多任务学习(在多个相关字符类别上进行训练)是否比浅层学习为深度学习模型带来更大的收益?
  • RQ4即使标签数据充足,使用无标签且多样的数据进行自教学习是否能提升深度模型的泛化能力?
  • RQ5在大规模手写字符识别任务中,结合无监督预训练和数据增强的深度学习能否实现人类水平的性能?

主要发现

  • SDA模型在10类MNIST数字识别任务上的测试错误率为1.4%,达到人类水平性能,并优于该测试集上所有先前发表的结果。
  • 在62类NIST字符识别任务中,SDA在使用扰动数据(NISTP)训练时,测试错误率为18.7%,显著优于浅层MLP在相同条件下的24.3%错误率。
  • 在干净数字上,SDA因训练于扰动数据而实现93%的错误率相对降低,而MLP仅实现-10%的变化,表明深度模型从数据增强中获益显著更多。
  • 当同时在三个任务(数字、大写、小写字母)上联合训练时,SDA的错误率相对降低27%,而MLP在数字任务上的相对改善仅为5.6%,表明深度模型在多任务学习中受益更大。
  • 在使用高度扰动数据(P07)训练后,SDA在干净数据上的错误率相比仅使用干净数据训练的模型降低了228%,证明了从分布外样本中实现强大泛化的能力。
  • SDA在NIST特殊数据库19上优于所有先前的最先进方法,在10类和62类任务上均实现了当时报道的最低错误率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。