Skip to main content
QUICK REVIEW

[论文解读] Implicit segmentation of Kannada characters in offline handwriting recognition using hidden Markov models

Manasij Venkatesh, Vikas Majjagi|arXiv (Cornell University)|Oct 16, 2014
Handwritten Text Recognition Techniques参考文献 12被引用 4
一句话总结

本文提出一种基于连续密度隐马尔可夫模型(HMMs)的隐式分割方法,用于离线卡纳达手写字符识别,利用该文字的黏着性特征将复杂字符分解为基础形态。通过使用HMM对字符序列进行建模,该方法避免了显式分割,降低了分类复杂度,并在Chars74k数据集上将准确率提高了10%,达到61.0%;通过额外训练数据进一步提升了4%。

ABSTRACT

We describe a method for classification of handwritten Kannada characters using Hidden Markov Models (HMMs). Kannada script is agglutinative, where simple shapes are concatenated horizontally to form a character. This results in a large number of characters making the task of classification difficult. Character segmentation plays a significant role in reducing the number of classes. Explicit segmentation techniques suffer when overlapping shapes are present, which is common in the case of handwritten text. We use HMMs to take advantage of the agglutinative nature of Kannada script, which allows us to perform implicit segmentation of characters along with recognition. All the experiments are performed on the Chars74k dataset that consists of 657 handwritten characters collected across multiple users. Gradient-based features are extracted from individual characters and are used to train character HMMs. The use of implicit segmentation technique at the character level resulted in an improvement of around 10%. This system also outperformed an existing system tested on the same dataset by around 16%. Analysis based on learning curves showed that increasing the training data could result in better accuracy. Accordingly, we collected additional data and obtained an improvement of 4% with 6 additional samples.

研究动机与目标

  • 解决由于卡纳达手写字符中形态相关字符数量庞大而导致的分类复杂度高的问题。
  • 克服显式分割在离线手写识别中的局限性,通过HMM建模实现隐式分割。
  • 通过利用卡纳达文字的黏着性结构,增加有效训练样本,从而提高识别准确率。
  • 评估训练数据量对模型性能的影响,并通过学习曲线展示数据效率。
  • 为卡纳达语——一种低资源的印度文字——建立离线手写识别的基线,提供稳健的特征与模型框架。

提出的方法

  • 采用滑动窗口方法,从固定宽度的垂直条带中提取基于梯度的特征,生成序列观测向量。
  • 采用从左到右的连续密度HMM,使用参数共享的状态,对字符序列进行建模,实现联合训练与分割。
  • 采用10状态HMM架构,相比15状态模型,降低了模型复杂度并提高了训练效率。
  • 使用高斯混合模型(GMMs)进行观测密度估计,通过验证准确率优化分量数量。
  • 通过允许HMM自动发现潜在的基础形态(如辅音和符号)实现隐式分割,而无需在训练数据中提供分割边界。
  • 通过为500个字符中的每个字符收集6个额外样本进行数据增强,重新训练模型以评估数据影响。

实验结果

研究问题

  • RQ1通过HMM实现的隐式分割是否能通过减少不同字符类别的数量,提升离线卡纳达手写识别的准确率?
  • RQ2通过HMM建模利用卡纳达字符的黏着性结构,对训练数据效率和模型泛化能力有何影响?
  • RQ3增加训练数据量在多大程度上能提升识别性能,学习曲线是否能反映这一趋势?
  • RQ4所提出的基于HMM的系统与现有方法(如基于DCT的最近邻分类器)在Chars74k数据集上的表现相比如何?
  • RQ5该隐式分割方法在未来能否扩展以处理复杂的字符组合,如辅音-辅音-元音(CCV)序列?

主要发现

  • 所提出的基于HMM的隐式分割方法在Chars74k数据集上实现了61.0%的识别准确率,相比将全部569个字符视为独立类别的方法提高了10%。
  • 该系统在相同数据集上比基于DCT的最近邻分类器(33.3%)高出15.9个百分点,表现出更优的性能。
  • 学习曲线分析表明,增加训练数据可显著提升准确率,添加每个字符6个额外样本后观察到4%的准确率提升。
  • 10状态模型在性能和训练速度上均优于15状态模型,表明减少参数数量有助于提升泛化能力。
  • 验证准确率在10个GMM分量时达到峰值,超过该点后开始下降,表明模型复杂度过高导致过拟合。
  • 结果表明,性能的主要瓶颈是训练数据不足,而非模型架构,因为进一步的数据收集带来了可测量的准确率提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。