Skip to main content
QUICK REVIEW

[论文解读] DenseRAN for Offline Handwritten Chinese Character Recognition

Wenchao Wang, Jianshu Zhang|arXiv (Cornell University)|Aug 13, 2018
Handwritten Text Recognition Techniques参考文献 21被引用 11
一句话总结

该论文提出DenseRAN,一种基于注意力机制的编码器-解码器模型,通过分析偏旁部首和二维结构组件,实现对离线手写中文字符的识别。通过利用DenseNet进行特征编码,并采用具备覆盖感知的空间注意力机制的GRU解码器,DenseRAN在ICDAR-2013数据集上实现了18.54%的字符错误率(CER)相对降低,并在CASIA-HWDB1.2数据集中对未见中文字符达到了40.82%的准确率,展现出对已见字符类别之外的强泛化能力。

ABSTRACT

Recently, great success has been achieved in offline handwritten Chinese character recognition by using deep learning methods. Chinese characters are mainly logographic and consist of basic radicals, however, previous research mostly treated each Chinese character as a whole without explicitly considering its internal two-dimensional structure and radicals. In this study, we propose a novel radical analysis network with densely connected architecture (DenseRAN) to analyze Chinese character radicals and its two-dimensional structures simultaneously. DenseRAN first encodes input image to high-level visual features by employing DenseNet as an encoder. Then a decoder based on recurrent neural networks is employed, aiming at generating captions of Chinese characters by detecting radicals and two-dimensional structures through attention mechanism. The manner of treating a Chinese character as a composition of two-dimensional structures and radicals can reduce the size of vocabulary and enable DenseRAN to possess the capability of recognizing unseen Chinese character classes, only if the corresponding radicals have been seen in training set. Evaluated on ICDAR-2013 competition database, the proposed approach significantly outperforms whole-character modeling approach with a relative character error rate (CER) reduction of 18.54%. Meanwhile, for the case of recognizing 3277 unseen Chinese characters in CASIA-HWDB1.2 database, DenseRAN can achieve a character accuracy of about 41% while the traditional whole-character method has no capability to handle them.

研究动机与目标

  • 通过利用内部结构和偏旁部首构成,解决整体字符建模在识别未见中文字符时的局限性。
  • 不将中文字符视为整体单元,而是将其建模为偏旁部首与空间关系的序列,从而实现对未见类别的泛化能力。
  • 通过显式学习结构与亚结构模式,提升对多样化手写风格的识别鲁棒性。
  • 开发一种端到端可训练的基于注意力机制的架构,联合检测偏旁部首与空间构型。

提出的方法

  • DenseRAN使用DenseNet作为编码器,从灰度手写字符图像中提取高层视觉特征。
  • 基于GRU的解码器逐步生成描述性字幕,识别偏旁部首及其二维空间排列。
  • 解码器采用基于覆盖的空间注意力机制,动态关注输入图像的不同区域,模拟人类对偏旁部首与结构的视觉注意机制。
  • 通过交叉熵损失端到端训练模型,以预测描述偏旁部首与结构组件的标注文本。
  • 通过注意力机制隐式学习偏旁部首与结构的检测,避免了人工分割或过度分割。
  • 该架构支持零样本泛化:只要构成字符的偏旁部首在训练期间出现过,未见字符即可被识别。

实验结果

研究问题

  • RQ1与整体字符建模相比,通过分析字符内部的偏旁部首与空间结构是否能提升识别性能?
  • RQ2通过利用已知的偏旁部首与结构模式,深度学习模型在多大程度上能泛化到未见的中文字符类别?
  • RQ3基于注意力机制的偏旁部首与结构检测在应对手写风格差异时,如何提升识别鲁棒性?
  • RQ4哪些类型的结构构型最容易被误分类,原因是什么?
  • RQ5注意力机制能否为模型识别决策提供可解释的洞察?

主要发现

  • 与整体字符建模相比,DenseRAN在ICDAR-2013数据集上实现了18.54%的字符错误率(CER)相对降低。
  • 在ICDAR-2013 1000类测试集中,准确率从500个已见类别的1.70%提升至2755个已见类别的30.68%,展现出强大的可扩展性。
  • 在CASIA-HWDB1.2数据集中,对于3277个未见字符,DenseRAN实现了40.82%的字符准确率,而整体字符模型在未见类别上完全失效。
  • 最常见的误分类是“锁”结构被误判为“d”结构,错误率为3.45%,原因在于潦草手写导致部件分离。
  • 错误分析表明,具有细微偏旁差异的字符最容易混淆,尤其在单结构字符中更为明显。
  • 注意力可视化结果表明,DenseRAN能与人类直觉保持一致,即使在未见字符上也按顺序关注偏旁部首与结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。