Skip to main content
QUICK REVIEW

[论文解读] Zero-Shot Chinese Character Recognition with Stroke-Level Decomposition

Jingye Chen, Bin Li|arXiv (Cornell University)|Jun 22, 2021
Handwritten Text Recognition Techniques参考文献 16被引用 6
一句话总结

本文提出一种笔画级分解方法,用于零样本中文字符识别,将每个字符视为五种基本笔画的序列,以解决字符和部首的零样本问题。通过基于匹配的策略与孪生网络,该方法在手写体、印刷体和场景字符上均达到最先进性能,并能通过极少微调有效泛化至韩文字符。

ABSTRACT

Chinese character recognition has attracted much research interest due to its wide applications. Although it has been studied for many years, some issues in this field have not been completely resolved yet, e.g. the zero-shot problem. Previous character-based and radical-based methods have not fundamentally addressed the zero-shot problem since some characters or radicals in test sets may not appear in training sets under a data-hungry condition. Inspired by the fact that humans can generalize to know how to write characters unseen before if they have learned stroke orders of some characters, we propose a stroke-based method by decomposing each character into a sequence of strokes, which are the most basic units of Chinese characters. However, we observe that there is a one-to-many relationship between stroke sequences and Chinese characters. To tackle this challenge, we employ a matching-based strategy to transform the predicted stroke sequence to a specific character. We evaluate the proposed method on handwritten characters, printed artistic characters, and scene characters. The experimental results validate that the proposed method outperforms existing methods on both character zero-shot and radical zero-shot tasks. Moreover, the proposed method can be easily generalized to other languages whose characters can be decomposed into strokes.

研究动机与目标

  • 解决中文字符识别中长期存在的字符和部首零样本问题,即测试集中出现未见过的字符或部首时,传统数据密集型模型无法识别。
  • 克服基于字符或部首的方法的局限性,这些方法在遇到训练数据中未出现的新字符或部首时会失效。
  • 通过将字符建模为基本笔画序列,实现类人般的泛化能力,因为笔画更基础且更不易发生零样本失败。
  • 开发一种基于匹配的策略,解决笔画序列与字符之间的一对多映射问题,从而实现对未见字符的准确识别。
  • 通过将方法扩展至韩文字符,展示跨语言泛化能力,证明其在具有相似笔画结构的东亚文字间具有可迁移性。

提出的方法

  • 基于 Unicode 汉字数据库,将每个中文字符分解为五种基本笔画类型:横、竖、左斜、右斜和折笔。
  • 使用编码器-解码器架构(包含 ResNet 和 Transformer 组件)训练深度学习模型,从输入字符图像中预测笔画序列。
  • 通过基于孪生网络的匹配策略解决一对多问题(多个字符共享同一笔画序列),即比较预测的笔画序列与候选字符嵌入之间的相似性。
  • 采用两阶段解码过程:首先预测笔画序列,然后使用学习到的嵌入将该序列匹配到最相似的已知字符。
  • 仅存储候选字符和支撑样本的嵌入,避免预先存储所有可能字符的嵌入,从而降低内存开销。
  • 通过将相同的笔画基础框架应用于韩文字符,实现跨语言迁移,这些字符同样可分解为相同的五种笔画类型,并具有一致的书写顺序。

实验结果

研究问题

  • RQ1笔画级分解方法是否能从根本上解决中文字符识别中的字符零样本问题?
  • RQ2所提出的方法是否也能解决困扰现有基于部首方法的部首零样本问题?
  • RQ3基于匹配的策略在解决笔画序列与字符之间一对多映射问题时有多高效?
  • RQ4该模型在多大程度上能泛化到其他语言(如韩语)?这些语言具有类似的基于笔画的字符结构。
  • RQ5与现有的基于字符和基于部首的零样本 CCR 方法相比,该方法在性能和效率上表现如何?

主要发现

  • 在 CTW 数据集的字符零样本设置下,该方法达到 85.29% 的准确率,优于现有方法(HDE 在已见样本上为 89.25%,但在零样本设置下更低)。
  • 在部首零样本设置下,该方法显著优于先前方法,证明其对未见部首具有强大的泛化能力。
  • 在韩文字符数据集上,当使用 80% 的数据进行训练时,模型在零样本识别任务上达到 78.00% 的准确率,验证了其跨语言可迁移性。
  • 该方法在不同领域间泛化良好:在印刷体艺术字符上表现最佳,因其笔画结构更清晰;但在手写体和场景字符上仍优于基线方法。
  • 尽管采用两阶段解码,该笔画方法的时间成本(每样本 1.24 秒)低于基于部首的方法(1.38 秒),因为其分类头更小(6 类 vs. 多个部首)。
  • 当仅用 20% 的数据进行训练时,该模型在韩文字符上的零样本准确率达到 23.09%,表明其在极小样本设置下仍具备强大的少样本泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。