Skip to main content
QUICK REVIEW

[论文解读] Kannada-MNIST: A new handwritten digits dataset for the Kannada language

Vinay Uday Prabhu|arXiv (Cornell University)|Aug 3, 2019
Handwritten Text Recognition Techniques被引用 18
一句话总结

本文介绍了Kannada-MNIST,一个用于卡纳达文字书写的实境手写数字数据集,包含60,000张训练图像和10,000张测试图像,可直接作为MNIST的替代品。同时,本文还发布了10,240张分布外的测试集(Dig-MNIST),并开源了所有代码、原始扫描图和扫描设置。使用卷积神经网络(CNN)作为基线模型,在Kannada-MNIST上达到96.8%的准确率,在Dig-MNIST上达到76.1%的准确率,表明其泛化挑战高于MNIST。

ABSTRACT

In this paper, we disseminate a new handwritten digits-dataset, termed Kannada-MNIST, for the Kannada script, that can potentially serve as a direct drop-in replacement for the original MNIST dataset. In addition to this dataset, we disseminate an additional real world handwritten dataset (with $10k$ images), which we term as the Dig-MNIST dataset that can serve as an out-of-domain test dataset. We also duly open source all the code as well as the raw scanned images along with the scanner settings so that researchers who want to try out different signal processing pipelines can perform end-to-end comparisons. We provide high level morphological comparisons with the MNIST dataset and provide baselines accuracies for the dataset disseminated. The initial baselines obtained using an oft-used CNN architecture ($96.8\%$ for the main test-set and $76.1\%$ for the Dig-MNIST test-set) indicate that these datasets do provide a sterner challenge with regards to generalizability than MNIST or the KMNIST datasets. We also hope this dissemination will spur the creation of similar datasets for all the languages that use different symbols for the numeral digits.

研究动机与目标

  • 为卡纳达文字书写的手写数字数据集提供一个大规模、真实的基准,类似于阿拉伯数字的MNIST。
  • 提供一个基准数据集,以评估模型在不同书写风格和噪声水平下的泛化能力。
  • 通过为其他使用不同数字系统的语言提供可比数据集,支持跨语言和跨文字泛化研究。
  • 通过开放获取原始扫描图像和扫描配置,促进鲁棒的自动分割和信号处理流程的开发。
  • 鼓励在低资源文字环境下对灾难性遗忘、合成数据增强和多类别软标签分配的研究。

提出的方法

  • Kannada-MNIST数据集由印度班加罗尔的65名志愿者收集,他们在预印制的网格纸上书写数字0–9,使用佳能imageFORMULA扫描仪以300 DPI分辨率扫描图像。
  • Dig-MNIST数据集由加利福尼亚州红木城的100名志愿者使用相同的网格格式收集,生成了一组更嘈杂、分布外的测试集,包含污渍和部分数字笔画。
  • 所有原始扫描图像、扫描设置以及用于数字提取的信号处理脚本均已开源,以支持端到端的可复现性和流程对比。
  • 采用标准卷积神经网络(CNN)架构作为基线模型,在Kannada-MNIST上进行训练,并在Kannada-MNIST和Dig-MNIST上进行评估。
  • 数据集包含与MNIST和Dig-MNIST的形态学对比,突出显示了类内差异,尤其是由于字体和书写风格差异导致的数字3、6和7的类内变化。
  • 作者提出了一种基于开源字体(如Lohit、Kedage)和增强框架的合成数据生成流程,以支持低资源文字的高效训练。

实验结果

研究问题

  • RQ1在不进行图像预处理的情况下,基于Kannada-MNIST训练的CNN能否在真实世界、分布外的测试集(Dig-MNIST)上实现有效泛化?
  • RQ2卡纳达数字3和7之间的形态学相似性(与MNIST数字2相似)如何影响模型的泛化能力及潜在的混淆?
  • RQ3通过开源字体和增强技术生成的合成数据,在真实卡纳达手写数字数据集上能否实现高准确率?
  • RQ4当一个在MNIST上预训练的模型在Kannada-MNIST上进行微调时,灾难性遗忘如何表现,尤其是在数字视觉相似性较高的情况下?
  • RQ5能否设计一种分类器,为像Dig-MNIST这样的嘈杂数据集中模糊或部分可见的数字分配软标签?

主要发现

  • CNN基线模型在Kannada-MNIST测试集上达到96.8%的top-1准确率,表明其在结构良好、分布内数据集上的优异性能。
  • 同一模型在Dig-MNIST测试集上达到76.1%的准确率,表明由于噪声、污渍和部分笔画导致显著性能下降。
  • 数字6在字体和书写风格之间表现出最高的类内差异,导致误分类,并造成较低的精确率(60%)和F1分数(72%)。
  • 数字3和7经常相互混淆,也与MNIST数字2混淆,表明视觉模糊是错误的主要来源。
  • 模型在类别0(精确率0.99,召回率0.61)和类别7(召回率0.63)上表现最差,表明在区分细微笔画模式方面存在挑战。
  • 作者观察到,误分类图像通常具有重叠笔画或不完整的网格,支持了改进自动分割流程的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。