[论文解读] BanglaWriting: A multi-purpose offline Bangla handwriting dataset
本论文提出 BanglaWriting,一个高质量、人工标注的离线孟加拉文手写数据集,包含260位个体的单页手写作品,附带词级边界框和Unicode标签。该数据集包含21,234个词、32,787个字符、5,470个独特词汇项,并包含诸如涂写和划线等真实手写变化,支持光学字符识别(OCR)、作者识别和手写生成等高级应用。
This article presents a Bangla handwriting dataset named BanglaWriting that contains single-page handwritings of 260 individuals of different personalities and ages. Each page includes bounding-boxes that bounds each word, along with the unicode representation of the writing. This dataset contains 21,234 words and 32,787 characters in total. Moreover, this dataset includes 5,470 unique words of Bangla vocabulary. Apart from the usual words, the dataset comprises 261 comprehensible overwriting and 450 handwritten strikes and mistakes. All of the bounding-boxes and word labels are manually-generated. The dataset can be used for complex optical character/word recognition, writer identification, handwritten word segmentation, and word generation. Furthermore, this dataset is suitable for extracting age-based and gender-based variation of handwriting.
研究动机与目标
- 创建一个全面的、人工标注的离线孟加拉文手写数据集,以支持多样化的机器学习应用。
- 包含如涂写、划线和错误等真实手写变化,以提升模型训练的鲁棒性。
- 通过真实世界的手写样本,支持作者识别、光学字符识别和手写分割的研究。
- 通过具有人口统计多样性的数据集,探索基于年龄和性别的手写差异。
- 提供原始图像和预处理图像数据,以及标准化的JSON标注,以确保与深度学习框架的兼容性。
提出的方法
- 使用A4纸和标准笔具,从孟加拉国八个地区的260名个体中收集手写页面。
- 通过扫描仪(HP Scanjet 2400)和智能手机相机(Xiaomi Redmi 6/7)拍摄图像,以涵盖真实世界成像条件。
- 使用Labelme软件对每张图像进行人工裁剪和标注,生成词级边界框和Unicode文本标签。
- 标注以JSON格式存储,包含 'label'、'points'、'imagePath'、'imageHeight' 和 'imageWidth' 字段,便于与机器学习系统集成。
- 开发了辅助的Python和OpenCV脚本,以减少原始图像中的光照差异和背景噪声。
- 将数据集划分为 'raw.zip'(未处理图像)和 'converted.zip'(预处理图像),以支持多样化的实验需求。
实验结果
研究问题
- RQ1一个经过人工标注的多用途孟加拉文手写数据集在多大程度上能提升离线OCR和作者识别系统的性能?
- RQ2如涂写和划线等真实手写特征在多大程度上影响手写识别模型的鲁棒性?
- RQ3在孟加拉语语境下,能否可靠地从手写特征中推断出年龄和性别等人口统计因素?
- RQ4成像条件(扫描图像 vs. 智能手机拍摄图像)在多大程度上影响手写数据集的质量和可用性?
- RQ5该数据集在训练孟加拉文脚本的生成式手写模型方面是否具备可行性?
主要发现
- 该数据集包含260个独特手写样本,共21,234个词和32,787个字符,包含5,470个独特的孟加拉词汇项。
- 数据集中包含261个涂写实例和450个手写划线或错误,增强了模型鲁棒性测试的真实性。
- 所有边界框和标签均由人工生成,与类似数据集中使用自动标注相比,确保了更高的标注质量。
- 数据集来自不同年龄(8–80岁)和性别的书写者,支持基于人口统计特征的手写分析。
- 数据集包含52张扫描图像和208张智能手机拍摄的图像,反映了真实世界中的成像差异。
- 成功开发了辅助预处理脚本,有效减少了智能手机拍摄图像中的光照和噪声影响,提升了数据在深度学习中的可用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。