Skip to main content
QUICK REVIEW

[论文解读] BanglaLekha-Isolated: A Comprehensive Bangla Handwritten Character Dataset

Mithun Biswas, Rafiqul Islam|arXiv (Cornell University)|Feb 22, 2017
Handwritten Text Recognition Techniques被引用 12
一句话总结

本论文提出 BanglaLekha-Isolated,一个大规模、全面的孤立孟加拉文手写字符数据集,包含 166,105 个孤立孟加拉文手写字符——涵盖数字、基础字符和复合字符——数据来源覆盖孟加拉国不同地理区域和年龄群体。该数据集经过一致性预处理,包含多标签元数据(年龄、性别、地区),可支持手写识别、作者属性推断及手写质量评估等研究。

ABSTRACT

Bangla handwriting recognition is becoming a very important issue nowadays. It is potentially a very important task specially for Bangla speaking population of Bangladesh and West Bengal. By keeping that in our mind we are introducing a comprehensive Bangla handwritten character dataset named BanglaLekha-Isolated. This dataset contains Bangla handwritten numerals, basic characters and compound characters. This dataset was collected from multiple geographical location within Bangladesh and includes sample collected from a variety of aged groups. This dataset can also be used for other classification problems i.e: gender, age, district. This is the largest dataset on Bangla handwritten characters yet.

研究动机与目标

  • 解决当前孟加拉文手写字符识别缺乏统一、大规模数据集的问题,该问题源于数据来源分散且不一致。
  • 提供一个单一、标准化的数据集,包含数字、基础字符和常用复合字符,以支持全面的机器学习研究。
  • 通过包含多标签元数据(年龄、性别、地区、机构)支持识别之外的研究,如作者属性推断与手写质量评估。
  • 通过提供已预处理、格式一致、降噪处理并进行方形图像缩放(保持长宽比)的数据集,减少模型训练与评估的时间。
  • 通过支持法医学与教育应用,实现对手写特征(如清晰度、形状、短音符号使用)的自动分析。

提出的方法

  • 从孟加拉国 22 个地区收集了 2,000 份表格,对象为母语孟加拉语者,涵盖不同年龄组(4–27 岁),并包含少量有身体残疾的子样本。
  • 采用标准化数据采集协议,设置时间限制(10 分钟、5 分钟和 2 分钟),以捕捉不同手写质量与书写速度。
  • 通过图像预处理,将前景与背景反转(黑色背景,白色字符),应用中值滤波降噪,并使用边缘加粗技术提升可读性。
  • 将所有图像缩放为方形格式,通过填充保持长宽比,确保机器学习模型输入的一致性。
  • 为每份表格分配唯一 22 位字符的表单 ID,编码内容包括地区(2 位)、机构(4 位)、性别(1 位)、年龄(2 位)、日期(4 位)和序列号(4 位),以确保可追溯性。
  • 由三位母语孟加拉语者根据手写专家制定的标准,对全部 2,000 份表格进行人工标注,评估内容包括形状、清晰度、短音符号使用及美学质量。

实验结果

研究问题

  • RQ1大规模、统一的孤立孟加拉文手写字符数据集是否能提升机器学习模型在手写识别任务中的性能与一致性?
  • RQ2在 BanglaLekha-Isolated 数据集中,能否通过手写字符图像有效预测年龄、性别和地区的元数据?
  • RQ3预处理流程在提升图像质量与一致性方面,对下游识别任务的增强效果如何?
  • RQ4该数据集是否能支持手写质量的自动评估,包括清晰度、形状准确性及正确使用短音符号?
  • RQ5在训练模型时,包含多样化书写风格与身体状况的影响,如何影响模型的泛化能力?

主要发现

  • BanglaLekha-Isolated 数据集包含 166,105 幅方形图像,代表孤立的孟加拉文字符,共分为 84 个类别:10 个数字、50 个基础字符和 24 个复合字符。
  • 该数据集是目前可用的最大的孟加拉文手写字符数据集,无论在总规模还是类别覆盖范围上,均超过 CMATERDB 与 ISI 数据集。
  • 类别分布接近平衡,包含 98,950 个基础字符、19,748 个数字和 47,407 个复合字符,与 CMATERDB 中复合字符严重失衡的情况形成对比。
  • 数据集包含多标签元数据(年龄、性别、地区、机构),编码于唯一的表单 ID 中,支持作者属性推断与法医学分析研究。
  • 所有图像均由母语者根据标准化标准进行人工标注,包括形状准确性、图像清晰度、短音符号正确性及美学质量,评分结果另存于独立电子表格中。
  • 该数据集公开可用,专为机器学习研究设计,已应用预处理以确保一致性,显著缩短模型训练与评估的准备时间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。