[논문 리뷰] BanglaWriting: A multi-purpose offline Bangla handwriting dataset
이 논문은 260명의 개인이 작성한 단일 페이지의 오프라인 방식으로 쓴 벵골 문자 글씨를 포함하는 고품질 수작업 주석 처리된 데이터셋인 BanglaWriting을 소개한다. 이 데이터셋은 단어 수준의 바운딩 박스와 유니코드 레이블을 포함하며, 총 21,234개의 단어, 32,787개의 문자, 5,470개의 고유 어휘 항목을 포함하고 있으며, 중첩 글씨와 취소선 등의 현실적인 변형을 수반하여 OCR, 글자 작성자 식별, 글씨 생성 등의 고도화된 응용 분야를 가능하게 한다.
This article presents a Bangla handwriting dataset named BanglaWriting that contains single-page handwritings of 260 individuals of different personalities and ages. Each page includes bounding-boxes that bounds each word, along with the unicode representation of the writing. This dataset contains 21,234 words and 32,787 characters in total. Moreover, this dataset includes 5,470 unique words of Bangla vocabulary. Apart from the usual words, the dataset comprises 261 comprehensible overwriting and 450 handwritten strikes and mistakes. All of the bounding-boxes and word labels are manually-generated. The dataset can be used for complex optical character/word recognition, writer identification, handwritten word segmentation, and word generation. Furthermore, this dataset is suitable for extracting age-based and gender-based variation of handwriting.
연구 동기 및 목표
- 다양한 기계 학습 응용 분야를 지원하는 종합적이고 수작업 주석 처리된 오프라인 방식의 벵골 문자 글씨 데이터셋을 구축하기 위해.
- 모델 훈련의 강건성 향상을 위해 중첩 글씨, 취소선, 실수와 같은 현실적인 글씨 변형을 포함하기 위해.
- 실제 글쓰기 샘플을 활용하여 글자 작성자 식별, 광학 문자 인식, 글씨 분할 연구를 가능하게 하기 위해.
- 다양한 인구 통계적 특성(연령, 성별)을 기반으로 한 글씨의 변형을 분석하기 위해 다인구 구조의 데이터셋을 제공하기 위해.
- 딥 러닝 프레임워크와의 호환성을 확보하기 위해 표준화된 JSON 주석과 함께 원본 및 사전 처리된 이미지 데이터를 제공하기 위해.
제안 방법
- A4 용지와 일반 펜을 사용하여 방글라데시 8개 지방에서 260명의 개인으로부터 수기 글씨 샘플을 수집하였다.
- 스캐너(HP Scanjet 2400)와 스마트폰 카메라(Xiaomi Redmi 6/7)를 이용해 실제 환경의 영상 조건을 반영한 이미지를 촬영하였다.
- 각 이미지는 Labelme 소프트웨어를 사용하여 수작업으로 자르고 주석 처리하여 단어 수준의 바운딩 박스와 유니코드 텍스트 레이블을 생성하였다.
- 기계 학습 통합을 위해 'label', 'points', 'imagePath', 'imageHeight', 'imageWidth' 필드를 포함한 JSON 형식으로 주석을 저장하였다.
- 원본 이미지의 조명 차이와 배경 노이즈를 줄이기 위해 보조 파이썬 및 OpenCV 스크립트를 개발하였다.
- 다양한 실험적 요구사항을 충족시키기 위해 데이터셋을 'raw.zip'(처리되지 않은 이미지)와 'converted.zip'(사전 처리된 이미지)로 분할하였다.
실험 결과
연구 질문
- RQ1수작업 주석 처리된 다기능 오프라인 벵골 문자 글씨 데이터셋은 오프라인 OCR 및 글자 작성자 식별 시스템의 성능을 어떻게 향상시킬 수 있는가?
- RQ2중첩 글씨나 취소선과 같은 현실적인 글씨 변형은 글자 인식 모델의 강건성에 어느 정도 영향을 미치는가?
- RQ3연령과 성별과 같은 인구 통계적 요소는 벵골 문맥에서 글씨 특징을 기반으로 신뢰성 있게 유추할 수 있는가?
- RQ4스캔된 이미지와 스마트폰으로 촬영한 이미지 간의 영상 조건은 글씨 데이터셋의 품질과 활용 가능성에 어떤 영향을 미치는가?
- RQ5이 데이터셋을 활용해 벵골 스크립트용 생성형 글씨 모델을 훈련시키는 데 실현 가능성이 있는가?
주요 결과
- 데이터셋은 260개의 고유한 글씨 샘플을 포함하며, 총 21,234개의 단어와 32,787개의 문자를 포함하고 있으며, 5,470개의 고유한 벵골 어휘 항목이 포함되어 있다.
- 데이터셋에는 중첩 글씨 261건과 손글씨로 작성된 취소선 또는 실수 450건이 포함되어 있어 모델의 강건성 테스트를 위한 현실성 향상을 도모하였다.
- 모든 바운딩 박스와 레이블은 수작업으로 생성되어 유사한 데이터셋에서 자동 주석 처리 방식에 비해 높은 주석 품질을 확보하였다.
- 다양한 연령(8–80세)과 성별의 글쓰기자로부터 수집되어 인구 통계 기반의 글씨 분석이 가능하도록 하였다.
- 스캔된 이미지 52장과 스마트폰으로 촬영한 이미지 208장이 포함되어 있어 실제 환경의 영상 변형을 반영하였다.
- 스마트폰으로 촬영한 이미지의 조명 및 노이즈 영향을 줄이기 위한 보조 사전 처리 스크립트를 성공적으로 개발하여 딥 러닝을 위한 데이터 활용도를 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.