[논문 리뷰] Development of a Multi-User Recognition Engine for Handwritten Bangla Basic Characters and Digits
이 논문은 Tesseract OCR 엔진을 사용하여 수기로 쓴 방글라 기본 문자와 숫자를 다중 사용자 인식 엔진으로 제안한다. 각 사용자당 919~928개의 사용자별 데이터셋으로 훈련된 시스템은 문자 수준에서 92.15%, 숫자 수준에서 97.37%의 정확도를 달성했으며, 개별 사용자 인식 정확도는 각각 90.66%, 91.66%, 96.87%였다.
The objective of the paper is to recognize handwritten samples of basic Bangla characters using Tesseract open source Optical Character Recognition (OCR) engine under Apache License 2.0. Handwritten data samples containing isolated Bangla basic characters and digits were collected from different users. Tesseract is trained with user-specific data samples of document pages to generate separate user-models representing a unique language-set. Each such language-set recognizes isolated basic Bangla handwritten test samples collected from the designated users. On a three user model, the system is trained with 919, 928 and 648 isolated handwritten character and digit samples and the performance is tested on 1527, 14116 and 1279 character and digit samples, collected form the test datasets of the three users respectively. The user specific character/digit recognition accuracies were obtained as 90.66%, 91.66% and 96.87% respectively. The overall basic character-level and digit level accuracy of the system is observed as 92.15% and 97.37%. The system fails to segment 12.33% characters and 15.96% digits and also erroneously classifies 7.85% characters and 2.63% on the overall dataset.
연구 동기 및 목표
- 수기로 쓴 방글라 기본 문자와 숫자를 위한 확장 가능하고 사용자별 맞춤형 인식 시스템을 개발하기 위해.
- 다양한 사용자 간 수기 스타일의 변동성을 다루기 위해.
- 최소한의 수정으로 오픈소스 Tesseract OCR 엔진을 방글라 문자에 적응시키기 위해.
- 다양한 사용자로부터 수집한 고립된 수기 샘플을 바탕으로 시스템 성능을 평가하기 위해.
- 인식 파이프라인 내에서의 분할 오류와 분류 오류를 정량화하기 위해.
제안 방법
- 세 명의 다른 사용자로부터 고립된 수기로 쓴 방글라 기본 문자와 숫자 샘플을 수집하였다.
- 각 사용자의 고유한 수기 데이터를 사용하여 Tesseract 언어 모델을 별도로 훈련시켰다.
- 사용자별 훈련 데이터셋(919, 928, 648개 샘플)을 사용하여 개별 사용자 모델을 생성하였다.
- 각 사용자당 1,527, 14,116, 1,279개 샘플의 독립된 테스트 세트에서 인식 성능을 테스트하였다.
- 사용자별 수기 스타일의 변동성을 처리하기 위해 Tesseract의 기존 OCR 파이프라인에 언어셋 커스터마이제이션을 적용하였다.
- 전체 데이터셋에서 인식 정확도, 분할 실패 비율, 오분류 비율을 측정하였다.
실험 결과
연구 질문
- RQ1Tesseract OCR 엔진을 사용하여 수기로 쓴 방글라 문자와 숫자를 위한 다중 사용자 인식 엔진을 효과적으로 구축할 수 있는가?
- RQ2일반 모델 대비 사용자별 훈련이 인식 정확도에 어떻게 향상시키는가?
- RQ3시스템에서 문자 분할 실패율과 오분류율은 각각 얼마인가?
- RQ4다양한 수기 스타일을 가진 서로 다른 사용자 간 인식 정확도는 어떻게 변하는가?
- RQ5문자 및 숫자 인식 정확도 측면에서 시스템의 총체적 성능는 어떠한가?
주요 결과
- 모든 사용자에 대해 문자 수준 인식 정확도가 92.15%로 달성되었다.
- 숫자 수준 인식 정확도는 97.37%에 도달하여 숫자 문자에 대해 뛰어난 성능를 보였다.
- 개별 사용자 인식 정확도는 각각 90.66%, 91.66%, 96.87%로 사용자에 따른 성능 변동성을 반영하였다.
- 시스템은 12.33%의 문자와 15.96%의 숫자를 분할하지 못했으며, 이는 수기 분할에 어려움이 있음을 시사했다.
- 추가로 7.85%의 문자와 2.63%의 숫자가 오분류되어 총 오류 비율에 기여하였다.
- 사용자별 모델의 사용은 단일 통합 모델 대비 인식 정확도를 크게 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.