Skip to main content
QUICK REVIEW

[논문 리뷰] Development of a multi-user handwriting recognition system using Tesseract open source OCR engine

Sandip Rakshit, Subhadip Basu|arXiv (Cornell University)|2010. 03. 30.
Handwritten Text Recognition Techniques참고 문헌 11인용 수 4
한 줄 요약

이 논문은 Tesseract OCR 엔진을 사용하여 다수의 사용자에 대한 손글씨 인식 시스템을 제시한다. 사용자별로 고립형 및 자유형 손글씨 샘플을 사용해 개별 언어 모델을 학습시켰다. 세 명의 사용자에 대해 시스템은 테스트 데이터에서 문자 수준 정확도로 각각 87.92%, 81.53%, 65.71%를 기록하여 총합 정확도 78.39%를 달성했다.

ABSTRACT

The objective of the paper is to recognize handwritten samples of lower case Roman script using Tesseract open source Optical Character Recognition (OCR) engine under Apache License 2.0. Handwritten data samples containing isolated and free-flow text were collected from different users. Tesseract is trained with user-specific data samples of both the categories of document pages to generate separate user-models representing a unique language-set. Each such language-set recognizes isolated and free-flow handwritten test samples collected from the designated user. On a three user model, the system is trained with 1844, 1535 and 1113 isolated handwritten character samples collected from three different users and the performance is tested on 1133, 1186 and 1204 character samples, collected form the test sets of the three users respectively. The user specific character level accuracies were obtained as 87.92%, 81.53% and 65.71% respectively. The overall character-level accuracy of the system is observed as 78.39%. The system fails to segment 10.96% characters and erroneously classifies 10.65% characters on the overall dataset.

연구 동기 및 목표

  • 다양한 글씨 스타일을 가진 다수의 사용자를 처리할 수 있는 확장 가능한 손글씨 인식 시스템을 개발하는 것.
  • 고립형 및 자유형 텍스트 샘플을 사용해 사용자별로 모델을 학습시켜 손글씨의 변동성을 다루는 것.
  • 제한된 학습 데이터로 개별 사용자에게 맞게 최적화된 Tesseract OCR의 성능 평가.
  • 다중 사용자 손글씨 텍스트 인식에서의 분할 및 분류 오류 측정.
  • 오픈소스 OCR 엔진인 Tesseract를 개인화된 손글씨 인식 작업에 적용할 수 있는 가능성을 입증하는 것.

제안 방법

  • 세 명의 다른 사용자로부터 고립형 및 자유형 손글씨 문자 샘플을 수집했다.
  • 각 사용자별 데이터셋으로 Tesseract OCR을 학습시켜 각 사용자에 맞는 고유한 언어 모델을 생성했다.
  • 개별 훈련 및 테스트 세트를 사용: 훈련용으로 각각 1844개, 1535개, 1113개의 고립형 샘플; 테스트용으로 각각 1133개, 1186개, 1204개.
  • Tesseract의 적응형 학습 프레임워크를 적용하여 각 사용자별 문자 인식을 최적화했다.
  • 문자 수준 정확도, 분할 실패 비율, 오분류 비율을 사용해 시스템 성능을 평가했다.
  • 사용자별 결과를 통합하여 총합 시스템 수준의 성능 지표를 계산했다.

실험 결과

연구 질문

  • RQ1Tesseract OCR은 다양한 글씨 스타일을 가진 다수의 사용자로부터 손글씨를 효과적으로 인식할 수 있는가?
  • RQ2사용자별 학습이 고립형 및 자유형 손글씨에서 문자 수준의 인식 정확도에 어떤 영향을 미치는가?
  • RQ3다양한 사용자 샘플에서 시스템의 문자 분할 및 오분류 성능은 어떠한가?
  • RQ4다중 사용자 손글씨 데이터에서 기준 모델 또는 일반적인 OCR 모델과 비교해 전체 정확도는 어떻게 되는가?
  • RQ5시스템이 손글씨 문자를 분할하거나 분류하는 데 실패하는 주요 원인은 무엇인가?

주요 결과

  • 시스템은 세 명의 사용자에 대해 각각 87.92%, 81.53%, 65.71%의 사용자별 문자 수준 인식 정확도를 기록했다.
  • 모든 사용자의 경우 전체 테스트 세트에서 문자 수준 총합 정확도는 78.39%였다.
  • 전체 데이터셋에서 10.96%의 문자가 분할에 실패했다.
  • 추가로 10.65%의 문자가 잘못 분류되어 인식 오류 비율이 높게 나타났다.
  • 성능은 사용자 간에 상당한 차이를 보였으며, 개인의 글씨 스타일과 학습 데이터 크기에 민감함을 시사했다.
  • 결과는 Tesseract에 대해 사용자별로 최적화한 결과가 일반 모델에 비해 인식 정확도를 크게 향상시킨다는 것을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.