Skip to main content
QUICK REVIEW

[논문 리뷰] Recognition of Handwritten Roman Script Using Tesseract Open source OCR Engine

Sandip Rakshit, Subhadip Basu|arXiv (Cornell University)|2010. 03. 30.
Handwritten Text Recognition Techniques인용 수 4
한 줄 요약

이 논문은 개방형 OCR 엔진인 Tesseract 2.01이 손글씨로 쓴 소문자 로마자 문자를 인식하는 데 대해 평가한다. 한 명의 사용자로부터 수집한 1,844개의 분리된 문자로 훈련된 시스템은 테스트 세트 1,133개의 문자에서 문자 수준 정확도 83.5%를 달성하였으며, 문자 분할 실패 비율은 5.56%, 오분류 비율은 10.94%였다.

ABSTRACT

In the present work, we have used Tesseract 2.01 open source Optical Character Recognition (OCR) Engine under Apache License 2.0 for recognition of handwriting samples of lower case Roman script. Handwritten isolated and free-flow text samples were collected from multiple users. Tesseract is trained to recognize user-specific handwriting samples of both the categories of document pages. On a single user model, the system is trained with 1844 isolated handwritten characters and the performance is tested on 1133 characters, taken form the test set. The overall character-level accuracy of the system is observed as 83.5%. The system fails to segment 5.56% characters and erroneously classifies 10.94% characters.

연구 동기 및 목표

  • 개방형 Tesseract OCR 엔진이 손글씨로 쓴 로마자 문자 인식 성능을 평가하기 위해.
  • 사용자 맞춤 손글씨 샘플을 활용해 Tesseract를 훈련시켜 인식 성능 향상 가능성을 탐구하기 위해.
  • 분리된 문자와 자유형 손글씨 텍스트 샘플에서의 분할 및 분류 정확도를 평가하기 위해.
  • 특히 분할 및 오분류 비율에 기인한 문자 인식 실패 유형을 분석하기 위해.

제안 방법

  • 다양한 사용자로부터 분리된 문자와 자유형 손글씨로 쓴 로마자 문자 샘플을 수집하였다.
  • 1,844개의 분리된 손글씨 문자를 사용해 단일 사용자 모델로 Tesseract 2.01을 훈련시켰다.
  • 미리 보지 않은 데이터에 대한 성능 평가를 위해 테스트 세트 1,133개의 문자를 사용하였다.
  • 문자 수준 정확도, 분할 실패 비율, 오분류 비율을 측정하였다.
  • 표준 Tesseract OCR 파이프라인을 적용하였으며, 특징 추출 및 내부 HMM 기반 모델을 사용한 분류를 수행하였다.
  • 성능 평가를 분리된 텍스트와 자유형 텍스트 카테고리에서 모두 수행하여 내성적 안정성 평가를 수행하였다.

실험 결과

연구 질문

  • RQ1Tesseract 2.01은 사용자 맞춤 훈련을 통해 손글씨로 쓴 소문자 로마자 문자를 효과적으로 인식할 수 있는가?
  • RQ2Tesseract가 분리된 손글씨 문자로 훈련된 경우 문자 수준 정확도는 얼마인가?
  • RQ3인식 과정에서 잘못 분할되거나 잘못 분류된 문자 비율은 얼마나 되는가?
  • RQ4분리된 문자와 자유형 손글씨 텍스트 샘플 간 성능은 어떻게 다름이 있는가?
  • RQ5Tesseract의 손글씨로 쓴 로마자 문자 인식에서 주요 실패 유형은 무엇인가?

주요 결과

  • 시스템은 테스트 세트에서 전체적으로 문자 수준 인식 정확도 83.5%를 달성하였다.
  • Tesseract는 5.56%의 문자를 분할하지 못해 손글씨 분할 문제에서 어려움을 겪고 있음을 나타낸다.
  • 추가로 10.94%의 문자가 잘못 분류되어 전체 오류 비율에 기여하고 있다.
  • 성능 평가는 단일 사용자 모델 기반으로 수행되었으며, 다중 사용자 또는 적응형 훈련을 통해 향상 가능성이 있음을 시사한다.
  • 결과적으로 Tesseract는 손글씨로 쓴 로마자 문자 인식에 효과적일 수 있으나, 분할 및 분류 오류는 여전히 주요 제약 요소로 남아 있다.
  • 본 연구는 사용자 맞춤 적응을 통해 Tesseract와 같은 개방형 OCR 도구를 손글씨 텍스트 인식에 활용할 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.