Skip to main content
QUICK REVIEW

[논문 리뷰] Omnifont Persian OCR System Using Primitives

Azarakhsh Keipour, Mohammad Eshghi|arXiv (Cornell University)|2022. 02. 13.
Handwritten Text Recognition Techniques인용 수 5
한 줄 요약

이 논문은 다양한 폰트와 크기에서 문자를 인식하기 위해 8개의 기본 구조적 요소를 사용하는 모델 기반 온미포트 페르시아어 OCR 시스템을 제시한다. 동시에 문자 행 분리, 스트로크 추출, 기본 요소 식별을 수행함으로써, 14종의 표준 페르시아어 폰트 6종의 크기에서 97.06%의 정밀도를 달성하며, 독립적인 분할 단계에서 발생하는 오류 전파를 제거한다.

ABSTRACT

In this paper, we introduce a model-based omnifont Persian OCR system. The system uses a set of 8 primitive elements as structural features for recognition. First, the scanned document is preprocessed. After normalizing the preprocessed image, text rows and sub-words are separated and then thinned. After recognition of dots in sub-words, strokes are extracted and primitive elements of each sub-word are recognized using the strokes. Finally, the primitives are compared with a predefined set of character identification vectors in order to identify sub-word characters. The separation and recognition steps of the system are concurrent, eliminating unavoidable errors of independent separation of letters. The system has been tested on documents with 14 standard Persian fonts in 6 sizes. The achieved precision is 97.06%.

연구 동기 및 목표

  • 다양한 폰트 스타일과 크기의 변화를 처리할 수 있는 강력하고 폰트에 관계없는 페르시아어 텍스트용 OCR 시스템을 개발하기 위해.
  • 폰트별로 특화된 훈련에 의존하거나 독립적인 문자 분할에 의존하는 전통적 OCR 시스템의 한계를 극복하기 위해.
  • 독립적인 분할 단계에서 발생하는 오류 누적을 방지하기 위해 텍스트 행 분리와 문자 인식을 동시에 처리하는 단일 과정으로 통합하기 위해.
  • 페르시아 문자를 위한 최소한의 구조적 기본 요소 집합을 사용하여 보편적인 인식 프레임워크를 구축하기 위해.
  • 다양한 표준 페르시아어 폰트와 여러 크기에서의 시스템 성능을 평가하기 위해.

제안 방법

  • 이미지 품질을 정규화하고 대trast를 향상시켜 스캔된 문서를 사전 처리한다.
  • 기하학적 및 레이아웃 분석을 통해 텍스트를 행과 하위 단어로 분리하고, 스트로크 스켈레톤을 추출하기 위해 흐리게 처리한다.
  • 하위 단어 내에서 점(i'rāb 표시)을 탐지하고 국소화하여 정확한 문자 분할을 지원한다.
  • 흐리게 처리된 하위 단어에서 스트로크 특징을 추출하고, 8개의 사전 정의된 기본 요소 중 하나로 분류한다.
  • 각 하위 단어의 기본 요소 조합을 사전 정의된 문자 식별 벡터 집합과 매칭하여 인식한다.
  • 오류 전파를 방지하기 위해 분리 및 인식을 동시에 처리한다.

실험 결과

연구 질문

  • RQ1최소한의 구조적 기본 요소 집합이 다양한 폰트와 크기에서 페르시아 문자의 정확한 인식을 가능하게 할 수 있는가?
  • RQ2동시 처리 방식의 분리 및 인식이 순차적 처리 방식에 비해 OCR 정확도를 얼마나 향상시키는가?
  • RQ3이 시스템은 다양한 표준 페르시아어 폰트와 크기에서 어떤 성능을 보이는가?
  • RQ4기본 요소 기반 특징은 얼마나 폰트에 특화된 훈련 데이터에 의존도를 낮추는가?
  • RQ5스트로크 기반 기본 요소는 문자 형태와 스트로크 복잡성의 변형을 다루는 데 얼마나 효과적인가?

주요 결과

  • 이 시스템은 14종의 표준 페르시아어 폰트와 6종의 크기를 포함한 스캔된 문서에서 97.06%의 정밀도를 달성한다.
  • 텍스트 행 분리와 문자 인식을 동시에 처리함으로써, 독립적인 분할 방식에 비해 오류 전파가 크게 감소한다.
  • 8개의 기본 구조적 요소를 사용함으로써, 폰트에 특화된 모델 없이 다양한 폰트 스타일에서 견고한 인식이 가능하다.
  • 구조적 접근 방식(외관 기반 접근이 아님) 덕분에, 예측할 수 없는 폰트-크기 조합에서도 뛰어난 일반화 능력을 보여준다.
  • 점 탐지와 스트로크 추출은 복잡한 페르시아 문자 형태에서 정확한 하위 단어 분할 및 기본 요소 분류에 핵심적인 역할을 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.