Skip to main content
QUICK REVIEW

[논문 리뷰] An Efficient Hidden Markov Model for Offline Handwritten Numeral Recognition

B. Saritha, S Hemanth|arXiv (Cornell University)|2010. 01. 29.
Handwritten Text Recognition Techniques참고 문헌 29인용 수 4
한 줄 요약

이 논문은 희박화된 문자 이미지에서 유도된 구조적 특징을 사용하여 오프라인 수기 숫자 인식을 위한 효율적인 은닉 마르코프 모델(HMM)을 제안한다. 각 숫자를 정규화된 스켈레톤화된 64×64 이미지에 기반한 이산 HMM으로 모델링함으로써, NIST 데이터셋에서 전체 정확도 84.5%를 달성하였으며, 숫자에 따라 성능이 달라지며, '4'는 가장 정확도가 낮고 '0'은 가장 높은 정확도를 보였다.

ABSTRACT

Traditionally, the performance of ocr algorithms and systems is based on the recognition of isolated characters. When a system classifies an individual character, its output is typically a character label or a reject marker that corresponds to an unrecognized character. By comparing output labels with the correct labels, the number of correct recognition, substitution errors misrecognized characters, and rejects unrecognized characters are determined. Nowadays, although recognition of printed isolated characters is performed with high accuracy, recognition of handwritten characters still remains an open problem in the research arena. The ability to identify machine printed characters in an automated or a semi automated manner has obvious applications in numerous fields. Since creating an algorithm with a one hundred percent correct recognition rate is quite probably impossible in our world of noise and different font styles, it is important to design character recognition algorithms with these failures in mind so that when mistakes are inevitably made, they will at least be understandable and predictable to the person working with the

연구 동기 및 목표

  • 구조적 특징과 HMM 모델링을 활용하여 오프라인 수기 숫자의 인식 정확도를 향상시키기.
  • 스캔된 이미지의 노이즈와 수기 스타일의 변동성에 대응하기.
  • 희박화 및 분기점, 끝점과 같은 위상적 특징을 포함한 강력한 특징 추출 파이프라인 개발.
  • 최소한의 상태 복잡도로 고립된 수기 숫자를 모델링하는 HMM의 효과성 평가.

제안 방법

  • 전처리 단계는 노이즈 감소, 선 폭 정규화, 이미지 희박화를 포함하여 1픽셀 폭의 스켈레톤을 생성한다.
  • 특징 추출은 끝점, 분기점, 고리, 선 분포 방향 등의 구조적 특징에 집중한다.
  • 각 숫자는 상태 전이 확률, 관측 확률, 초기 상태 분포를 포함한 이산 은닉 마르코프 모델(HMM)로 모델링된다.
  • 사전 분할된 데이터가 필요 없이 표준 Baum-Welch 재추정을 사용하여 HMM을 훈련한다.
  • 관측 공간은 희박화된 이미지에서 유도된 양자화된 특징으로 정의된다.
  • 각 HMM의 가능도를 계산하고 가장 높은 가능도를 가진 모델을 선택하여 인식을 수행한다.

실험 결과

연구 질문

  • RQ1고립된 수기 숫자 인식에 대해 HMM 기반 모델링과 구조적 특징을 조합했을 때의 효과성은 어떠한가?
  • RQ2희박화와 스켈레톤화가 특징 일관성과 인식 정확도에 어떤 영향을 미치는가?
  • RQ3어느 숫자가 가장 인식하기 어려운가? 그리고 잘못 분류되는 데 기여하는 구조적 특징은 무엇인가?
  • RQ4최소한의 상태를 가진 HMM이 다양한 수기 숫자 데이터셋에서 높은 인식 정확도를 달성할 수 있는가?

주요 결과

  • 제안된 HMM 기반 시스템은 숫자당 40개 샘플이 있는 데이터셋에서 총 인식 정확도 84.5%를 달성하였다.
  • '0'은 가장 정확하게 인식되는 숫자이며, '4'는 가장 정확도가 낮아, 그 형태에 구조적 모호성이 있음을 시사한다.
  • 희박화 과정은 노이즈를 감소시키고 위상적 구조를 유지함으로써 특징 일관성을 크게 향상시킨다.
  • 분기점과 끝점과 같은 구조적 특징는 스타일의 변동성에도 불구하고 숫자 형태를 효과적으로 구분하는 데 기여한다.
  • 명확하고 고유한 위상적 특징을 지닌 숫자에서는 모델 성능이 뛰어나며, 모호하거나 유사한 구성이 있는 숫자에서는 어려움을 겪는다.
  • 향후 향상 방안으로 스켈레톤의 불필요한 분지 제거 히어리스틱 기법 적용과 신경망 통합을 통한 성능 향상이 가능할 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.