Skip to main content
QUICK REVIEW

[논문 리뷰] Morphological Reconstruction for Word Level Script Identification

B.V. Dhandra, Mallikarjun Hangarge|arXiv (Cornell University)|2011. 06. 25.
Handwritten Text Recognition Techniques참고 문헌 13인용 수 8
한 줄 요약

이 논문은 방향성 이미지 복원과 지역적 기술자들을 활용하여 다국어 인도 문서의 단어 수준 스크립트 식별을 위한 형태학적 복원 기반 접근법을 제안한다. 칸나다, 텔루구, 데바나가리, 아랍 숫자를 구분한다. 다양한 폰트와 크기에서 2,625개의 단어 이미지에서 평가된 방법은 최근접 이웃 분류를 사용하여 높은 정확도를 달성하며, 다국어 OCR 사전처리에 있어 뛰어난 성능을 보여준다.

ABSTRACT

A line of a bilingual document page may contain text words in regional language and numerals in English. For Optical Character Recognition (OCR) of such a document page, it is necessary to identify different script forms before running an individual OCR system. In this paper, we have identified a tool of morphological opening by reconstruction of an image in different directions and regional descriptors for script identification at word level, based on the observation that every text has a distinct visual appearance. The proposed system is developed for three Indian major bilingual documents, Kannada, Telugu and Devnagari containing English numerals. The nearest neighbour and k-nearest neighbour algorithms are applied to classify new word images. The proposed algorithm is tested on 2625 words with various font styles and sizes. The results obtained are quite encouraging

연구 동기 및 목표

  • 영어 숫자와 지역 스크립트를 포함한 双어 문장에서 혼합 스크립트 텍스트를 단어 수준에서 식별하는 데 도전하는 것.
  • 폰트 변화와 크기 차이에 영향을 받지 않는 이미지 기반의 강건한 스크립트 분류 방법을 개발하는 것.
  • 형태학적 복원과 지역적 기술자가 서로 다른 스크립트 간의 시각적 패턴을 구분하는 데 얼마나 효과적인지 평가하는 것.
  • 각 단어를 해당 스크립트로 분류하여 다국어 OCR 시스템의 정확한 사전처리를 가능하게 하는 것.

제안 방법

  • 단어 이미지에서 방향성 구조적 특징을 추출하기 위해 수평, 수직, 대각선 방향으로 다중 방향 형태학적 열림 복원을 적용하는 것.
  • 복원된 이미지에서 유도된 지역적 기술자를 사용하여 각 단어의 국소 텍스처 및 형상 특성을 표현하는 것.
  • 특징 유사도 기반으로 스크립트 레이블을 할당하기 위해 최근접 이웃(NN) 및 k-최근접 이웃(k-NN) 분류 알고리즘을 사용하는 것.
  • 형태학적 연산에 일관된 입력을 보장하기 위해 이진화 및 정규화를 통해 입력 이미지 전처리를 수행하는 것.
  • 칸나다, 텔루구, 데바나가리, 영어 숫자에서 온 2,625개의 단어 이미지 데이터셋을 사용하여 분류기 학습 및 테스트를 수행하는 것.
  • 스위치 간의 구조적 차이, 예를 들어 스트로크 밀도 및 방향 패턴을 강조하기 위해 방향성 복원을 사용하는 것.

실험 결과

연구 질문

  • RQ1다중 방향에서의 형태학적 복원이 단어 수준의 스크립트 식별을 위한 구분 가능한 특징을 효과적으로 캡처할 수 있는가?
  • RQ2복원된 이미지에서 유도된 지역적 기술자가 다양한 폰트 스타일과 크기에서 스크립트 분류 정확도를 어떻게 향상시키는가?
  • RQ3k-NN 분류기가 인도 지역 스크립트와 아랍 숫자를 구분하는 데서 최근접 이웃 방법보다 얼마나 뛰어난가?
  • RQ4실세계의 다국어 문서 이미지에서 폰트 및 크기 변화에 대해 제안된 방법이 얼마나 강건한가?

주요 결과

  • 제안된 방법은 세 가지 주요 인도 스크립트와 영어 숫자에서 온 2,625개의 단어 이미지에서 높은 분류 정확도를 달성하였으며, 폰트 및 크기 변화에 대해 강력한 내성성을 보여주었다.
  • 다양한 방향에서의 형태학적 복원이 서로 다른 스크립트의 시각적 외관을 구분하는 데 효과적인 방향성 구조적 특징을 효과적으로 추출하였다.
  • k-NN 분류기가 최근접 이웃 분류기보다 분류 정확도에서 뛰어나, 유사한 학습 샘플을 다수 고려하는 데서 유의미한 이점이 있음을 시사하였다.
  • 복원된 이미지에서 유도된 지역적 기술자가 각 스크립트 고유의 국소 텍스처 및 형상 패턴을 효과적으로 캡처하는 데 성공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.