Skip to main content
QUICK REVIEW

[논문 리뷰] AlexU-Word: A New Dataset for Isolated-Word Closed-Vocabulary Offline Arabic Handwriting Recognition

Mohamed E. Hussein, Marwan Torki|arXiv (Cornell University)|2014. 11. 17.
Handwritten Text Recognition Techniques참고 문헌 5인용 수 3
한 줄 요약

이 논문은 아랍 알파벳의 모든 글자 형태를 포함하도록 설계된 25,114개의 샘플을 포함한 새로운 오프라인 아랍어 필기 인식 데이터셋인 AlexU-Word를 소개한다. 이 데이터셋은 분할된 글자 이미지로 모델을 훈련시켜 문자 기반 인식을 가능하게 하며, SIFT 기술과 인공 신경망(ANN)을 사용하여 최신 기술 수준인 92.16%의 단어 인식 정확도를 달성한다.

ABSTRACT

In this paper, we introduce the first phase of a new dataset for offline Arabic handwriting recognition. The aim is to collect a very large dataset of isolated Arabic words that covers all letters of the alphabet in all possible shapes using a small number of simple words. The end goal is to collect a very large dataset of segmented letter images, which can be used to build and evaluate Arabic handwriting recognition systems that are based on segmented letter recognition. The current version of the dataset contains $25114$ samples of $109$ unique Arabic words that cover all possible shapes of all alphabet letters. The samples were collected from $907$ writers. In its current form, the dataset can be used for the problem of closed-vocabulary word recognition. We evaluated a number of window-based descriptors and classifiers on this task and obtained an accuracy of $92.16\%$ using a SIFT-based descriptor and ANN.

연구 동기 및 목표

  • 모든 아랍 알파벳 글자의 가능한 형태를 포괄하는 대규모 폐쇄어휘 오프라인 아랍어 필기 인식을 위한 데이터셋을 구축하기.
  • 훈련을 위해 단어를 개별 글자로 분할할 수 있도록 해, 강력한 문자 검출기 개발을 지원하기.
  • 글로벌 특징 기술자와 분류기의 성능 평가를 가능하게 하기 위해 벤치마크 데이터셋을 제공하기.
  • 향후 더 많은 단어와 레이블이 부여된 문자 수준 분할 정보를 추가하여 모델의 일반화 능력을 향상시키기 위해 데이터셋을 확장하기.
  • 다양하고 대규모의 분할된 문자 데이터를 활용해 아랍어 필기 인식의 패러다임을 단어 수준에서 문자 수준으로 전환하기.

제안 방법

  • 다양한 글쓰기 스타일과 필기 변형을 반영하기 위해 907명의 기수(남성 662명, 여성 245명; 오른손잡이 846명, 왼손잡이 61명)로부터 데이터를 수집하였다.
  • 28개 아랍 알파벳 글자가 초기, 중간, 끝, 고립형의 4가지 형태로 모두 포함되도록 109개의 고유한 아랍어 단어를 선정하였다.
  • 각 단어는 다양한 기수들에 의해 여러 번 기록되어 총 25,114개의 샘플을 확보하였으며, 훈련(15,039), 검증(5,048), 테스트(5,027) 세트로 나누어졌다.
  • 분류를 위해 단어 이미지에서 글로벌 이미지 기술자인 방향성 기울기 히스토그램(HOG7)과 척도 불변 특징 변환(SIFT7)을 추출하였다.
  • 세 가지 분류기—k-최근접 이웃(k-NN), 한 개의 은닉층(250개의 시그모이드 활성화 노드)을 가진 인공 신경망(ANN), 선형 커널을 사용한 서포트 벡터 머신(SVM)—을 평가하였다.
  • 모델 훈련은 검증 세트에서 초모수 튜닝을 통해 이루어졌으며, 최적의 초모수를 선정한 후 최종 평가를 테스트 세트에서 400회 훈련 반복을 통해 수행하였다.

실험 결과

연구 질문

  • RQ1소수의 단순하면서도 고도로 커버리지가 높은 아랍어 단어들이 오프라인 필기 인식 데이터셋에서 아랍 글자의 모든 가능한 형태를 효과적으로 대표할 수 있는가?
  • RQ2폐쇄어휘 설정 하에서, HOG7 대비 SIFT7의 글로벌 이미지 기술자가 고립된 아랍어 단어를 분류하는 데 얼마나 효과적인가?
  • RQ3최적화된 초모수를 적용했을 때, k-NN, SVM, ANN 분류기의 상대적 성능은 어떻게 되는가?
  • RQ4개별 글자로 분할이 가능한 데이터셋을 통해 문자 기반 인식 패러다임을 어느 정도 구현할 수 있는가?
  • RQ5다양하고 기수 다양성이 확보된 고립된 아랍어 단어 데이터셋에서 SIFT 특징과 ANN를 사용할 경우, 어떤 정도의 단어 인식 정확도를 달성할 수 있는가?

주요 결과

  • SIFT7 기술자가 인공 신경망(ANN)과 조합되었을 때 가장 높은 분류 정확도 92.16%를 기록하였으며, HOG7 및 다른 분류기 조합보다 뛰어난 성능을 보였다.
  • k-NN 분류기는 SIFT7를 사용했을 때 79.73%의 정확도를 달성했고, HOG7를 사용했을 때는 67.45%로 상당히 떨어져 SIFT의 우수한 분류 능력을 확인할 수 있었다.
  • ANN 분류기는 HOG7를 사용했을 때 86.67%의 정확도를 기록했고, SIFT7를 사용했을 때는 92.16%로 상승하여 비선형 모델이 더 rich한 특징 표현에서 더 큰 이점을 얻음을 보여주었다.
  • SVM 분류기는 SIFT7를 사용했을 때 91.16%의 정확도를 기록하여 ANN에 비해 略로 낮았지만, 다른 모든 조합보다 뛰어난 성능을 보였으며, 선형 커널이 강력한 일반화 능력을 제공함을 시사했다.
  • 9개의 단어 클래스는 100%의 정확도로 분류되었고, 혼동 행렬에서 강한 대각선 패턴이 관찰되어 대부분의 클래스 간에 높은 분리 가능성 존재를 확인했다.
  • 가장 혼동이 많이 일어난 단어 쌍은 시각적 또는 청각적으로 유사한 경우로, 유사한 글자 형태나 최소한의 철자적 차이를 가진 경우로 확인되었으며, 이는 모델이 미세한 차이에 민감함을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.