[논문 리뷰] Handwritten and Machine printed OCR for Geez Numbers Using Artificial Neural Network
이 연구는 560幅의 이미지 데이터셋(훈련용 460장, 테스트용 100장)을 사용하여 오프라인 수기 및 인쇄된 게즈 숫자 표기의 인식을 위한 피드포워드 백프로파게이션 인공신경망을 제안한다. 전체 분류 정확도는 89.88%를 기록하며, 종교적 및 달력 문서에서 흔히 사용되지만 이전 에티오피아 문자 연구에서 간과되었던 게즈 숫자 인식의 격차를 메우며 에티오피아 역사적 문헌의 디지털화에 기여한다.
Researches have been done on Ethiopic scripts. However studies excluded the Geez numbers from the studies because of different reasons. This paper presents offline handwritten and machine printed Geez number recognition using feed forward back propagation artificial neural network. On this study, different Geez image characters were collected from google image search and three persons are instructed to write the numbers using pencil. In total we have collected 560 numbers of characters. We have used 460 of the characters for training and 100 are used for testing. Accordingly we have achieved overall all classification ~89:88%
연구 동기 및 목표
- 에티오피아 종교적 및 역사적 텍스트에서 흔히 사용되지만 이전 연구에서 간과되었던 게즈 숫자 인식에 대한 연구 부족을 보완하기 위해.
- 수기 및 인쇄된 게즈 숫자 표기를 모두 인식할 수 있는 기계학습 기반 시스템을 개발하기 위해.
- 게즈 숫자를 디지털 텍스트로 정확하게 변환함으로써 에티오피아 역사적 문헌의 디지털화에 기여하기 위해.
- 부족한 연구가 이루어진 아프리카 언어의 스크립트 전용 숫자 인식에 인공신경망을 활용할 수 있는지의 타당성을 탐색하기 위해.
제안 방법
- Google 이미지, 성경 자료, 세 명의 개인으로부터 수집한 수기 샘플로부터 총 560장의 게즈 숫자 이미지를 확보하였다.
- 이미지를 Grayscale로 변환하고, 이진화하며, 전경 문자 픽셀을 '1'로 유지하기 위해 반전 처리한 후 개별 문자를 분할하였다.
- 신경망에 일관된 입력을 제공하기 위해 분할된 문자들을 균일한 45×40 픽셀 크기로 조정하였다.
- 3개의 은닉층(20, 15, 10개 뉴런)과 20개 뉴런을 갖는 출력층(20개의 게즈 숫자 기호를 나타냄)을 갖는 다층 피드포워드 백프로파게이션 신경망을 설계하였다.
- 공액 기울기 백프로파게이션을 사용하여 네트워크를 학습시켰으며, Polak-Ribière 업데이트를 적용하였다. 입력 벡터는 45×40 이미지 행렬을 1800개 요소를 갖는 열 벡터로 평탄화하여 구성하였다.
- 각 숫자를 고유한 이진 벡터로 매핑하기 위해 5비트 이진 인코딩을 출력 레이블에 사용하였다.
실험 결과
연구 질문
- RQ1피드포워드 백프로파게이션 신경망은 수기 및 인쇄된 게즈 숫자를 효과적으로 인식할 수 있는가?
- RQ2게즈 숫자 인식에서 훈련 데이터와 테스트 데이터 간의 성능 차이는 어떻게 나타나는가?
- RQ3이미지 전처리 및 분할 단계가 게즈 숫자 인식 정확도 향상에 어느 정도 기여하는가?
- RQ4제한된 훈련 데이터 크기가 모델의 전체 분류 성능에 어떤 영향을 미치는가?
- RQ5기존에 아مهر라어/게즈 스크립트에 대해 학습된 신경망 아키텍처를 게즈 숫자 인식에 적응시켜도 만족스러운 정확도를 달성할 수 있는가?
주요 결과
- 제안된 시스템의 전체 분류 정확도는 테스트 세트 100장에 대해 89.88%에 도달하였다.
- 훈련 분류 정확도는 98.03%로 매우 높아 훈련 데이터에 대한 강력한 학습 능력을 보였다.
- 테스트 정확도는 65.3%로 훈련 성능 대비 뚜렷한 하락을 보였으며, 이는 데이터 불균형 또는 테스트 세트 크기의 제한 때문일 가능성이 높다.
- 모델는 훈련 데이터에 대해 높은 일반화 능력을 보였지만, 새로운 테스트 샘플에는 어려움을 겪었으며, 이는 데이터 부족이 핵심 제약 요소임을 시사한다.
- 이진화, 반전, 크기 조정을 포함한 이미지 전처리 단계는 일관된 입력 표현을 확보하고 네트워크 성능 향상에 필수적이었다.
- 출력 레이블에 5비트 이진 인코딩을 사용함으로써 20종의 고유한 게즈 숫자 기호에 대한 효과적인 다중 클래스 분류가 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.