[논문 리뷰] A BLSTM Network for Printed Bengali OCR System with High Accuracy
이 논문은 인쇄된 방글라어 및 영어 텍스트 인식을 위한 단일층 BLSTM-CTC 신경망을 제안하며, 20종의 방글라어 글꼴에서 문자 수준 정확도 99.32%와 단어 수준 정확도 96.65%를 달성한다. 시스템은 분할 없이 전체 텍스트 줄을 처리하며, 47,720줄의 데이터를 기반으로 CTC를 사용해 엔드 투 엔드 학습을 수행한다. 구글 드라이브 기반 OCR보다 정확도가 높으며, 특히 아삼어 문자에 대한 오분류를 피한다.
This paper presents a printed Bengali and English text OCR system developed by us using a single hidden BLSTM-CTC architecture having 128 units. Here, we did not use any peephole connection and dropout in the BLSTM, which helped us in getting better accuracy. This architecture was trained by 47,720 text lines that include English words also. When tested over 20 different Bengali fonts, it has produced character level accuracy of 99.32% and word level accuracy of 96.65%. A good Indic multi script OCR system is also developed by Google. It sometimes recognizes a character of Bengali into the same character of a non-Bengali script, especially Assamese, which has no distinction from Bengali, except for a few characters. For example, Bengali character for 'RA' is sometimes recognized as that of Assamese, mainly in conjunct consonant forms. Our OCR is free from such errors. This OCR system is available online at https://banglaocr.nltr.org
연구 동기 및 목표
- 기존 OCR 파이프라인에서 흔한 분할 오류를 피하는 고정확도의 엔드 투 엔드 인쇄된 방글라어 및 영어 OCR 시스템을 개발하는 것.
- 테서랙트 및 구글 드라이브 기반 OCR과 같은 기존 시스템의 한계를 해결하는 것, 특히 시각적으로 유사한 방글라어 문자를 아삼어 문자로 잘못 분류하는 경향을 개선하는 것.
- 클라우드 기반 API에 의존하지 않고도 응용 프로그램에 배포할 수 있는 독립형으로 접근 가능한 OCR 시스템을 만들기 위한 것.
- 47,720줄의 상대적으로 작은 학습 데이터셋에서 얕은 BLSTM-CTC 아키텍처의 성능을 평가하는 것.
- 방글라어 스크립트 인식에서 글꼴 변형과 문서 품질 열화에 대한 강건성을 향상시키는 것.
제안 방법
- 128개의 히든 유닛을 가진 단일층 양방향 장기 단기 기억(BlSTM) 네트워크를 사용하여 시퀀스 모델링을 수행하며, 각 줄당 1×48 픽셀의 회색조 이미지 스트립을 처리한다.
- 엔드 투 엔드 학습을 가능하게 하기 위해 BLSTM에 연결주의 시간 분류(CTC) 레이어를 결합하여 단어나 문자 수준의 정렬 정보가 필요 없도록 한다.
- 입력 특징은 48픽셀 높이로 정규화되며, 최대 80에포크 동안 배치 크기가 1인 상태에서 학습된다.
- 연속된 에포크 간 CTC 손실과 검증 오차의 변화가 각각 ≤0.01 및 ≤0.1일 경우 학습을 중단한다.
- 검증 세트에 대해 최소 편집 거리(MED)를 사용하여 문자 수준 및 단어 수준 정확도를 평가한다.
- Tesseract 4.0 및 구글 드라이브 기반 OCR(GDS)과의 성능 비교를 위해 MED 기반 정확도 지표를 사용하여 시스템을 테스트한다.
실험 결과
연구 질문
- RQ1단일층 BLSTM-CTC 아키텍처가 단어나 문자 분할 없이도 인쇄된 방글라어 및 영어 텍스트 인식에서 높은 정확도를 달성할 수 있는가?
- RQ2경량 BLSTM-CTC 모델의 성능은 방글라어 스크립트에서 최신 기술인 구글 드라이브 기반 OCR 및 테서랙트 4.0과 비교해 어떻게 되는가?
- RQ3제안된 시스템은 특히 복합 형태에서 방글라어 문자를 아삼어 문자로 잘못 인식하는 문제를 어느 정도 줄일 수 있는가?
- RQ4BLSTM 아키텍처에서 피크홀 연결 및 드롭아웃을 사용하지 않은 것이 제한된 학습 데이터셋에서 일반화 능력과 정확도 향상에 기여하는가?
- RQ5독립형으로 개방된 OCR 시스템은 클라우드 기반 시스템보다 더 높은 정확도를 달성할 수 있으며, 로컬 응용 프로그램에 배포 가능한가?
주요 결과
- 제안된 BLSTM-CTC 시스템은 20종의 방글라어 글꼴에서 문자 수준 정확도 99.32%와 단어 수준 정확도 96.65%를 달성했으며, Tesseract 4.0(91.79% CA, 76.31% WA)과 구글 드라이브 기반 OCR(98.54% CA, 92.86% WA)를 모두 능가했다.
- 시스템은 스크립트 간 오분류가 없으며, 특히 구글 OCR 시스템에서 알려진 문제인 방글라어 'RA'를 아삼어로 잘못 인식하는 것을 방지한다.
- 128개의 히든 유닛과 48에포크 학습을 통해 검증 오차가 가장 낮게 나타나, 주어진 데이터셋 크기에서 최적의 성능을 달성했다.
- 단지 47,720줄의 학습 라인만을 사용했음에도 불구하고 높은 정확도를 달성했으며, 이는 BLSTM-CTC 아키텍처가 중간 크기의 데이터셋에서도 효과적이라는 것을 시사한다.
- 시스템은 구글 OCR 출력에서 관찰된 바와 같이 허위 Dandas(문장 구분 기호)를 생성하지 않는다.
- 완전히 기동 가능한 시스템은 https://banglaocr.nltr.org 에 공개되어 있어 독립형 배포 및 더 큰 응용 프로그램에의 통합이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.