[논문 리뷰] Tamizhi-Net OCR: Creating A Quality Large Scale Tamil-Sinhala-English Parallel Corpus Using Deep Learning Based Printed Character Recognition (PCR).
이 논문은 오래된 폰트로 훈련된 LSTM 기반 훈련을 사용하여 Tesseract 4.1.1 모델을 개선한 Tamizhi-Net OCR을 제안한다. 이는 타밀어,僧伽라어, 영어의 인쇄된 문자 인식(PCR)을 향상시킨다. 타밀어의 문자 수준 정확도는 98.2%로 상승(상대적 향상 12.9%)하였고, 영어는 94.8%로 상승(상대적 향상 3.26%)하였다. 이로 인해 비표준 폰트를 사용하는 PDF에서 다국어 텍스트를 확장 가능하고 자동으로 추출할 수 있게 되었다.
Most of the low resource languages do not have the necessary resources to create even a substantial monolingual corpus. These languages may often be found in government proceedings but mostly in the form of Portable Document Formats (PDFs) that contains legacy fonts. Extracting text from these documents to create a monolingual corpus is challenging due to legacy font usage and printer-friendly encoding which are not optimized for text extraction. Therefore, we propose a simple, automatic, and novel idea that can scale for Tamil, Sinhala, and English languages and many documents. For this purpose, we enhanced the performance of Tesseract 4.1.1 by employing LSTM-based training on many legacy fonts to recognize printed characters in the above languages. Especially, our model detects code-mix text, numbers, and special characters from the printed document. It is shown that this approach can boost the character-level accuracy of Tesseract 4.1.1 from 85.5 to 98.2 for Tamil (+12.9% relative change) and 91.8 to 94.8 for Sinhala (+3.26% relative change) on a dataset that is considered as challenging by its authors.
연구 동기 및 목표
- 타밀어와 영어와 같은 저자원 언어에 대해 대규모 고품질의 단일 언어 코퍼스가 부족한 문제를 해결하기 위해.
- 오래된 폰트와 프린터 우아한 인코딩을 사용하는 PDF에서 텍스트를 추출하는 데 도전하는 문제를 극복하기 위해.
- 혼합 언어(코드 믹스드) 문서에서 타밀어, 영어, 영어의 인쇄된 문자를 자동으로 스케일링 가능한 방법으로 인식하기 위한 방법을 개발하기 위해.
- 오래된 폰트 데이터를 기반으로 한 딥러닝을 사용하여 Tesseract 4.1.1의 문자 수준 정확도를 향상시키기 위해.
- 스캔된 오래된 폰트 PDF에서 타밀어-영어-영어 병렬 코퍼스를 생성할 수 있도록 하기 위해.
제안 방법
- 다양한 오래된 폰트에서 훈련된 LSTM 기반 광학 문자 인식(OCR) 모델을 사용해 Tesseract 4.1.1을 개선하였다.
- 다국어 텍스트, 숫자, 특수 문자를 포함한 인쇄된 타밀어, 영어, 영어 문자를 포함한 대규모 다국어 데이터셋을 사용해 모델을 훈련시켰다.
- 기존 Tesseract 아키텍처를 비라틴 문자를 포함한 복잡한 문자 집합을 인식할 수 있도록 적응시키기 위해 전이 학습 기법을 적용하였다.
- 정부 문서에서 흔히 볼 수 있는 인쇄 우아한 인코딩과 비표준 폰트 매핑을 처리하기 위해 모델을 최적화하였다.
- 일반화 능력을 향상시키기 위해 오래된 폰트 PDF를 훈련 샘플로 전처리 및 증강하기 위한 고유한 데이터 파이프라인을 사용하였다.
- 문자 수준 정확도 향상 정도를 측정하기 위해 도전적인 벤치마크 데이터셋을 사용해 성능을 평가하였다.
실험 결과
연구 질문
- RQ1LSTM 기반 향상된 Tesseract 4.1.1은 오래된 폰트를 사용하는 문서에서 타밀어와 영어의 문자 수준 정확도를 크게 향상시킬 수 있는가?
- RQ2이 모델은 다국어 인쇄 문서에서 코드 믹스드 텍스트, 숫자, 특수 문자를 얼마나 잘 감지하고 정확하게 인식할 수 있는가?
- RQ3이러한 저자원 언어의 정부 및 자료 보관 문서 대량 처리에 대해 제안된 방법의 확장성은 어떠한가?
- RQ4기본 Tesseract 4.1.1 대비 오래된 폰트 PDF에서 타밀어와 영어의 OCR 정확도 향상률은 얼마인가?
- RQ5이 방법을 통해 스캔된 문서에서 고품질의 타밀어-영어-영어 병렬 코퍼스를 자동으로 생성할 수 있는가?
주요 결과
- 제안된 Tamizhi-Net OCR 모델은 도전적인 벤치마크 데이터셋에서 타밀어의 문자 수준 정확도를 85.5%에서 98.2%로 향상시켜 상대적 향상률 12.9%를 달성하였다.
- 영어의 경우, 기본 Tesseract 4.1.1의 91.8% 대비 94.8%의 문자 수준 정확도를 달성하여 상대적 향상률 3.26%를 기록하였다.
- 모델은 다국어 인쇄 문서에서 코드 믹스드 텍스트, 숫자, 특수 문자를 높은 정밀도로 성공적으로 인식하였다.
- 이 방법은 정부 및 자료 보관소에서 흔히 볼 수 있는 대량의 오래된 폰트 PDF 처리에 대해 확장 가능성을 입증하였다.
- 향상된 Tesseract 모델은 스캔된 비표준 문서 형식에서 고품질의 단일 언어 및 병렬 코퍼스를 자동으로 생성할 수 있도록 하였다.
- 결과적으로, 오래된 폰트에서 LSTM 기반의 정밀 조정이 타밀어 및 영어와 같은 저자원 스크립트의 OCR 성능을 크게 향상시킨다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.