[논문 리뷰] A Novel Approach to OCR using Image Recognition based Classification for Ancient Tamil Inscriptions in Temples
이 논문은 7세기에서 12세기 사이의 고대 타밀 문구를 대상으로 한 새로운 OCR 시스템을 제안한다. 이 시스템은 수작업으로 정제된, 잘라낸 사원 문구 이미지로 훈련된 2차원 컨볼루션 신경망(2D-CNN)을 사용한다. Otsu 기반 이진화 이후 CNN이 문자를 분류하며, 결과는 pytesseract와 TTS 출력을 통해 통합된다. 시스템은 테스트 세트에서 77.7%의 인식 정확도를 달성한다.
Recognition of ancient Tamil characters has always been a challenge for epigraphers. This is primarily because the language has evolved over the several centuries and the character set over this time has both expanded and diversified. This proposed work focuses on improving optical character recognition techniques for ancient Tamil script which was in use between the 7th and 12th centuries. While comprehensively curating a functional data set for ancient Tamil characters is an arduous task, in this work, a data set has been curated using cropped images of characters found on certain temple inscriptions, specific to this time as a case study. After using Otsu thresholding method for binarization of the image a two dimensional convolution neural network is defined and used to train, classify and, recognize the ancient Tamil characters. To implement the optical character recognition techniques, the neural network is linked to the Tesseract using the pytesseract library of Python. As an added feature, the work also incorporates Google's text to speech voice engine to produce an audio output of the digitized text. Various samples for both modern and ancient Tamil were collected and passed through the system. It is found that for Tamil inscriptions studied over the considered time period, a combined efficiency of 77.7 percent can be achieved.
연구 동기 및 목표
- 수세기 동안 크게 변화해온 고대 타밀 문자를 인식하는 데 도전하는 것 — 이는 표준화된 디지털 자원이 부족하기 때문이다.
- 7세기에서 12세기 사이의 사원 문구에서 추출한 잘라낸 문자의 기능적인 데이터셋을 구축하는 것.
- 딥 러닝 기반 이미지 분류를 활용해 역사적 타밀 문자의 OCR 성능을 향상시키는 것.
- 디지타이징된 문구의 접근 가능한 출력을 위해 텍스트에서 음성으로 변환 기능을 통합하는 것.
- 현대 및 고대 타밀 문자 샘플에 대한 시스템 성능 평가
제안 방법
- 7세기에서 12세기 사이의 사원 문구에서 추출한 잘라낸 고대 타밀 문자 이미지로부터 맞춤형 데이터셋을 정제했다.
- 대trast를 향상시키고 분류에 적합하게 준비하기 위해 Otsu 임계값 기반 이진화를 수행했다.
- 개별 타밀 문자를 분류하기 위해 2차원 컨볼루션 신경망(2D-CNN)을 설계하고 훈련시켰다.
- 훈련된 CNN 모델을 pytesseract 파이썬 라이브러리를 통해 Tesseract OCR 엔진과 연동하여 종단 간 OCR 처리를 구현했다.
- 인식된 텍스트에서 음성 출력을 생성하기 위해 Google의 텍스트에서 음성으로 변환 엔진을 통합했다.
- 인식 정확도 평가를 위해 현대 및 고대 타밀 문자 샘플 모두에 대해 시스템을 평가했다.
실험 결과
연구 질문
- RQ1딥 러닝 기반 이미지 분류 모델이 역사적 문구에서 고대 타밀 문자를 신뢰성 있게 인식할 수 있는가?
- RQ2Otsu 기반 이미지 전처리는 열악한 상태의 사원 문구에서 문자 인식 정확도 향상에 얼마나 효과적인가?
- RQ32D-CNN 분류와 Tesseract를 융합한 하이브리드 OCR 시스템의 성능은 어떠한가?
- RQ47세기에서 12세기 사이의 다양한 문구에서 글자 스타일과 폰트의 다양성에 대해 시스템이 얼마나 잘 대처할 수 있는가?
- RQ5텍스트에서 음성으로 변환 기능의 통합이 시각적 자료에 대한 접근성 향상에 기여하는 정도는 어떠한가?
주요 결과
- 제안된 OCR 시스템은 7세기에서 12세기 사이의 고대 타밀 문구에서 총 77.7%의 인식 정확도를 달성했다.
- Otsu 임계값 기반 처리가 대비 향상과 노이즈 감소를 통해 후속 CNN 분류에 유의미한 영향을 미쳤다.
- pytesseract를 통한 2D-CNN과 Tesseract의 통합이 종단 간 텍스트 인식에 효과적으로 기여했다.
- 시스템은 Google의 텍스트에서 음성으로 변환 엔진을 활용해 음성 출력을 성공적으로 생성하여 디지타이징된 문구에 다중 모odal 접근을 가능하게 했다.
- 사원 문구에서 추출한 잘라낸 문자의 정제된 데이터셋은 역사적 글자 데이터의 부족에도 불구하고 훈련 및 평가에 유용한 자원으로 입증되었다.
- 이 방법은 특히 역사적 변형이 뚜렷한 글자체에 대해 대규모 에피그래픽 디지타이제이션의 실현 가능성을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.