[논문 리뷰] State of the Art Optical Character Recognition of 19th Century Fraktur Scripts using Open Source Engines
이 논문은 합성 데이터 대신 다양한 실제 데이터로 훈련된 혼합 모델을 사용하여 19세기 프라크투어 문자를 위한 오픈소스 OCR 엔진을 평가한다. 이는 새로운 OCR 엔진인 칼라마리가 테서렉트와 오써포스를 모두 뛰어넘으며, ABBY의 문자 오류율을 70% 이상 감소시키고, 예측되지 않은 역사적 텍스트에서 평균 CER가 1% 미만이 되는 것으로 입증한다.
In this paper we evaluate Optical Character Recognition (OCR) of 19th century Fraktur scripts without book-specific training using mixed models, i.e. models trained to recognize a variety of fonts and typesets from previously unseen sources. We describe the training process leading to strong mixed OCR models and compare them to freely available models of the popular open source engines OCRopus and Tesseract as well as the commercial state of the art system ABBYY. For evaluation, we use a varied collection of unseen data from books, journals, and a dictionary from the 19th century. The experiments show that training mixed models with real data is superior to training with synthetic data and that the novel OCR engine Calamari outperforms the other engines considerably, on average reducing ABBYYs character error rate (CER) by over 70%, resulting in an average CER below 1%.
연구 동기 및 목표
- 책 전용 훈련 없이 19세기 프라크투어 문자에 대한 오픈소스 OCR 엔진의 성능을 평가하는 것.
- 실제 역사적 데이터로 훈련된 혼합 모델이 합성 데이터로 훈련된 모델보다 성능이 뛰어나지 않는지 조사하는 것.
- 기존의 Tesseract와 OCRopus와 같은 기성 엔진뿐 아니라 상용 ABBY 시스템과도 비교하는 최신 오픈소스 OCR 엔진인 칼라마리의 성능을 비교하는 것.
- 책, 저널, 사전을 포함한 다양한 예측되지 않은 역사적 자료에서 OCR 성능을 평가하는 것.
- 오픈소스 도구와 실제 훈련 데이터만을 사용하여 프라크투어 문자의 고정밀 OCR 기준을 설정하는 것.
제안 방법
- 다양한 출처에서 확보한 실제 19세기 프라크투어 문서의 집합을 활용하여 혼합 OCR 모델을 훈련하는 것.
- 일반화 능력과 강건성을 평가하기 위해 실제 데이터로 훈련된 모델과 합성 데이터로 훈련된 모델을 비교하는 것.
- 딥 러닝 기반 시퀀스 모델링을 활용하여 문자 인식 성능을 향상시킨 오픈소스 OCR 엔진인 칼라마리를 활용하는 것.
- 예측되지 않은 19세기 프라크투어 텍스트(책, 저널, 사전 포함)로 구성된 검증 세트를 활용해 모든 모델의 성능을 평가하는 것.
- OCR 엔진 간 성능 비교를 위한 주요 평가 지표로 문자 오류율(CER)을 사용하는 것.
- OCR 엔진의 입력 품질을 향상시키기 위해 이진화 및 노이즈 제거와 같은 표준 전처리 기법을 적용하는 것.
실험 결과
연구 질문
- RQ1실제 역사적 프라크투어 데이터로 혼합 OCR 모델을 훈련하면 합성 데이터로 훈련하는 것보다 성능이 뛰어나게 되는가?
- RQ2예측되지 않은 19세기 프라크투어 텍스트에서 오픈소스 OCR 엔진 칼라마리의 성능은 테서렉트, 오써포스, 상용 ABBY 시스템과 비교해 어떻게 되는가?
- RQ3책 전용 미세조정 없이도 오픈소스 OCR 엔진이 19세기 프라크투어 문자에서 문자 오류율을 1% 이하로 낮출 수 있는가?
- RQ4훈련 데이터의 글꼴 및 타입세트 다양성이 역사적 문자에 대한 OCR 모델의 일반화 능력에 어떤 영향을 미치는가?
- RQ5오픈소스 도구가 복잡한 역사적 문자를 인식하는 데서 상용 OCR 시스템인 ABBY의 성능을 따라하거나 뛰어넘을 수 있는 정도는 어느 정도인가?
주요 결과
- 실제 역사적 프라크투어 데이터로 혼합 모델을 훈련하는 것은 일반화 능력과 정확도 측면에서 합성 데이터로 훈련하는 것보다 뚜렷이 뛰어나다.
- 오픈소스 OCR 엔진 칼라마리는 예측되지 않은 19세기 프라크투어 텍스트에서 평균 문자 오류율(CER)이 1% 미만이 된다.
- 칼라마리는 테스트 세트 전반에서 상용 ABBY 시스템의 문자 오류율을 평균 70% 이상 감소시킨다.
- 칼라마리는 테서렉트와 오써포스를 모두 능가하며, 복잡한 역사적 문자에 대한 뛰어난 강건성과 정확도를 보여준다.
- 칼라마리에서 실제 데이터 훈련과 고급 딥 러닝 아키텍처의 조합이 프라크투어 OCR 분야에서 최고 수준의 성능을 가능하게 한다.
- 책 전용 미세조정 없이도 최고 성능을 보이는 오픈소스 모델들이 역사적 프라크투어 문서에서 거의 산업 수준의 정확도를 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.