[논문 리뷰] Automated Transcription of Non-Latin Script Periodicals: A Case Study in the Ottoman Turkish Print Archive
이 논문은 오스만 투르크어 문예지의 아랍 문자로 쓰인 역사적 텍스트를 자동으로 전사하기 위한 딥러닝 기반 접근법을 제시한다. Transkribus 플랫폼을 활용하여 역사적 오스만 투르크어 텍스트를 현대 라틴 문자 투르크어로 변환하는 HTR 모델을 훈련시으며, 일对일 문자 대응이 없는 문제와 같은 과제를 극복한다. 이는 20세기 초의 두 문예지에서 성공적인 전사 결과를 도출하여, 문체 개혁과 기술적 장벽에도 불구하고 현대 독자들이 디지털로 접근할 수 있도록 한다.
Our study utilizes deep learning methods for the automated transcription of late nineteenth- and early twentieth-century periodicals written in Arabic script Ottoman Turkish (OT) using the Transkribus platform. We discuss the historical situation of OT text collections and how they were excluded for the most part from the late twentieth century corpora digitization that took place in many Latin script languages. This exclusion has two basic reasons: the technical challenges of OCR for Arabic script languages, and the rapid abandonment of that very script in the Turkish historical context. In the specific case of OT, opening periodical collections to digital tools require training HTR models to generate transcriptions in the Latin writing system of contemporary readers of Turkish, and not, as some may expect, in right-to-left Arabic script text. In the paper we discuss the challenges of training such models where one-to-one correspondence between the writing systems do not exist, and we report results based on our HTR experiments with two OT periodicals from the early twentieth century. Finally, we reflect on potential domain bias of HTR models in historical languages exhibiting spatio-temporal variance as well as the significance of working between writing systems for language communities that have experienced language reform and script change.
연구 동기 및 목표
- 비라틴 문자를 사용하는 OCR 기술적 과제로 인해 오스만 투르크어(OT) 텍스트가 디지털 코퍼스에서 배제되는 문제를 해결하기 위해.
- 비라틴 문자를 사용하는 오스만 투르크어를 현대 라틴 문자 투르크어로 전사하는 HTR 모델을 개발하고 평가하여, 현대 독서 관행과 일치시킴.
- 제한된 비대표적인 문예지 샘플을 기반으로 훈련된 역사적 언어 모델에서 도메인 편향과 시공간적 변동이 미치는 영향을 조사하기 위해.
- 스크립트 개혁을 경험한 언어 공동체의 보존과 접근성을 지원하기 위한 교차 스크립트 전사의 가능성을 입증하기 위해.
제안 방법
- 역사적 오스만 투르크어 문예지의 아랍 문자 텍스트를 대상으로 Transkribus 플랫폼을 활용해 딥러닝 기반 HTR 모델을 훈련시킴.
- 시각적 특징을 라틴 문자 등가물로 매핑하기 위해 엔드 투 엔드 신경망을 적용함.
- 저자원, 높은 시각적 변동성이 있는 역사적 텍스트에서의 일반화 능력을 향상시키기 위해 데이터 증강 및 전이 학습 기법을 활용함.
- 실세계의 역사적 인쇄물에서의 변동성 있는 잉크, 손상, 레이아웃 복잡성 등을 고려해 두 개의 20세기 초 문예지에서 모델을 훈련함.
- 원본 아랍 문자를 유지하는 것보다 현대 투르크어 독자들을 위한 접근성에 중점을 두어 교차 스크립트 전사에 집중함.
- 표준 HTR 평가 지표인 단어 오류율(WER)과 문자 오류율(CER)을 사용해 모델 성능을 평가함. 다만 요약에서는 정확한 수치를 기재하지 않음.
실험 결과
연구 질문
- RQ1일대일 문자 대응이 없는 상황에서 오스만 투르크어 텍스트를 아랍 문자에서 현대 라틴 문자로 전사하는 HTR의 효과성은 어떠한가?
- RQ2제한된 훈련 데이터를 바탕으로 비라틴 문자를 사용하는 역사적 문자체계에 대해 HTR 모델을 훈련시킬 때 발생하는 주요 기술적 및 언어학적 과제는 무엇인가?
- RQ3스크립트 사용의 시공간적 변동이 있는 문예지에 적용될 때 도메인 편향이 HTR 모델 성능에 미치는 영향은 어느 정도인가?
- RQ4교차 스크립트 전사는 스크립트 개혁을 경험한 언어 공동체의 디지털 접근성과 보존을 어떻게 지원할 수 있는가?
주요 결과
- HTR 모델은 아랍 문자로 쓰인 오스만 투르크어 문예지를 성공적으로 현대 라틴 문자 투르크어로 전사하여, 역사적 언어 접근을 위한 교차 스크립트 전사의 가능성을 입증함.
- 비병렬 문체 체계를 사용하는 비라틴 문자를 위한 HTR 모델 훈련은 철저한 철자 및 발음 불일치 처리가 필요함을 확인함.
- 정확한 문자 매핑이 없음에도 불구하고 두 훈련된 20세기 초 문예지에서 사용 가능한 전사 품질을 달성하여 실용적 유용성을 입증함.
- 역사적 텍스트를 위한 HTR 시스템 설계 시 스크립트 개혁과 언어 진화를 고려하는 것이 중요함을 강조함.
- 특히 철자적 변동성이 높은 언어에서는 제한된 비대표적인 역사적 코퍼스에서 훈련할 경우 도메인 편향이 중요한 문제로 작용할 수 있음이 결과로 나타남.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.