[논문 리뷰] Transcribing Medieval Manuscripts for Machine Learning
이 논문은 기계학습 작업을 지원하기 위해 수기 문자 인식(HTR)을 사용하여 중세 라틴어 문헌을 변환하는 프레임워크를 제시한다. 학술 연구의 필요에 맞춘 변환 체계에 중점을 두며, 텍스트 증거 간의 필적 변동, 약어, 필적 전환을 포함한 확장 가능한 분석이 가능하다는 것을 보여준다.
This article focuses on the transcription of medieval manuscripts. Whereas problems of transcription have long interested medievalists, few workable options in the era of printed editions were available besides normalisation. The automation of this process, known as handwritten text recognition (HTR), has made new kinds of digital text creation possible, but also has foregrounded the necessity of theorising transcription in our scholarly practices. We reflect here on different notions of transcription against the backdrop of changing text technologies. Moreover, drawing on our own research on medieval Latin Bibles, we present general guidelines for customizing transcription schemes, arguing that they must be designed with specific research questions and scholarly end use in mind. Since we are particularly interested in the scribal contribution to the production of codices, our transcription guidelines aim to capture abbreviations and orthographic variation between different textual witnesses for downstream machine learning tasks. In the final section of the article, we discuss a few examples of how the HTR-created transcriptions allow us to address new questions at scale in medieval manuscripts, such as textual variance across witnesses, the prediction of a change in scribal hands within a single manuscript as well as the profiling of individual and regional scribal characteristics.
연구 동기 및 목표
- 기계학습의 시대에 중세 문헌을 위한 체계적이고 이론에 기반한 변환 방법의 격차를 보완하기 위해.
- 후속 HTR 및 기계학습 응용을 위해 철학적 및 철자적 변동을 유지하는 커스터마이징 가능한 변환 체계를 개발하기 위해.
- 다양한 문헌 증거 간의 약어와 철자 다양성을 캡처하여 필적 기여도 연구를 지원하기 위해.
- HTR 기반 변환을 통해 단일 문헌에서의 텍스트 변동성과 개인적 필적 특성에 대한 대규모 분석을 가능하게 하기 위해.
- 특정 연구 질문과 디지털 학술 목표에 부합하는 변환 체계 설계를 위한 실용적 지침을 제공하기 위해.
제안 방법
- 개별 문헌 증거에 특화된 철자적 변동과 약어를 유지하는 변환 체계 설계.
- 중세 라틴 성경의 디지털 이미지에 HTR 모델을 적용하여 기계로 읽을 수 있는 변환문 생성.
- 한 문헌 내에서 필적 변화를 추적하는 등의 학술적 우선순위를 반영해 변환 파이프라인을 커스터마이징.
- 필적 전환과 지역적 필적 프로파일을 탐지하는 데 초점을 맞춘 기계학습 모델을 훈련시키기 위해 HTR 출력물을 학습 데이터로 활용.
- 컴퓨터 분석을 위한 구조화된 변환 형식에 철학적 특징(예: 결합 문자, 약어) 통합.
- 도서관 문서 변환 및 전문가의 철학적 평가와의 비교를 통해 변환 정확도 검증.
실험 결과
연구 질문
- RQ1기계학습 응용을 위해 철학적 및 철자적 변동을 유지하는 변환 체계는 어떻게 설계할 수 있는가?
- RQ2HTR 기반 변환은 한 문헌 내에서 필적 변화를 얼마나 정확하게 탐지할 수 있는가?
- RQ3HTR 기반 변환은 다수의 문헌 증거 간에 지역적 및 개인적 필적 특성을 드러내는가?
- RQ4변환에 약어와 철자적 변동을 포함시키면 후속 기계학습 작업의 정확도가 어떻게 향상되는가?
- RQ5텍스트 변동성 대규모 분석에 있어 변환 선택의 영향은 무엇인가?
주요 결과
- 약어와 철자적 변동을 유지하는 커스터마이징된 변환 체계는 철학적 분석을 위한 HTR 출력의 정확도를 크게 향상시킨다.
- HTR 기반 변환은 이전에는 수작업 검토가 필요했던 한 문헌 내 필적 전환을 대규모로 탐지할 수 있도록 한다.
- HTR 변환을 기반으로 훈련된 기계학습 모델은 철자 및 약어 패턴을 바탕으로 개인 및 지역적 필적 특성을 성공적으로 프로파일링한다.
- 이 방법은 다수의 문헌 증거 간 텍스트 변동성의 대규모 비교를 가능하게 하여 이전에 발견되지 않은 필적 경향을 드러낸다.
- 특정 연구 질문을 중심으로 설계된 변환 체계는 일반화된 정규화 접근보다 후속 기계학습 작업에서 더 정확하고 의미 있는 결과를 도출한다.
- HTR와 학술적 변환 관행의 통합은 필적 주체성과 텍스트 전파 분석에 특화된 새로운 디지털 문헌 연구 형태를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.