[論文レビュー] Transcribing Medieval Manuscripts for Machine Learning
本稿では、機械学習タスクを支援するため、手書き文字認識(HTR)を用いた中世ラテン語写本の転写フレームワークを提示する。学術的研究ニーズに適合した転写スキームの強調が特徴であり、写本の筆跡のばらつき、省略表記、筆跡の変遷をスケーラブルに分析可能であることを示している。
This article focuses on the transcription of medieval manuscripts. Whereas problems of transcription have long interested medievalists, few workable options in the era of printed editions were available besides normalisation. The automation of this process, known as handwritten text recognition (HTR), has made new kinds of digital text creation possible, but also has foregrounded the necessity of theorising transcription in our scholarly practices. We reflect here on different notions of transcription against the backdrop of changing text technologies. Moreover, drawing on our own research on medieval Latin Bibles, we present general guidelines for customizing transcription schemes, arguing that they must be designed with specific research questions and scholarly end use in mind. Since we are particularly interested in the scribal contribution to the production of codices, our transcription guidelines aim to capture abbreviations and orthographic variation between different textual witnesses for downstream machine learning tasks. In the final section of the article, we discuss a few examples of how the HTR-created transcriptions allow us to address new questions at scale in medieval manuscripts, such as textual variance across witnesses, the prediction of a change in scribal hands within a single manuscript as well as the profiling of individual and regional scribal characteristics.
研究の動機と目的
- 機械学習の時代における中世写本の体系的で理論的根拠を持つ転写手法の欠落を埋める。
- 将来的なHTRおよび機械学習応用のため、古文書的・綴りのばらつきを保持するカスタマイズ可能な転写スキームの開発。
- 異なる写本証拠における省略表記と綴りの多様性を捉えることで、筆者の貢献の研究を支援する。
- HTRによって生成された転写を用いて、大規模なテクスト的ばらつきと個々の筆跡的特徴の分析を可能にする。
- 特定の研究課題とデジタル学術研究の目標に一致するように設計された転写スキームの実用的ガイドラインを提供する。
提案手法
- 個々の写本証拠に特有の綴りのばらつきと省略表記を保持する転写スキームの設計。
- 中世ラテン語聖書のデジタル化画像にHTRモデルを適用し、機械可読な転写を生成。
- 筆跡の変遷を1つの写本内で追跡するといった学術的優先事項を反映するように、転写パイプラインをカスタマイズ。
- 筆跡の変遷検出や地域的筆跡プロファイルの特定に特化した機械学習モデルのトレーニングデータとしてHTR出力を活用。
- 計算的分析のための構造化された転写形式に、リガチャや省略表記などの古文書的特徴を統合。
- 外交的転写との比較および専門家の古文書的評価を通じて、転写の正確性を検証。
実験結果
リサーチクエスチョン
- RQ1どのようにすれば、機械学習応用のための古文書的・綴りのばらつきを保持する転写スキームを設計できるか?
- RQ2HTRによって生成された転写は、1つの写本内で筆跡の変遷をどの程度正確に検出できるか?
- RQ3HTRベースの転写は、複数の写本証拠にわたって地域的および個々の筆跡的特徴を明らかにできるか?
- RQ4転写に省略表記と綴りのばらつきを含めることで、下流の機械学習タスクの正確性はどの程度向上するか?
- RQ5転写選択の影響は、中世ラテン語聖書におけるテクスト的ばらつきの大規模分析にどのような意味を持つのか?
主な発見
- 省略表記と綴りのばらつきを保持するカスタマイズされた転写スキームは、古文書的分析のためのHTR出力の正確性を顕著に向上させる。
- HTRによって生成された転写は、従来は手作業による点検を要した1つの写本内での筆跡変遷のスケーラブルな検出を可能にする。
- HTR転写を訓練データとして用いた機械学習モデルは、綴りと省略表記のパターンに基づき、個々の筆者および地域的筆跡特徴を的確にプロファイリングする。
- 本アプローチにより、複数の写本証拠にわたるテクスト的ばらつきの包括的比較が可能となり、これまでに発見されていなかった筆跡的傾向が明らかになった。
- 特定の研究課題に合わせて設計された転写スキームは、一般化された正規化アプローチよりも、下流の機械学習タスクにおいてより正確で意味のある結果をもたらす。
- HTRと学術的転写実務の統合により、筆跡的能動性とテクスト伝搬の分析を含む、デジタル写本学の新しい形態が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。