[論文レビュー] Applications of Machine Learning in Document Digitisation
本稿では、機械学習を用いてスキャンされた歴史的文書からのデータ収集を自動化する方法を示している。看護師の日誌における治療指標を推定するために教師なしレイアウト分類を、デンマークの死亡証明書における手書き文字認識のためにアテンションベースのニューラルネットワークを適用している。出生日および死亡日を転写するエンドツーエンドの精度は83.66%に達し、手動による転写コストを顕著に削減するとともに、大規模な文書コレクションのスケーラブルな分析を可能にしている。
Data acquisition forms the primary step in all empirical research. The availability of data directly impacts the quality and extent of conclusions and insights. In particular, larger and more detailed datasets provide convincing answers even to complex research questions. The main problem is that 'large and detailed' usually implies 'costly and difficult', especially when the data medium is paper and books. Human operators and manual transcription have been the traditional approach for collecting historical data. We instead advocate the use of modern machine learning techniques to automate the digitisation process. We give an overview of the potential for applying machine digitisation for data collection through two illustrative applications. The first demonstrates that unsupervised layout classification applied to raw scans of nurse journals can be used to construct a treatment indicator. Moreover, it allows an assessment of assignment compliance. The second application uses attention-based neural networks for handwritten text recognition in order to transcribe age and birth and death dates from a large collection of Danish death certificates. We describe each step in the digitisation pipeline and provide implementation insights.
研究の動機と目的
- スキャンされた歴史的文書の手動またはクラウドソーシングによる転写におけるスケーラビリティおよびコストの制限を解消すること。
- 機械学習が、看護師の日誌や死亡証明書のような非標準的でスキャンされた紙の文書からデータ収集を自動化できることを示すこと。
- Python、PyTorch、OpenCVなどの自由に利用可能なツールを用いて、機械学習ベースのデジタル化パイプラインを実装できることを示すこと。
- 実際のアーカイブデータセットにおけるレイアウト分類および手書き文字認識のエンドツーエンド機械学習パイプラインの性能を評価すること。
- 大規模な歴史的データ分析において、手作業の負担を軽減しながらも、妥当な精度を維持できるという機械学習の実用的利点を強調すること。
提案手法
- 看護師の日誌における治療分野を同定・セグメンテーションするために、クラスタリング技術を用いた教師なしレイアウト分類。
- 事前にセグメンテーションされた分野におけるスキャン済み文書のエンドツーエンド手書き文字認識に、アテンションベースのニューラルネットワークを適用。
- 特に日付分野における転写誤りを低減するために、フィールドレベルのセグメンテーションを改善するためのMask R-CNNの使用。
- 低信頼度の予測を手動レビュー用にフラグとして出力するための信頼度しきい値の導入により、アクティブラーニングループを可能にした。
- 年齢および日付分野の転写結果を照合することで、全体の精度を93.56%まで向上させた。
- 11,630件の日付および11,072件の年齢から成る、スキャンされたデンマークの死亡証明書の小規模でキュレートされたデータセットを用いて、トレーニングおよび評価を実施。
実験結果
リサーチクエスチョン
- RQ1教師なしレイアウト分類は、手動アノテーションなしで、歴史的看護師日誌における治療関連分野を効果的に同定できるか?
- RQ2アテンションベースのモデルは、スキャンされた死亡証明書からの手書き文字認識において、どの程度高い精度を達成できるか?
- RQ3セグメンテーションおよびフィールドレベルの誤りを考慮した場合、エンドツーエンド機械学習のパフォーマンスはクラウドソーシングによる転写と比べてどうか?
- RQ4機械学習パイプラインは、大規模なアーカイブ文書コレクションにおける手動転写の負担を軽減できるか、かつ妥当な精度を維持できるか?
- RQ5フィールドレベルのセグメンテーションは、歴史的文書における手書き文字認識の精度にどのような役割を果たすか?
主な発見
- 教師なしレイアウト分類は、4,000ページの評価セットにおいて、約1.0の精度および再現率を達成し、完全なコレクション解析がなければ発見されなかった治療割り当ての非遵守状況を明らかにした。
- エンドツーエンド機械学習パイプラインは、スキャンされた死亡証明書からの出生日および死亡日の転写において83.66%の精度を達成したが、誤差の大部分はセグメンテーションの問題に起因しており、特に年齢の成分に影響を及えた。
- 年齢の正確さは89.11%であったのに対し、日は95.92%、月は96.98%であったため、年齢分野へのセグメンテーション誤差の影響が顕著に現れている。
- 年齢および日付分野の転写結果を照合することで、エンドツーエンドの精度は93.56%まで向上した。これは、複数のフィールド間の一貫性チェックの価値を示している。
- 完全にセグメンテーションされた評価セットでは、機械学習モデルが96%の精度を達成した。これは、実世界のパフォーマンスにおいて、セグメンテーションの質が主なボトルネックであることを示している。
- 200万件の文書を機械学習で転写するコストは、手動による転写と比較して無視できるほど低く、機械学習ベースのデジタル化パイプラインのスケーラビリティおよびコスト効率の高さが顕著に示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。