[論文レビュー] 19th Century United States Newspaper images predicted as Photographs with labels for "human", "animal", "human-structure" and "landscape"
本稿では、10,000件のクラウドソーシングによるアノテーションを用いて、Detectron2から微調整されたFaster R-CNNモデルを訓練することで、歴史的米国新聞から抽出された視覚的コンテンツのうち、見出し、写真、図版、地図、コミック、編集コマics、広告という7つのコンテンツタイプを識別する、これまでで最大の歴史的米国新聞からの視覚的コンテンツデータセット「Newspaper Navigator」を提示する。このデータセットは1630万枚のChronicling Americaページにまたがり、データセット、モデル、コードをすべて公開し、自由に再利用可能である。
The Dataset contains images derived from the Newspaper Navigator (news-navigator.labs.loc.gov/), a dataset of images drawn from the Library of Congress Chronicling America collection (chroniclingamerica.loc.gov/). [The Newspaper Navigator dataset] consists of extracted visual content for 16,358,041 historic newspaper pages in <em>Chronicling America</em>. The visual content was identified using an object detection model trained on annotations of World War 1-era Chronicling America pages, including annotations made by volunteers as part of the Beyond Words crowdsourcing project. source: https://news-navigator.labs.loc.gov/ One of these categories is 'photographs'. This dataset contains a sample of these images with additional labels indicating if the photograph has one or more of the following labels: "human", "animal", "human-structure" and "landscape" The data is organised as follows: The images themselves can be found in `images.zip` `newspaper-navigator-sample-metadata.csv` contains metadata about each image drawn from the Newspaper Navigator Dataset. `multi_label.csv` contains the labels for the images as a CSV file `annotations.csv` conains the labels for the images with additional metadata This dataset was created for use in an under-review Programming Historian tutorial (http://programminghistorian.github.io/ph-submissions/lessons/computer-vision-deep-learning-pt2) The primary aim of the data was to provide a realistic example dataset for teaching computer vision for working with digitised heritage material. The data is shared here since it may be useful for others. <strong>This data documentation is a work in progress and will be updated when the Programming Historian tutorial is released publicly. </strong> The metadata CSV file contains the following columns: - filepath<br> - pub_date<br> - page_seq_num<br> - edition_seq_num<br> - batch<br> - lccn<br> - box<br> - score<br> - ocr<br> - place_of_publication<br> - geographic_coverage<br> - name<br> - publisher<br> - url<br> - page_url<br> - month<br> - year<br> - iiif_url
研究の動機と目的
- 歴史的米国新聞における視覚的コンテンツをスケーラブルかつ自動的に発見・分析するためのツールの不足に対処すること。
- Chronicling Americaにおけるキーワード検索や手動検索の限界を克服し、南北戦争の地図や20世紀初頭のコマicsストリップといった大規模な視覚メディア研究を妨げる要因を解消すること。
- 深層学習を用いて高解像度の新聞画像から視覚的コンテンツを抽出し、意味的にラベル付けするスケーラブルなパイプラインを構築すること。
- 研究者によるデジタル・ヒューマニティーズ、教育、パブリック・ヒストリー分野での利用を想定し、公開可能で再利用可能な視覚的コンテンツデータセット(関連するテキストメタデータを含む)を構築すること。
提案手法
- Beyond Wordsのクラウドソーシング・イニシャチブから得た10,000件の検証済みバウンディングボックスアノテーションを用いて、Detectron2の事前学習済みFaster R-CNNモデルを微調整した。
- METS/ALTO OCRデータを用いて、予測された視覚的コンテンツのバウンディングボックス内に含まれるテキストコンテンツ(例:見出し、キャプション)を抽出した。
- Chronicling Americaの1630万枚の新聞ページを処理するパイプラインを設計し、訓練済みモデルを適用して7つの視覚的コンテンツクラスを検出・ラベル付けした。
- コーパス全体にわたる視覚的コンテンツの類似性ベースの照会を高速化するため、画像埋め込みを生成した。
- 訓練済みモデル、Newspaper Navigatorデータセット、およびすべてのソースコードをパブリックドメインとして公開し、自由な再利用を可能にした。
- パイプラインを適用して視覚的コンテンツと関連メタデータを抽出・整理し、探索的および分析的調査の新しい形を可能にした。
実験結果
リサーチクエスチョン
- RQ1歴史的新聞ページにおいて、写真、地図、編集コマicsといった視覚的コンテンツを、スケールに応じて自動的に検出・ラベル付けすることは可能か?
- RQ219世紀および20世紀初頭の新聞における視覚的コンテンツ認識のための、限定的でクラウドソーシングによるアノテーションで学習された深層学習モデルの性能と一般化能力はいかほどか?
- RQ3抽出された視覚的コンテンツと関連するテキストメタデータ(例:見出し、キャプション)をどのように構造化すれば、デジタル・ヒューマニティーズ研究における高度な検索および分析クエリを可能にするか?
- RQ4視覚的コンテンツの自動抽出が、南北戦争の地図や米国各地域に広がった初期のコマicsストリップの普及を研究する上で、どのような意味を持つのか?
- RQ5視覚的コンテンツ認識とOCRデータの統合により、歴史的新聞における探索的検索やテキスト再現分析の新しい形がどのように可能になるか?
主な発見
- Newspaper Navigatorデータセットには、1630万枚の歴史的米国新聞ページからの視覚的コンテンツが抽出されており、これまでに作成された中で最大のデータセットである。
- 視覚的コンテンツ認識モデルは、写真、図版、地図、コマics、編集コマics、見出し、広告の検出において高い性能を示した。バリデーションでは、例として南北戦争地図コレクションにおいても誤検出の割合が非常に小さかった。
- パイプラインは、予測されたバウンディングボックス内に含まれるMETS/ALTO OCRデータからのテキストコンテンツ(例:見出し、キャプション)を正常に抽出・リンクし、視覚的コンテンツの意味的拡張を可能にした。
- データセットには7つの異なる視覚的コンテンツクラスが含まれており、それぞれに画像埋め込みとテキストメタデータが関連付けられており、高速な類似性ベースの画像検索を可能にした。
- モデルとデータセットは、すべてのソースコードとともに公開されており、研究者、教育者、開発者が自由に再利用可能である。
- 本アプローチにより、特定の地図タイプやニュースサイクルの地理的・時間的拡散を追跡するなど、歴史的新聞における視覚メディアの大規模かつ再現可能な分析が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。