[논문 리뷰] 19th Century United States Newspaper images predicted as Photographs with labels for "human", "animal", "human-structure" and "landscape"
이 논문은 1630만 개의 역사적 미국 신문 페이지에서 10,000개의 커뮤니티 기반 레이블링 결과를 기반으로 보정된 Faster R-CNN 모델을 훈련시켜, 헤드라인, 사진, 일러스트레이션, 지도, 만화, 편집 칼럼, 광고 등 7종류의 시각적 콘텐츠 유형을 식별한 Newspaper Navigator 데이터셋을 제시한다. 이는 역사적 미국 신문에서 추출된 가장 큰 시각적 콘텐츠 데이터셋이며, 데이터셋, 모델, 소스 코드를 모두 공개하여 자유로운 재사용을 가능하게 한다.
The Dataset contains images derived from the Newspaper Navigator (news-navigator.labs.loc.gov/), a dataset of images drawn from the Library of Congress Chronicling America collection (chroniclingamerica.loc.gov/). [The Newspaper Navigator dataset] consists of extracted visual content for 16,358,041 historic newspaper pages in <em>Chronicling America</em>. The visual content was identified using an object detection model trained on annotations of World War 1-era Chronicling America pages, including annotations made by volunteers as part of the Beyond Words crowdsourcing project. source: https://news-navigator.labs.loc.gov/ One of these categories is 'photographs'. This dataset contains a sample of these images with additional labels indicating if the photograph has one or more of the following labels: "human", "animal", "human-structure" and "landscape" The data is organised as follows: The images themselves can be found in `images.zip` `newspaper-navigator-sample-metadata.csv` contains metadata about each image drawn from the Newspaper Navigator Dataset. `multi_label.csv` contains the labels for the images as a CSV file `annotations.csv` conains the labels for the images with additional metadata This dataset was created for use in an under-review Programming Historian tutorial (http://programminghistorian.github.io/ph-submissions/lessons/computer-vision-deep-learning-pt2) The primary aim of the data was to provide a realistic example dataset for teaching computer vision for working with digitised heritage material. The data is shared here since it may be useful for others. <strong>This data documentation is a work in progress and will be updated when the Programming Historian tutorial is released publicly. </strong> The metadata CSV file contains the following columns: - filepath<br> - pub_date<br> - page_seq_num<br> - edition_seq_num<br> - batch<br> - lccn<br> - box<br> - score<br> - ocr<br> - place_of_publication<br> - geographic_coverage<br> - name<br> - publisher<br> - url<br> - page_url<br> - month<br> - year<br> - iiif_url
연구 동기 및 목표
- 역사적 미국 신문의 시각적 콘텐츠를 탐색하고 분석하기 위한 스케일러블하고 자동화된 도구의 부족을 해결하기 위해.
- Chronicling America에서의 关련 키워드나 수작업 검색의 한계를 극복하여, 빈민전 지도나 20세기 초 만화 스트립과 같은 대규모 시각 미디어 연구를 가능하게 하기 위해.
- 딥 러닝을 활용해 고해상도 신문 이미지에서 시각적 콘텐츠를 추출하고 의미론적으로 레이블링하는 스케일러블한 파이프라인을 구축하기 위해.
- 디지털 인문학, 교육, 공공 역사 분야의 연구자들이 사용할 수 있도록 공개된 재사용 가능한 시각적 콘텐츠 데이터셋과 관련 텍스트 메타데이터를 만들기 위해.
제안 방법
- Beyond Words 커뮤니티 기반 레이블링 프로젝트에서 확보한 10,000개의 검증된 바운딩 박스 레이블을 기반으로 Detectron2에서 제공하는 사전 훈련된 Faster R-CNN 모델을 보정했다.
- METS/ALTO OCR 데이터를 활용해 예측된 시각적 콘텐츠 바운딩 박스 내부에 포함된 텍스트 콘텐츠(예: 헤드라인, 캡션)를 추출했다.
- Chronicling America에서 1,630만 개의 신문 페이지를 처리하기 위한 파이프라인을 설계하여, 훈련된 모델을 적용해 7종류의 시각적 콘텐츠 유형을 탐지하고 레이블링했다.
- 논문 전체 코퍼스 내에서 시각적 콘텐츠 간 유사도 기반 검색을 빠르게 수행하기 위해 이미지 임베딩을 생성했다.
- 훈련된 모델, Newspaper Navigator 데이터셋, 모든 소스 코드를 공개 영역에 배포하여 자유로운 재사용을 보장했다.
- 파이프라인을 적용해 시각적 콘텐츠와 관련 메타데이터를 추출하고 정리하여, 새로운 형태의 탐색적 및 분석적 연구를 가능하게 했다.
실험 결과
연구 질문
- RQ1역사적 신문 페이지에서 사진, 지도, 편집 칼럼 등의 시각적 콘텐츠를 대규모로 자동으로 탐지하고 레이블링할 수 있는 방법은 무엇인가?
- RQ219세기와 20세기 초의 신문에서 시각적 콘텐츠 인식을 위해 제한된 커뮤니티 기반 레이블링 데이터로 훈련된 딥 러닝 모델의 성능과 일반화 능력은 어떠한가?
- RQ3추출된 시각적 콘텐츠와 관련 텍스트 메타데이터(예: 헤드라인, 캡션)를 어떻게 정렬하면 디지털 인문학 연구에서 고도의 검색 및 분석 쿼리를 지원할 수 있는가?
- RQ4시각적 콘텐츠 자동 추출 기술이 빈민전 지도나 미국 전역에서의 초기 만화 스트립 확산을 연구하는 데 미치는 영향은 무엇인가?
- RQ5시각적 콘텐츠 인식과 OCR 데이터의 통합이 역사적 신문에서 새로운 형태의 탐색적 검색 및 텍스트 복제 분석을 가능하게 하는가?
주요 결과
- Newspaper Navigator 데이터셋은 1,630만 건의 역사적 미국 신문 페이지에서 추출한 시각적 콘텐츠를 포함하고 있으며, 지금까지 제작된 가장 큰 시각적 콘텐츠 데이터셋이다.
- 모델은 사진, 일러스트레이션, 지도, 만화, 편집 칼럼, 헤드라인, 광고를 높은 정확도로 탐지했으며, 검증 과정에서 오직 소수의 오진 예측(예: 빈민전 지도 컬렉션에서의 오진)만 관찰되었다.
- 파이프라인은 예측된 바운딩 박스 내부에 포함된 텍스트 콘텐츠(예: 헤드라인, 캡션)를 성공적으로 추출하고 연결하여 시각적 콘텐츠의 의미론적 풍부함을 높였다.
- 데이터셋은 7종류의 시각적 콘텐츠 유형을 포함하며, 각각 이미지 임베딩과 텍스트 메타데이터를 함께 제공하여 유사도 기반의 신속한 이미지 검색을 가능하게 한다.
- 모델과 데이터셋은 소스 코드와 함께 공개되어 연구자, 교육자, 개발자가 자유롭게 재사용할 수 있도록 했다.
- 이러한 접근법은 특정 지도 유형의 지리적·시기적 확산이나 뉴스 사이클을 추적하는 등 역사적 신문의 시각 미디어에 대한 대규모이고 재현 가능한 분석을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.