[논문 리뷰] The Newspaper Navigator Dataset: Extracting And Analyzing Visual Content from 16 Million Historic Newspaper Pages in Chronicling America
이 논문은 Chronicling America의 1,630만 개의 역사적 미국 신문 페이지에서 추출한 시각적 콘텐츠를 담은 가장 큰 공개 데이터셋인 Newspaper Navigator 데이터셋을 소개한다. Beyond Words 이니셔티브에서 제공한 1만 개의 커뮤니티 기반 레이블링을 기반으로 미세조정된 딥러닝 모델을 사용하여, 제목, 사진, 일러스트레이션, 지도, 만화, 편집 칼럼, 광고 등 7종류의 시각적 콘텐츠 유형을 추출하고 분류한다. 또한 OCR를 통해 유도된 캡션과 이미지 임베딩도 함께 제공되며, 이 모든 자료는 자유 사용이 가능한 공공 영역에 배포된다.
Chronicling America is a product of the National Digital Newspaper Program, a partnership between the Library of Congress and the National Endowment for the Humanities to digitize historic newspapers. Over 16 million pages of historic American newspapers have been digitized for Chronicling America to date, complete with high-resolution images and machine-readable METS/ALTO OCR. Of considerable interest to Chronicling America users is a semantified corpus, complete with extracted visual content and headlines. To accomplish this, we introduce a visual content recognition model trained on bounding box annotations of photographs, illustrations, maps, comics, and editorial cartoons collected as part of the Library of Congress's Beyond Words crowdsourcing initiative and augmented with additional annotations including those of headlines and advertisements. We describe our pipeline that utilizes this deep learning model to extract 7 classes of visual content: headlines, photographs, illustrations, maps, comics, editorial cartoons, and advertisements, complete with textual content such as captions derived from the METS/ALTO OCR, as well as image embeddings for fast image similarity querying. We report the results of running the pipeline on 16.3 million pages from the Chronicling America corpus and describe the resulting Newspaper Navigator dataset, the largest dataset of extracted visual content from historic newspapers ever produced. The Newspaper Navigator dataset, finetuned visual content recognition model, and all source code are placed in the public domain for unrestricted re-use.
연구 동기 및 목표
- 현재 연구자들이 关건어나 수작업 검색에 국한되어 있어, 역사적 신문에서 시각적 콘텐츠에 대한 확장 가능하고 구조화된 접근 방식이 부족한 문제를 해결하기 위해.
- Chronicling America의 1,630만 개의 디지털화된 신문 페이지에서 유의미한 의미 정보를 포함한 대규모 시각적 콘텐츠 데이터셋을 구축하기 위해.
- 제목, 이미지, 광고를 추출하고 관련 텍스트 메타데이터를 정리함으로써 디지털 인문학 연구의 새로운 형태를 가능하게 하기 위해.
- 공개된 시각적 콘텐츠 인식 모델과 모든 소스 코드를 공공 영역에 배포함으로써 대중 참여와 학술적 탐구를 지원하기 위해.
- 커뮤니티 기반 레이블링과 딥러닝을 융합하여 신문 아카이브와 같은 문화유산 응용 분야에서의 잠재력을 입증하기 위해.
제안 방법
- Beyond Words 커뮤니티 기반 레이블링 이니셔티브에서 확보한 1만 개의 검증된 바운딩 박스 레이블을 기반으로, 사진, 일러스트레이션, 지도, 만화, 편집 칼럼, 제목, 광고를 포함한 다양한 시각적 콘텐츠 유형에 대해 딥러닝 객체 검출 모델을 훈련시켰다.
- 레이블링 파이프라인을 확장하여 OCR 보정 및 캡션 전사 작업을 통합함으로써, 시각적 콘텐츠 인식을 위한 고품질 훈련 데이터셋을 구축하였다.
- 미세조정된 모델을 사용해 1,630만 개의 Chronicling America 신문 페이지에 대해 7종류의 시각적 콘텐츠 유형을 추출하고 분류하였다.
- 각 바운딩 박스 내부의 METS/ALTO OCR에서 텍스트 콘텐츠를 추출하고, 유사도 검색 및 검색 속도 향상을 위한 이미지 임베딩을 생성하였다.
- 전체 코퍼스를 처리할 수 있는 확장 가능한 추론 파이프라인을 설계하였으며, 출판 연도 및 지역별 필터링을 지원함으로써 모델의 일반화 능력을 향상시켰다.
- 훈련된 모델, 데이터셋, 모든 소스 코드를 공공 영역에 배포하여 자유 사용 및 향후 개발을 가능하게 하였다.
실험 결과
연구 질문
- RQ1커뮤니티 기반 레이블링을 기반으로 훈련된 딥러닝 모델이 역사적 신문의 다양한 시각적 콘텐츠 유형을 정확하게 추출하고 분류할 수 있는가?
- RQ2대규모 신문 아카이브에서 OCR 및 이미지 데이터로부터 체계적으로 메타데이터를 추출할 수 있는 방법은 무엇인가? 예를 들어 캡션과 이미지 임베딩 같은 구조화된 메타데이터를 말한다.
- RQ3훈련 데이터의 다양성이, 특히 시각적 콘텐츠가 제한적인 20세기 전반의 신문에 대해 모델의 일반화 능력에 어떤 영향을 미치는가?
- RQ4역사적 신문에서 추출한 공개적이고 개방형 시각적 콘텐츠 데이터셋이 디지털 인문학 및 대중 역사 연구의 새로운 형태를 가능하게 할 정도로 가치가 있는가?
- RQ5자동화된 시각적 콘텐츠 추출 기술이 키워드 기반 방법을 초월해 역사적 신문의 탐색적 검색과 접근 방식을 어떻게 향상시킬 수 있는가?
주요 결과
- Newspaper Navigator 데이터셋은 1789년부터 1963년까지 미국 47개 주, 워싱턴 D.C., 푸에르토리코를 포함한 1,630만 개의 신문 페이지를 포함하며, 포괄적인 시각적 콘텐츠 추출을 수행하였다.
- 이 데이터셋은 제목, 사진, 일러스트레이션, 지도, 만화, 편집 칼럼, 광고 등 7종류의 시각적 콘텐츠 유형을 포함하며, 각각 OCR에서 유도된 캡션과 이미지 임베딩이 함께 제공된다.
- 시각적 콘텐츠 인식 모델는 Beyond Words 훈련 세트에서 높은 정확도를 기록했으며, 전체 1,630만 페이지의 코퍼스 처리에 성공적으로 확장되었다.
- 이 데이터셋은 지역 간 뉴스 사이클 가시성의 차이, 사진 복제 패턴, 특정 시각적 콘텐츠 유형의 지리적 확산 등을 연구하는 데 새로운 형태의 연구를 가능하게 하였다.
- 모델과 데이터셋은 제한 없이 공개되어 디지털 인문학, 교육, 대중 역사, 창의적 컴퓨팅 등 다양한 분야에서의 재사용을 지원한다.
- 미래의 향상은 코퍼스의 10.4%를 차지하는 1875년 이전 페이지에 대해 미세조정을 통해 가능하며, 또한 Beyond Words 프로젝트에서 확보한 1만 개의 검증된 OCR 보정 데이터를 활용해 OCR 보정 모델을 훈련시킬 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.