[논문 리뷰] German Parliamentary Corpus (GerParCor)
이 논문은 오스트리아, 독일, 리히텐슈타인, 스위스의 독일어 의회 전원 회의 기록을 포함하는 대규모로, 장르에 특화된 독일어 의회 기록인 GerParCor를 소개한다. 이 기록은 세 개의 세기 동안 이어지며, Fraktur 및 스캔된 텍스트를 위해 OCR(Tesseract)를 활용하고, NLP 전처리를 위해 spaCy3를 사용한다(토큰화, 품사 태깅, NER, 의존성 파싱). 모든 데이터는 시간 분석이 가능한 정치적 의사소통 및 NLP 연구를 위해 UIMA XMI 형식으로 완전히 주석 처리되어 공개된다.
Parliamentary debates represent a large and partly unexploited treasure trove of publicly accessible texts. In the German-speaking area, there is a certain deficit of uniformly accessible and annotated corpora covering all German-speaking parliaments at the national and federal level. To address this gap, we introduce the German Parliament Corpus (GerParCor). GerParCor is a genre-specific corpus of (predominantly historical) German-language parliamentary protocols from three centuries and four countries, including state and federal level data. In addition, GerParCor contains conversions of scanned protocols and, in particular, of protocols in Fraktur converted via an OCR process based on Tesseract. All protocols were preprocessed by means of the NLP pipeline of spaCy3 and automatically annotated with metadata regarding their session date. GerParCor is made available in the XMI format of the UIMA project. In this way, GerParCor can be used as a large corpus of historical texts in the field of political communication for various tasks in NLP.
연구 동기 및 목표
- 독일어권 국가의 국가 및 연방 차원에서 통일된 접근이 가능한 주석 처리된 의회 기록 집합의 부족을 해결하기 위해.
- 다양한 국가와 시기 동안의 독일어 의회 전원 회의 기록을 포괄하고 역사적으로 풍부한 기록 집합을 구축하기 위해.
- 표준화된 기계로 읽을 수 있고 시간 주석 처리가 된 의회 텍스트를 통해 대규모 NLP 및 정치의사소통 연구를 가능하게 하기 위해.
- 역사적으로 중요한, 종종 스캔되거나 Fraktur 형식으로 된 의회 기록을 구조화되고 주석 처리된 디지털 형태로 변환 및 처리하기 위해.
- 재현 가능성과 확장성을 위해 GitHub를 통해 기록 집합과 처리 파이프라인을 공개하기 위해.
제안 방법
- 가능한 경우 개별 API 또는 웹 스크래핑을 통해 독일, 오스트리아, 스위스, 리히텐슈타인의 국가 및 연방 의회로부터 의회 전원 회의 기록을 확보하였다.
- 스캔되거나 Fraktur 형식의 기록을 기계로 읽을 수 있는 텍스트로 변환하기 위해 Tesseract를 사용한 OCR을 적용하였다.
- 모든 텍스트를 spaCy3 파이프라인으로 처리하여 토큰화, 문장 경계 검출, 품사 태깅, 어간 추출, NER, 형태 분석, 의존성 파싱을 수행하였다.
- 세션 날짜, 위치, 제목, 문서 ID와 같은 메타데이터를 각 문서에 UIMA XMI 형식으로 추출하고 통합하였다.
- NLP 도구 및 데이터베이스와의 통합을 지원하기 위해 UIMA XMI 형식을 사용하여 기록 집합을 저장하고 구조화하였다.
- 공개 접근성과 확장성을 위해 전체 기록 집합과 처리 소프트웨어를 GitHub에 배포하였다.
실험 결과
연구 질문
- RQ1이질적이고 종종 스캔되거나 고전적인 형식의 자료에서 어떻게 체계적으로 다국어 및 역사적으로 광범위한 의회 기록 집합을 구축할 수 있는가?
- RQ2역사적 독일어 의회 텍스트(특히 Fraktur 및 저품질 스캔)에 대해 OCR 및 NLP 파이프라인을 얼마나 효과적으로 적용할 수 있는가?
- RQ3통합된 표준화된 시간 주석 처리 기록 집합이 다국적 및 시간적 범위를 초월한 비교 정치의사소통 및 NLP 연구를 지원할 수 있는가?
- RQ4일관된 주석 처리를 위해 다수의 의회, 언어, 역사적 시기를 포함하는 기록 집합을 구축할 때 발생하는 기술적 및 방법론적 과제는 무엇인가?
- RQ5어떻게 이러한 기록 집합을 다양한 NLP 도구 및 연구 플랫폼 간 상호운용성과 재사용 가능성을 확보할 수 있는가?
주요 결과
- GerParCor는 4개의 독일어권 국가에서 세 개의 세기 동안의 정치적 논의를 다루는 대규모로, 다국어이며 역사적으로 광범위한 독일어 의회 전원 회의 기록 집합을 포함한다.
- 기록 집합은 디지털화된 텍스트와 OCR 처리된 텍스트를 모두 포함하며, 상당 부분이 Tesseract 기반 OCR을 통해 성공적으로 변환된 스캔된 Fraktur 문서에서 유래하였다.
- 모든 문서는 토큰화, 품사 태깅, 어간 추출, NER, 형태 분석, 의존성 파싱을 포함한 포괄적인 언어 주석 처리를 spaCy3를 통해 강화하였다.
- 세션 날짜, 문서 제목, 위치와 같은 메타데이터는 자동으로 추출되어 XMI 형식에 통합되어 시간 기반 및 맥락 기반 분석이 가능하게 하였다.
- 기록 집합은 표준화된 UIMA XMI 형식으로 제공되어 주요 NLP 및 텍스트 분석 프레임워크와의 상호운용성을 보장한다.
- 전체 기록 집합과 처리 파이프라인이 GitHub에 호스팅되어 있어 공개 접근, 재현 가능성, 향후 추가 의회 문서로의 확장이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.