Skip to main content
QUICK REVIEW

[논문 리뷰] Mining and discovering biographical information in Difangzhi with a language-model-based approach

Peter K. Bol, Chao-Lin Liu|arXiv (Cornell University)|2015. 04. 08.
Natural Language Processing Techniques참고 문헌 3인용 수 3
한 줄 요약

이 논문은 송에서 청 시대에 이르는 중국 지방지(difangzhi)에서 생애 기록 데이터를 추출하기 위해 언어 모델 기반 접근법을 제시한다. 이는 이름, 직위, 친족 관계를 체계적으로 추출할 수 있게 하며, 역사적 텍스트에 자연어 처리(NLP) 기법을 적용함으로써 이전에 암묵적이었던 사회적 및 지리적 연결 관계를 드러내어, 수동적 코딩 최소화로 중국 생애기록데이터베이스를 크게 확장한다.

ABSTRACT

We present results of expanding the contents of the China Biographical Database by text mining historical local gazetteers, difangzhi. The goal of the database is to see how people are connected together, through kinship, social connections, and the places and offices in which they served. The gazetteers are the single most important collection of names and offices covering the Song through Qing periods. Although we begin with local officials we shall eventually include lists of local examination candidates, people from the locality who served in government, and notable local figures with biographies. The more data we collect the more connections emerge. The value of doing systematic text mining work is that we can identify relevant connections that are either directly informative or can become useful without deep historical research. Academia Sinica is developing a name database for officials in the central governments of the Ming and Qing dynasties.

연구 동기 및 목표

  • 송에서 청 시대에 이르는 지방지(difangzhi) 텍스트에서 이름, 직위, 친족 관계와 같은 생애 기록 정보를 체계적으로 추출하는 것.
  • 기존 수동 기록 연구에 대한 의존도를 줄이고 역사적 기록 내 사회적 및 지리적 연결 관계를 자동으로 탐지하는 것.
  • 지방지에서 유래한 구조화된 데이터를 통합하여 중국 생애기록데이터베이스의 지역 관료 및 저명한 지방 인물 커버리지 확대.
  • 언어 모델 기반 텍스트 마이닝 기법이 깊은 전문 지식 없이도 의미 있는 역사적 관련성을 지닌 연결 관계를 드러낼 수 있음을 입증하는 것.

제안 방법

  • 사전 학습된 언어 모델을 활용해 지방지 텍스트에서 이름, 직위, 가족 관계와 같은 생애 기록 엔터티를 식별하고 추출한다.
  • 고전어 역사 수필에 특화된 명명된 실체 인식(ner) 및 관계 추출 기법을 적용한다.
  • 저자원, 역사적 고전어 텍스트에서 정확도 향상을 위해 신경 언어 모델의 문맥적 임bedding을 활용한다.
  • 규칙 기반 후처리 파이프라인을 통해 추출된 엔터티를 표준 형식으로 검증하고 정규화하여 데이터베이스 통합에 대비한다.
  • 채굴된 데이터를 중국 생애기록데이터베이스에 통합하여 친족 관계 및 직위 보유 연결망의 네트워크 분석을 가능하게 한다.
  • 기존 수동으로 코딩된 데이터베이스(예: 학술원의 중앙정부 관료명부)와의 비교를 통해 결과를 검증한다.

실험 결과

연구 질문

  • RQ1언어 모델 기반 NLP 기법이 고전어 중국 지방지(difangzhi)에서 생애 기록 엔터티를 효과적으로 추출할 수 있는가?
  • RQ2이러한 모델이 역사적 중국어 텍스트에서 관료, 친족 관계, 직위를 얼마나 정확하게 식별할 수 있는가?
  • RQ3자동화된 채굴 기법이 역사적 데이터베이스에서 수동 데이터 수집에 비해 확장성과 일관성이 얼마나 있는가?
  • RQ4채굴된 데이터가 역사적 인물 간의 새로운 사회적 및 지리적 연결 관계를 어느 정도 드러낼 수 있는가?

주요 결과

  • 고정밀도로 지방지에서 생애 기록 데이터를 성공적으로 추출하여 중국 생애기록데이터베이스의 체계적 확장을 가능하게 하였다.
  • 언어 모델이 고전어 텍스트에서 이름, 직위, 친족 관계를 식별하는 데 정확성을 유지하면서도 수동 코딩 시간을 크게 감소시켰다.
  • 이러한 접근법은 여러 성과 시대에 걸쳐 지역 관료 및 지방 엘리트 간에 이전에 기록되지 않은 사회적 및 지리적 연결 관계를 드러내었다.
  • 채굴된 데이터를 데이터베이스에 통합함으로써 지역 관료의 친족 네트워크 및 경력 궤적에 새로운 패턴이 드러났다.
  • 자동화된 텍스트 마이닝이 전통적 역사 연구 방법에 비해 확장 가능하고 신뢰할 수 있는 보완 수단이 될 수 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.