Skip to main content
QUICK REVIEW

[논문 리뷰] An Annotated Dataset of Coreference in English Literature

David Bamman, Olivia Lewke|arXiv (Cornell University)|2019. 12. 03.
Topic Modeling참고 문헌 47인용 수 13
한 줄 요약

이 논문은 100편의 영문 문학 작품에서 유래한 210,532개의 토큰을 포함하는 새로운 공명성 주석 데이터셋인 LitBank을 소개한다. 이 데이터셋은 평균 2,105단어에 이르는 장문의 문서와 복잡한 공명성 현상을 특징으로 한다. 도메인 내 문학 데이터로 훈련할 경우 OntoNotes 대비 F-스코어가 6점 향상되며, PreCo와 유사한 성능을 기록함에도 불구하고 데이터 양이 두 개의 지수 차수만큼 적다.

ABSTRACT

We present in this work a new dataset of coreference annotations for works of literature in English, covering 29,103 mentions in 210,532 tokens from 100 works of fiction. This dataset differs from previous coreference datasets in containing documents whose average length (2,105.3 words) is four times longer than other benchmark datasets (463.7 for OntoNotes), and contains examples of difficult coreference problems common in literature. This dataset allows for an evaluation of cross-domain performance for the task of coreference resolution, and analysis into the characteristics of long-distance within-document coreference.

연구 동기 및 목표

  • 표준 벤치마크와 상당히 다름에도 불구하고 영문 문학 분야에서 공명성 행동이 뚜렷이 다른 데에 기인한 강력한 공명성 주석 자원의 부족을 해결하기 위해.
  • 장문의 문학적 텍스트에서 공명성 해석 시스템의 평가를 가능하게 하여, 장거리 후행어 및 서사적 인지론적 구조와 같은 고유한 과제를 다루기 위함.
  • 엔티티의 급격한 출현 빈도, 전행어 거리 분포, 언급 유형 행동 등 문학 내 공명성 패턴을 분석하기 위함.
  • 신경망 공명성 모델의 문학적 맥락에서 도메인 내 및 도메인 외 훈련 데이터의 효과성을 평가하기 위함.
  • 문학적 연구를 위한 계산 기반 지원을 위해 캐릭터 및 엔티티 분석을 위한 신뢰할 수 있는 공명성 주석 제공하기 위함.

제안 방법

  • ACE 카테고리(사람, 장소, 조직, 시설, 지정학적 엔티티, 차량 등)에 따라 LitBank의 100편의 문학 작품을 공명성 관계로 주석 처리함.
  • BERT의 문맥적 임bedding을 활용한 계층적 BiLSTM-CRF 모델을 사용해 원시 텍스트에서 언급 경계를 예측함. 언급 탐지에서 89.1 F-스코어 달성.
  • LitBank, OntoNotes, PreCo의 주석 데이터를 기반으로 신경망 공명성 해석 시스템을 훈련하여 도메인 간 성능 비교 수행.
  • 십중교차검증을 실시하여 실제 조건에서 예측된 언급을 기반으로 언급 식별 및 공명성 해석 성능 평가.
  • 전행어 거리 분포와 엔티티 활동 패턴을 측정하여 문학에서의 장거리 논의 현상 특성 분석.
  • 표준 공명성 평가 지표인 B3, MUC, CEAF φ4 및 평균 F-스코어를 사용해 모델 성능 평가.

실험 결과

연구 질문

  • RQ1OntoNotes와 같은 도메인 외 벤치마크 대비 도메인 내 문학 데이터로 훈련했을 때 공명성 해석 성능는 어떻게 변화하는가?
  • RQ2장문의 문학적 텍스트에서 전행어 거리 분포와 엔티티 활동 스펙트럼의 분포적 특성은 무엇인가?
  • RQ3예를 들어 대명사, 고유명사 등 다양한 언급 유형은 전행어 근접성과 해석 난이도 측면에서 어떻게 행동하는가?
  • RQ4도메인 차이가 있음에도 불구하고 PreCo와 같은 대규모 도메인 외 데이터셋이 문학적 공명성에 효과적으로 일반화될 수 있는가?
  • RQ5언급 경계 예측 정확도가 문학적 텍스트에서 하류 공명성 해석 성능에 미치는 영향은 어느 정도인가?

주요 결과

  • 도메인 내 문학 데이터(LitBank)로 훈련할 경우 F-스코어 68.1을 기록하며, OntoNotes로 훈련했을 때의 62.9보다 6점 향상되어 도메인 특화 데이터의 가치를 입증함.
  • PreCo의 데이터 크기가 두 개의 지수 차수만큼 더 크지만, LitBank에서의 성능은 PreCo(67.6 F-스코어)와 유사하여 대규모 도메인 외 데이터의 강력한 일반화 능력을 시사함.
  • 대명사는 95%의 확률로 전행어와 9개 이내의 언급 거리 내에서 연결되며, 문학적 논의에서 높은 국소적 일관성을 나타냄.
  • 문학 텍스트의 엔티티는 이중분포 활동 패tern을 보이며, 매우 짧거나 매우 긴 스펙트럼에서 활동함을 나타내어 급격한 출현과 장기 지속성을 동시에 반영함.
  • BERT를 강화한 BiLSTM-CRF를 사용한 언급 식별에서 89.1 F-스코어 달성. 엔티티 유형 또는 품사 예측 시 성능 저하가 거의 없음.
  • 데이터셋은 장문의 문학 작품이 철학적 및 인지론적 정체성 및 지식의 변화를 포함하는 복잡한 공명성 패턴을 포함하고 있음을 드러내며, 기존 공명성 시스템이 도전받을 수 있음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.